时间:2026年7月17日
地点:中国上海(WAIC 2026)
人物:百川智能、清华大学研究团队
事件详情:2026 世界人工智能大会(WAIC 2026)期间,百川智能首次展出 Baichuan-M4 医疗增强大模型在肿瘤、儿科等专科场景中的落地成果:与国家癌症中心、中国医学科学院肿瘤医院联合共建的肿瘤专科 AI,以及与国家儿童医学中心、北京儿童医院联合共建的 AI 儿科医生,均已在真实临床场景中开展验证。Baichuan-M4 由百川智能与清华大学研究团队联合打造,公开评测显示其在 OpenAI 提出的权威医疗评测 HealthBench 上综合得分 68.6,位列世界第一,领先第二名 GPT-5.5 超过 10 分;在 Hard 子集上领先达 15.9 分;事实性幻觉率降至 3.3%,为全行业最低。
背景:Baichuan-M4 是百川智能于 2026 年 6 月正式发布的新一代医疗增强大模型,相比上一代 M3 实现三大核心进化:交互模式变革——具备"真人医生"式主动追问能力,能模拟医生诊疗逻辑进行连续问诊;全病程记忆——支持跨越数年的临床记忆整合,长上下文性能显著提升;证据锚定技术——医学结论能精确对应权威医学论文或临床指南的具体段落,循证引用精度高达 90.0。在 WAIC 2026 之前,M4 已在 HealthBench 主榜单及 Hard、Professional 三个子榜单上同时位列世界第一。
影响:
- 幻觉率 3.3% 是医疗大模型的"安全红线",M4 在三份权威子榜单上同时世界第一,直接奠定国产医疗 AI 在国际学术界的领先地位
- 与国家癌症中心、北京儿童医院的真实临床验证,是国产医疗大模型首次进入"三甲医院在用"级别,加速 AI 辅助诊断的合规化进程
- "主动追问 + 全病程记忆"打破传统医疗 AI 的单轮对话模式,是 AI 辅助诊疗从"工具"走向"同事"的关键一步
- 对 OpenAI、Anthropic、DeepSeek 等通用大模型公司在医疗垂直领域构成实质性挑战,加速医疗 AI 国产化进程
总结:医疗是 AI 最难、也最值得攻克的垂直领域——它要求 0 幻觉、可解释、可追溯。Baichuan-M4 在 HealthBench 上对 GPT-5.5 形成 10 分以上的代差,不仅证明国产垂直大模型已经走通"高门槛 + 严标准"路线,更让 AI 辅助诊疗在临床落地上有了可量化的安全保证。当一台 AI 系统能在三甲医院帮医生做诊断辅助时,AI 与医疗的关系不再是"颠覆"而是"补位"。
参考来源:
- https://so.html5.qq.com/page/real/search_news?docid=70000021_2126a5a303c62352
- https://so.html5.qq.com/page/real/search_news?docid=70000021_8066a59ff1c19352
- https://www.ithome.com/tags/%e5%8c%bb%e7%96%97%e6%a8%a1%e5%9e%8b/
- https://new.qq.com/rain/a/20260622A0BRG000
- https://blog.csdn.net/m0_73135814









