

为人类造医生、为生命建模型。
作者|田思奇
编辑|栗子
7月17日,WAIC 2026开幕。上海世博展览馆聚集1100多家企业、3000多件展品,规模创下九届以来新高。人形机器人、四足机器人、载人机甲等具身智能产品集中亮相,AI以更具体、更接近现实世界的方式进入公众视野。
但在展馆里走一圈,真正值得关注的变化不只在“AI能不能动起来”。模型能不能进入一个行业,接住真实用户,沿着复杂流程持续工作,也是这场竞争中的重要命题。
今年WAIC的一个清晰信号是:AI正从“能聊”走向“能干”。对大模型公司来说,榜单成绩给出的是起点,真正拉开差距的,是模型能不能离开发布会,进入一个行业最难的部分。
更直接一点,当模型已经能拿下榜单第一,下一场考试究竟在哪里?
百川给出的答案是:M4 已经不只在榜单上,它还被放进了AI家庭医生产品,并继续进入肿瘤和儿科专科现场。
为人类造AI医生,百川正在把这件事变成现实。
1.AI医疗的价值,不在对话框里
让AI帮你做PPT、总结会议、写代码,核心工作仍由人完成。这样的AI进入的是工作外围,解决的是一个个被明确提出的任务。
但医疗不一样。患者不会按标准格式描述症状,医生也不可能只回答一句话就结束服务。AI要处理遗漏、追问、检索、判断和后续跟进,真正进入的是一段连续流程。
探访今年WAIC百川智能展位,『甲子光年』看到的是三组不同层次的现场证据:面向家庭的百小医、与国家癌症中心共建的肿瘤专科能力,以及与北京儿童医院联合验证的儿科能力。

时至今日,市面上能回答健康问题的 AI 产品很多,豆包、千问、元宝等都能完成问答。但“答对一道题”和“接住一段医疗服务”之间,隔着的不只是一个聊天窗口,还有对真实信息的补齐、对医学证据的调用,以及对后续节点的持续跟进。
王小川对「甲子光年」说:“百川的目的是让大模型真正进入诊前、诊中、诊后的医疗服务流程,进入家庭、医院和更广泛的健康服务场景。”
但这个目标实现起来并不容易。
牛津大学发表于《Nature Medicine》的研究给过一个数字:AI 读取标准化病历时准确率为 94.9%,真实患者自助使用时降至 34.5%。
差距不只来自知识量。因为真实患者的表达往往遗漏、混乱、断续,标准化病历里没有这些噪声。医疗服务需要 AI 主动补齐信息,而不是等用户把问题问完整。
AI面对的不是一次性问答。症状出现、就医准备、报告解读、医嘱执行和后续随访,通常分散在不同时间、不同入口里。它离用户最近,需求也最高频,最能检验 AI 能不能接住一段连续服务。
而M4 的处理方式是主动追问症状、病史和相关检查情况,形成下一步判断所需的信息框架,再用超长记忆承接多次交流。它把“用户问一句、模型答一句”的关系,往前推进了一步。
这也是AI家庭医生产品和普通聊天机器人的分界线:前者要接住问题后面会发生什么。
2.M4三项第一之后,真正难的是把能力用起来
据「甲子光年」了解,Baichuan-M4在HealthBench、HealthBench Hard、HealthBench Professional三项医疗评测中均位列第一。综合得分68.6,领先第二名GPT-5.5超过10分;事实性幻觉率3.3%,在该组对比模型中最低。同口径下,GPT-5.5为3.8%、Claude Opus 4.7为6.9%、DeepSeek-V4-Pro为9.8%。

这个分数证明,M4的基础模型能力已经站在前列。但高分不会自动变成AI家庭医生,也不会自动变成专科能力。中间还隔着产品组织、医学证据和真实场景。
事实上,要想让AI真正进入医疗场景,需要多方能力配合。低幻觉解决的是“少错”,循证解决的是“有据可查”,主动追问和长程记忆解决的是“能不能把服务接下去”。
百川把这些能力都放进了 M4。
具体来说,针对医疗场景中的事实性错误,百川通过事实性感知强化学习算法,最大限度减少幻觉。
循证能力直接对应医疗服务的专业门槛:权威指南被拆解为1000余条原子化临床路径,每条由临床专家定义和校验,让模型回答有路径可循、有证据可查。
而连续服务还需要主动追问和长程记忆。M4根据当前信息追问症状、病史和检查情况,并承接从首诊到多次复诊的交流;Harness组织追问、检索和专科能力调用。
这些能力如果只停留在技术描述里,仍然只是模型材料。百小医和后面的专科项目,让它们接受了真实场景的检验。
M4的模型分数是硬证据,证明百川站在AI医疗前列;AI家庭医生产品和专科验证,则开始回答一个更难的问题:这套能力能不能被真正用起来。
Tether进军AI医疗时,在OpenAI、Ubiquant AI和百川的方案中选定M3作为教师模型,并评价为“代际差异”。M4是M3之后的新一代旗舰。
3.AI家庭医生和专科临床,百川都在逐步进入
百小医是 M4 面向家庭健康的产品化落地。
它的定位就是AI家庭医生,通过APP和微信BOT,把模型放进症状梳理、就医准备、报告解读、医嘱执行和家庭日常健康管理。
APP覆盖症状梳理、就医准备、报告解读和医嘱执行等就医环节;微信BOT面向家庭日常,支持进入家庭群,提供用药提醒、复查节点和随访咨询。
现场演示从一个具体场景开始:深夜脚趾剧痛惊醒,打开百小医,经过10轮追问排除运动损伤,锁定急性痛风方向,并建议挂风湿免疫科。问诊卡同时生成给患者和医生的两份材料;到院确诊后,系统再逐条拆解处方,结合生活习惯给出执行建议。百小医把一次突发症状接进后续就医服务,AI家庭医生不再只是回答当下的问题。
王小川说:“AI家庭医生应该在你最常打开的地方等着你。微信是中国人的数字生活底座,AI就该在那里。”
AI家庭医生解决的是日常健康服务,专科现场面对的则是更复杂的病例、更严格的证据要求和更高的临床门槛。
M4在肿瘤和儿科的验证,回答的是模型能力能不能进入真实专科。
肿瘤场景首先考验循证和推理。
百川与国家癌症中心、中国医学科学院肿瘤医院联合共建,将M4用于病历解构、多源循证检索和按证据等级排序的方案对比。院内验证显示,与MDT专家意见一致率在指南内方案中为100%,在指南外复杂病例中为94%。

儿科面对的是另一类难题。
中国儿童专用药占比不足2%,53%的门诊处方涉及超说明书用药,模型既要理解知识,也要处理复杂的用药安全边界。
融合北京儿童医院知识库后,M4综合安全合规率为92%,对照其他AI工具为63%。在60个真实病例的内部对照中,M4 的诊断结果与标准答案符合率为91.7%,同场12位主治医师和住院医师平均值为77.12%,与北儿专家诊断符合率为95%。
北京儿童医院院长倪鑫提出,希望和百川一起打造100万个AI儿科医生。
单个病例的准确不是终点。真实机构里的持续验证,才会把一次展示变成可复用的专科能力。
4.让通用模型长出专科能力,百川的下一张牌
王小川将医疗称为“通用大模型皇冠上的明珠”。因为医疗不仅要求事实可靠、证据可追溯、能够主动补齐信息,还要承接长期服务。
对通用底座而言,这里既是高门槛,也是检验能力成色的地方。
医疗面对的不是一组标准题,而是专业知识、复杂语境、证据来源和真实责任交织在一起的服务现场。
百川的领先,不只体现在M4的排名上,也在于它比多数公司更早把模型、AI家庭医生产品和专科验证接到了同一条发展路径上。
M4站在模型评测前列,百小医进入家庭,肿瘤和儿科项目进入临床机构,这三件事放在一起,才看得出百川已经走到哪里,因为AI家庭医生产品和专科验证,让模型评测名列前茅的成绩,开始有了真实场景的支撑。
如果这套方法继续沿专科展开,肿瘤和儿科之后,心血管、内分泌、药物咨询、康复管理等场景都可能成为下一步方向。一年前百川只有家庭健康产品作为应用载体,目前已经在两个国家级临床机构形成了阶段性验证。
从现有产品和合作项目看,百川希望逐步形成覆盖家庭与医院、连接诊前、诊中和诊后环节的 AI 医疗服务体系。
在机器人用行动让人看见AI下一步时,百川展示的是另一种更难被看见的进展:M4的能力,已经开始进入AI家庭医生和专科现场。
(封面图及文中图片来源:百川智能)