2026年7月28日,智诊科技发布了新一代医学大模型WiseDiag V3,同步升级C端产品“好伴AI”。如果只盯着评测分数看,可能会错过真正重要的信号。
先看分数。DoctorBench官方排行榜上,WiseDiag V3以82.50的综合分位列全球第一,超过Gemini-3.1-Pro-Preview的76.70、DeepSeek-v4-Pro的75.60、GPT-5.4的73.70。MedXpertQA文本推理56.4分同样位居全球第一。MedBench也是全球第一。在HealthBench的Base和Professional两个子集中也排名靠前。
在通用大模型巨头环伺之下,一家中国垂直医疗AI公司能在国际权威医学评测中全面领跑,这件事本身就值得写进行业备忘录。但真正值得讨论的,不是“刷榜”本身。
智诊科技把过去十年医疗AI划分为两次浪潮:第一次是“知识数字化”,让医学信息变得可检索;第二次是“对话生成”,让AI能像人一样组织语言、生成回答。这两次浪潮解决了一个问题——让知识离人更近。但没有解决另一个更深层的问题——让知识真正持续地服务于这个人。
WiseDiag V3正在跨越第三次拐点:从“一次回答”到“持续服务”。好伴AI从“能聊”升级为“能持续服务”。这不是产品文案的修辞升级,而是技术路线的根本转向。
支撑这一转向的是三层能力。第一层是长期健康记忆。系统自动关联用户的历史咨询、检查报告、健康档案、家庭成员信息,在新咨询中主动理解上下文,无需用户重复输入背景。第二层是Agent Loop智能体服务。把复杂的健康咨询拆解为多个连续任务,通过自主规划、工具调用、结果验证、动态调整完成闭环,同时对高风险症状、证据不足、用药建议进行主动识别和风险提示。第三层是主动式服务。模型不再“问一句答一句”,而是像多学科专家组一样主动追问细节、跨科室联合推理、动态追踪病情走向。
WiseDiag V3的训练体系升级提供了理解这种能力跃迁的切口。
医学继续预训练数据从800亿tokens扩展到1000亿tokens,覆盖科研、疾病、药学、问答、临床、规范、中医、字典八大医学知识层。换算成可感知的数字:相当于27.5万篇论文、36万条优质医疗问答、25200篇指南共识、2360本医学书籍。
更关键的是后训练体系的两项创新。OPD多科室专家融合与在线蒸馏机制,先分专科训练专家模型,再汇聚进统一模型,使V3能综合神经、心血管、呼吸、内分泌等多学科视角分析同一组症状。GRM生成式奖励模型充当“医学评审官”,对每个回答从准确性、完整性、安全性、清晰度四个维度打分,再把评分反馈回训练回路。这套机制把“安全”从外部约束变成了内生能力。
官方举的案例很有说服力:用户问“72岁父亲高血压糖尿病,吃氨氯地平+缬沙坦+二甲双胍,最近头晕能否加强力定眩片”,V3不会只围绕“头晕”单一症状作答,而是结合年龄、用药、既往史,首要怀疑体位性低血压,给出“先平卧或站立测血压、不自行加药、立即就医”的分层决策。这种多科室视角的综合判断,正是通用大模型在医疗垂直场景中最难做到的事。
任何技术叙事都需要直面边界。
第一个边界是监管。持续服务模式下的事故责任认定仍是监管空白。智诊官方也在视频中强调“好伴AI不能替代医生,不作为诊疗依据”。“对一个人的一生健康负责”目前更多是产品理念,而非法律意义上的责任承担。
第二个边界是验证。WiseDiag V3在DoctorBench等榜单超越Gemini、GPT-5.4等国际通用大模型,确实说明在专科场景下垂直模型的临床实战能力可以与通用巨头掰手腕。但榜单成绩仅能反映模型在标准化测试场景下的能力,实际落地效果还需结合具体场景的适配优化、数据安全保障等多因素综合判断。
更值得关注的是好伴AI在真实家庭场景中的长期留存与干预成功率。这才是“持续服务”能否成立的最终证据。目前已知的数据是:好伴AI累计服务用户超1000万人次,已服务300多家三甲及省级重点医院,汇聚2000多位专家数字分身。2026年5月,智诊科技完成6500万元天使轮融资。模型已通过国家算法备案。这些数字勾勒出一家正在加速商业化的公司的轮廓,但离回答“持续服务是否真正成立”还有距离。
国产垂直医疗大模型已经不再满足于“知识问答跑分”,而是把竞争维度拉到了“长期记忆加多智能体服务闭环”。这是一个行业信号。
但信号不等于终局。医疗AI从榜单第一名到真正成为家庭健康的可信伙伴,中间还隔着监管框架的完善、临床验证的积累、用户信任的建立。这些事,刷榜刷不出来,融资也融不出来,只能在真实的家庭场景中一天一天地验证。
WiseDiag V3的发布告诉我们:医疗AI的竞争,正在从“谁更博学”转向“谁更值得托付”。这条路比刷榜难得多,但也是唯一正确的方向。