2025-08-11 科研追新

当日精选(由提交工具自动创建)。

百川开源医疗推理模型 Baichuan-M2-32B,HealthBench 超越 GPT-OSS-120B

百川开源 Baichuan-M2-32B,通过患者模拟器与 Verifier 系统开展端到端强化学习,在医疗评测 HealthBench 上超过参数规模更大的 GPT-OSS-120B。

 人工智能应用 模型开发 推理 强化学习 模型评估

百川发布并开源医疗推理大模型 Baichuan-M2-32B,其在 OpenAI HealthBench 评测集上的表现超过 GPT-OSS-120B。HealthBench 包含 5000 条覆盖多语言、多场景的医疗多轮对话,并由来自 60 个国家的 262 名医生制定细粒度评价标准。模型创新性地引入患者模拟器和大型 Verifier 系统,从真实医疗问题出发进行端到端强化学习训练。该方法在增强医疗专业能力的同时,力求保持模型的通用能力。

用途与启示
  • 为医疗问答、临床数据解读和健康咨询等垂直应用提供高性能开源基座模型。
  • 展示患者模拟器与 Verifier 驱动的强化学习在专业领域模型训练中的价值。
  • 说明中等参数规模模型可借助领域数据、验证机制和训练策略超过更大通用模型。
  • HealthBench 的多维医生评分体系可作为医疗大模型评估与对齐的参考。
📝 原始笔记(逐字保留)
1. [让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板](https://mp.weixin.qq.com/s/YCfbNgiGGwzmUnrWSEY8zw) 1. 百川开源最新医疗推理大模型 **Baichuan-M2-32B** ,在OpenAI发布的Healthbench评测集上,超越其刚刚发布5天的开源模型gpt-oss-120b。 2. HealthBench是由OpenAI今年发布的一个医疗健康领域评估测试集,数据集中包含5000条多轮对话,模拟模型与个人用户或医疗专业人士之间的真实交流。这些对话跨越多语言、多背景(如急诊、临床数据解读、全球健康等)。 1. 每段对话配有由262名医生(来自60个国家)撰写的具体评价准则,一共涉及48562条特点明确的标题标准(rubric criteria)。评分不仅涵盖医学准确性,还包括指令遵从、沟通能力等行为维度。 3. 创新性提出了 **患者模拟器和Verifier系统** 。核心基于一个大型的Verifier系统,能够从真实存在的医疗问题出发,进行端到端强化学习训练,能够在保持模型通用能力同时大幅提升医疗领域表现。 4. Blog:https://www.baichuan-ai.com/blog/baichuan-M2 #### [GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%](https://mp.weixin.qq.com/s/gfM7kMxSt9Cs7Ark8gaOcA)
0%