Skip to main content
Aggregate 雷锋网 人工智能 25 Aug 2026 - 12:30

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123

RSS 官方收录 · 可信分层展示

关键摘要

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"——你觉得医疗专用模型肯定比通用模型更懂医疗?…

  • 你觉得英语训练出来的模型处理英语医疗数据肯定最好?
  • 这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。
  • 论文链接:https://aclanthology.

摘要引擎:抽取

正文提要

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。

    作者丨幸丽娟

    编辑丨岑   峰

                                                                                                       

医疗,是大模型落地最特殊的场景之一。

特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"——

你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。

你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。

这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。

论文链接:

https://aclanthology.org/2026.findings-acl.573.pdf

论文代码:https://github.com/congboma/MedErrBench

研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多达十类典型医疗错误上的表现。

论文一作马聪博( Congbo Ma)是纽约大学阿布扎比分校博士后研究员,所在的 Clinical AI Lab 长年与阿布扎比克利夫兰诊所等当地医疗机构保持合作。这种医工深度融合的研究模式,让团队既不缺技术能力,也拥有较为丰富的行业经验。而这正是构建一套"临床可信"的评测基准的前提。

但这个评测基准数据集的构建,并不简单。它涉及英文,中文和阿拉伯语三语医学数据、十类错误的设计、与医疗系统的跨界协作、以及数轮标注标准的拉锯。

这样一项环节较多、涉及多方协作的研究工作,究竟为什么必须要做?又为什么能做成? AI 科技评论采访了马聪博,她详细介绍了这项工作的必要性、构建过程、行业意义以及下一步的深入研究方向。

图片

01

MedErrBench为什么非做不可?

这项研究并非凭空而起,它始于两个方向的具体原因:

第一个来自临床一线。马聪博 所在的 Clinical AI Lab 与阿布扎比多家医院的临床医生保持长期合作,他们基本上每两周都会跟医生开会讨论。在交流过程中,医生们提出:无论是给出诊断,还是撰写病例小结,如果能有一个系统自动标记出哪里可能存在错误,对辅助诊断会非常有用。临床实践中的真实需求,给了他们这一研究灵感。

第二个来自对大模型行为的观察。研究团队发现,现有的大模型经常能生成非常流畅、甚至有医学术语支撑的解释或诊断,但这些看似专业的输出背后,隐藏着错误。在医学领域,哪怕一个词出错,后果都可能是致命的。团队意识到,需要一个专门针对"错误检测与纠正"的评测基准,给现有大模型在后面再加一道安全网。

医疗纠错的价值,在于尽可能早地发现诊疗过程中的潜在错误,并在错误进一步影响临床决策之前提供提示。尤其在急诊等信息密集、决策节奏快的场景中,及时识别遗漏、矛盾或不合理之处,有助于降低医疗错误带来的风险,提升患者安全。

马聪博 表示,如果这类系统能嵌入医疗流程,在急诊等容易漏诊的场景下提示潜在错误,将具有实际的临床价值。

图片

02

MedErrBench是怎么建出来的?

医疗作为容错率极低的落地场景,首先得有一套靠谱的“考题”。MedErrBench的构建流程,本身就是一项严谨的工程。

MedErrBench 的整体框架

三语数据:全部来自原生来源

很多多语言数据,把英语数据扔进Google Translate就号称“多语言”。MedErrBench不是。

英语和中文数据来自MedQA(美国和中国执业医师考试题),研究团队进一步筛选出包含完整临床背景、多句描述的复杂病例,去掉了过于简单的事实型问答,使数据更接近真实临床推理任务。

阿拉伯语数据来自MedArabiQ和MedAraBench。研究团队结合关键词筛选与人工审核,构建了涵盖病例场景题(Scenario-based)和医学知识题(Knowledge-based)的数据,以保证数据的多样性和挑战性。

也就是说,英语、中文、阿拉伯语全部来自各自语言的原生医学数据源,而非翻译产物。

而研究团队之所以选择这三种语言,有明确用意:

  • 英语:国际医学研究和临床教育的主要语言

  • 中文:全球使用人数最多的语言之一,医疗AI的重要应用场景

  • 阿拉伯语:覆盖中东和北非地区,代表低资源语言环境

这种设计能真实反映模型在不同语言和文化背景下的表现,而不仅仅是测试跨语言翻译能力。

十类典型医疗错误

有了原始病例之后,研究团队邀请临床医生总结归纳了10类临床最常见的医疗错误:

1.Diagnosis(诊断错误)

2.Management(诊疗方案错误)

3.Treatment(治疗错误)

4.Pharmacotherapy(药物相关错误)

5.Causal Organism / Pathogen(病原体错误)

6.Lab/Serum Value Interpretation(实验室检查解读错误)

7.Physiology(生理知识错误)

8.Histology(病理组织学错误)

9.Anatomy(解剖学错误)

10.Epidemiology(流行病学错误)

这套分类体系覆盖了临床工作中的高频错误类型,也方便后续细粒度分析不同模型的弱点分布。

多维度标注:不止是“对不对”

研究团队设计了三种辅助标注,让MedErrBench不仅能测“模型答没答对”,还能分析“为什么答错”:

  • Important Medical Words(关键医学术语)

临床医生标注每个案例中的关键医学实体——疾病名称、药物、检查项目、解剖结构等。这些术语直接影响临床决策,也是模型在纠正时最需要保持准确的信息。

  • Difficulty Level(任务难度)

每个案例根据医学知识复杂程度和推理难度,标注为简单、中等或困难。这可以用来分析不同模型在简单病例和复杂病例上的表现差异。

  • Reasoning Type(推理类型)

标注完成该任务所需的推理能力——事实检索、单步推理或多步推理。这为分析模型的能力边界提供了直接依据。

任务难度和推理类型统计

临床专家审核与质量控制

为了保证数据质量,所有案例均经过临床专家审核(Expert Review and Quality Control)。团队采用了两阶段人工审核与质量控制流程。

第一阶段,由三名分别以英语、中文和阿拉伯语为母语的 NLP 研究人员,在学习了由临床医生定义的十类临床错误分类体系后,进行初步标注和人工核验。具体工作包括识别幻觉内容或不自然的表述,删除大语言模型引入的错误或冗余信息,并对过长句子进行拆分。尤其是在中文数据集中,逗号等标点有时无法合理划分不同分句,因此需要进行额外处理。

第二阶段,每种语言由两名独立的临床医生对所有样本进行审核,以确保医学上的有效性。他们会纠正数据转换过程中产生的错误,核验错误类型标签,并检查关键临床术语、难度等级和推理类型。对于审核中的分歧,我们将其归类为逻辑错误、分类错误或拼写错误。拼写错误直接修正;对于其他问题,只要任一位临床医生提出异议,就会进一步修改。

这套质量控制流程说起来简单,做起来还有有点费劲。马聪博 坦言,整个流程中最困难的一环不是技术,而是与医生的合作。医生没有技术背景,从临床角度标注数据,与研究团队的需求之间存在 gap。

为解决这个问题,团队采用小批量迭代的方式:先让医生标注二三十个例子,团队审核后反馈问题,医生再修改、再返回,如此反复多个回合,逐步统一了标注标准。再加上医生本职工作繁忙,整个流程耗时较长。

最终,这套质量控制流程确保了数据的一致性、准确性和临床可信度。

回顾整个构建流程,马聪博认为这项工作的最大价值体现在两个层面:一是数据覆盖的广度。三语原生数据的收集和标注本身就是一项长链条工程,而此前业内缺乏一个真正可用的多语言医疗错误评测基准;二是错误分类的深度——从五种类型拓展到十类,分类来源于临床医生的真实经验。

从这个意义上来看,MedErrBench不仅能够作为医疗错误检测与纠正的评测基准,也为整个行业未来的医疗AI安全研究提供了高质量的数据基础。

图片

03

实验结果:两个反直觉的发现

研究团队选取了三类模型进行测试:通用大语言模型(General-purpose LLMs)、语言专用大语言模型(Language-specialized LLMs)以及医疗专用大语言模型(Medical-domain LLMs),涵盖GPT-4o、Gemini、Llama、Qwen、DeepSeek、ALLAM、MedGemma和HuatuoGPT等主流模型。

所有模型需完成三项逐级递进的任务:

  • 错误检测(Detection):判断病例文本中是否存在错误;

  • 错误定位(Localization):指出错误具体在哪个位置;

  • 错误纠正(Correction):生成修正后的正确文本。

三项任务的难度并不均等。检测和定位是判别式任务,用准确率衡量即可。纠正则是生成式任务,评估更为复杂。研究团队采用了 ROUGE-1、ROUGE-2、ROUGE-L、BLEU、BERTScore 和 BLEURT 六个自动评价指标。其中,ROUGE 和 BLEU 主要衡量生成文本与参考答案在词语和短语层面的匹配程度,BERTScore 和 BLEURT 则进一步从语义表示和学习到的人类评价信号等角度衡量两者的一致性。通过这些指标,可以从不同维度评估模型生成的纠正文本与参考答案之间的接近程度。

实验跑完之后,团队得到了两个完全反直觉的发现。

反直觉发现一:医疗专用模型,不如通用模型

如果问一个AI从业者:MedGemma和HuatuoGPT这类在医学数据上专门训练过的模型,在医疗错误检测任务上,表现应该优于同量级的通用模型吗?大多数人会回答"是的"。但实验数据给出了相反的结论。

在英文数据集上Doubao-1.5-Thinking-Pro三项任务均表现最优:检测准确率0.779,定位准确率0.774。DeepSeek-R1和gpt-4o-mini紧随其后。而医疗专用模型MedGemma和HuatuoGPT的表现,不仅没有超越通用模型,甚至落后于部分通用模型。为什么医疗专用模型反而表现不佳?马聪博在采访中分析了两个原因。

第一,医疗模型的训练目标与当前任务并不完全匹配。“像 MedGemma 这样的医疗模型,训练重点更多放在医学问答、临床文本和医学影像等任务上,并没有专门针对医疗错误检测和纠正进行训练。医学知识丰富,并不意味着模型天然擅长识别一段看似合理的临床文本中具体哪里出了错。

第二,通用模型可能受益于更大的训练规模和更广泛的数据分布。“前沿通用模型通常在更大规模、更多样的数据上训练,其中也可能包含相当数量的医学内容。这样的训练不仅带来医学知识,也增强了模型在语言理解、推理和指令遵循等方面的通用能力。对于医疗错误检测和纠正这样既需要医学知识、又需要细粒度推理的任务,这些通用能力可能同样重要。

此外,还有一个实验结果出乎研究团队意料:Doubao和DeepSeek系列模型在三语数据集上的整体表现普遍超过了GPT-4o和Gemini。

研究团队同样探讨了原因,一是训练数据的构成。 DeepSeek同时涵盖中英文语料,在多语言医疗任务上具有天然优势。二是推理能力的贡献。 DeepSeek-R1等模型具备推理机制,而推理能力在错误检测,尤其是定位和纠正这类复杂任务上,起到了关键作用。

不过她也补充了一个重要的时间背景:论文实验完成于2025年,测试的是GPT-4o和GPT-4o mini。如果使用2026年最新版的GPT模型,结果可能会有所不同。

这两个实验结果共同提示,在医疗错误检测与纠正任务中,领域知识并不是决定模型表现的唯一因素。相比单纯积累医学知识,模型能否理解上下文、识别潜在矛盾并进行推理和纠正,可能更加关键。

反直觉发现二:英文原生模型在中文原生数据集上,竟然表现更好

这个发现来自研究团队做的一组对比实验。团队将中文数据集翻译成英文和阿拉伯语后重新测试,结果发现:在中文原生数据集上模型表现最好;翻译成英文和阿拉伯语后,各项指标普遍下降,尤其在定位和纠正任务上降幅明显。

更出乎意料的是,像 GPT、Gemini 这种以英语训练为主的模型,在中文原生数据集上的检测表现,竟然比在英文原生数据集上还要好。

对此,马聪博进一步分析原因:原生数据的临床信息密度和质量,比"翻译过来的多语言覆盖"更有价值。翻译可能会丢失语境细节,还可能引入表达偏差,影响模型对错误的判断。(这组对比实验的结果放在论文附录 J.1 中。)

除了模型本身的差异,研究团队还发现三个额外因素会显著影响结果。

一是提示策略(Prompt)设计。

研究团队进一步分析了不同提示策略(Prompt)的影响,实验发现,模型的性能不仅取决于模型本身,也与提示设计密切相关。相比仅提供错误类型,在 Prompt 中加入错误类型定义以及少样本示例,通常能够帮助模型更准确地理解和纠正医疗错误。

 二是不同难度示例。

不同模型对 in-context 示例难度的偏好存在明显差异:Doubao-1.5-thinking-pro 更适合中等难度示例,DeepSeek-V3 更受益于简单示例,而 Gemini 2.0 Flash 则更适用于发现语高难度示例的错误。此外,Doubao-1.5-thinking-pro 在各难度下均表现出最高的预测置信度。

三是不同的临床数据类型(知识型 VS场景型)。

实验结果显示,大多数模型在场景型临床数据上的表现优于知识型数据,说明它们更依赖上下文模式识别,而非稳健的阿拉伯语医学知识。Llama3-8B 是唯一的例外,在知识型任务上表现略好;而 Qwen2.5-7B-Instruct 的两类任务性能差距最大,表明其可能更依赖表层模式和指令遵循。

图片

04

两个坦诚的局限

论文最后列出了两个局限性:

第一,缺少错误严重程度的标注。 一个药物剂量的小错误和一个致命误诊,风险天差地别,但当前数据集没有区分。这意味着,模型修正了一个"不痛不痒的小错"和修正了一个"可能致命的大错",在MedErrBench上的得分可能完全一样。

第二,阿拉伯语数据量偏小。 不是不想做,是高质量、公开的阿拉伯语医学数据本身就稀缺。团队在论文中表示正在继续扩充。

此外在采访中讨论到“如何判断 AI 是否达到人类水平”这一问题时,马聪博的回答很务实:"我们目前并没有让 AI 去设定一个什么样的标准,或者说让它能够替代人类去做一些什么。目前我们希望它能够做一个辅助诊断的系统,能够提醒医生可能存在的一些潜在错误,发现一些遗漏的信息,降低一些有可能造成的医疗事故。"

换句话说,AI 在这里的角色不是替代医生,而是做一个"检测错误、告诉医生"的辅助角色。至于纠正,模型给出的方案,本身不一定对,依然需要医生复核。

因此,在医疗AI的现阶段,与其纠结于“AI是否达到了人类水平”这一抽象命题,不如先让AI做好辅助这件事。把错误找出来、告诉医生、由医生做最终判断——这或许才是医疗AI在当前技术阶段最务实、也最有价值的落地方向。

图片

05

下一步的研究

MedErrBench 只是这个团队的第一步。

正如马聪博所说,他们做这个数据集的初衷,是希望能够推动更多研究者关注医疗错误检测与纠正这个方向。她坦言,一个新的研究方向要形成,数据集往往是第一道门槛,所以他们选择先从收集多语料数据集入手,为后续的研究生态打下基础。

在后续研究中,团队也开始将重点延伸到实际医疗流程,探索如何在医生诊断、撰写病历等环节及时提示潜在错误,为临床决策提供辅助。与此同时,临床应用对模型的准确性和可靠性提出了更高要求,而目前模型在错误定位和纠正上的表现仍有明显提升空间。围绕这些问题,团队已经进一步开展了相关研究,目前论文正在投递中,主要聚焦于两个方向

第一个方向:用 Agentic AI 提升检测,定位和纠正效果。 团队正在用智能体架构来提升模型在错误检测和纠正任务上的准确度和生成质量,目标是把当前还不够高的指标进一步提高。

第二个方向:为医疗纠错任务设计新的评估指标。 这是一个容易被忽视但极其重要的问题。目前衡量纠正任务用的还是 ROUGE、BLEU Score、BLEURT 这类通用指标,但它们把所有词都按同等重要来给分。

马聪博 举了一个例子:如果模型根据病例推断出患者可能患有什么疾病,结果疾病名称给错了,那整个纠正就是失败的。但用 ROUGE 来算,其他词语对了、只有病名错了,依然能拿到一个不低的分数。

因此,团队正在设计一套新指标:对关键医学术语赋予更高权重,同时引入安全性评估维度,判断修正后的文本是否真正规避了临床风险。

通用指标看“像不像”,医疗指标看“关键的地方对不对”、安全性够不够, 这是团队对评估理念的凝练,也是他们下一步希望推动的范式转变。雷峰网雷峰网雷峰网

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表