哈佛研究:AI 诊断准确度超越急诊室医生

内容管家 AI领域评论20字数 653阅读2分10秒阅读模式
哈佛研究:AI 诊断准确度超越急诊室医生

哈佛研究:AI 在急诊分诊中准确率超越人类医生

一项新研究测试了大语言模型在多种医疗场景中的表现,其中在真实急诊病例中,OpenAI 的 o1 模型甚至超越了人类医生。该研究由哈佛医学院与贝斯以色列女执事医疗中心的医师和计算机科学家团队联合完成,已发表于《Science》杂志。

o1 模型在急诊诊断中表现突出

研究团队选取了 76 名进入贝斯以色列急诊室的患者为对象,将两名主治医师的诊断结果与 OpenAI o1 和 4o 模型的诊断进行对比。评估工作由另外两名主治医师完成——他们事先不知道哪些诊断来自人类、哪些来自 AI。

结果发现,在每个诊断接触点,o1 的表现均与两位主治医师相当或更优。这种差距在首次急诊分诊阶段尤为明显:该阶段患者信息最少、决策最紧迫,正是最考验诊断能力的环节。

数据说话:o1 准确率 67% 远超同行

研究团队未对数据做任何预处理,AI 获得的正是当时电子病历中的同等信息。在此条件下,o1 模型在 67% 的分诊病例中给出了"精确或高度接近"的诊断,而两名主治医师的这一比例分别为 55% 和 50%。

"我们用几乎所有基准测试了 AI 模型,它的表现超越了两款前代模型,也超越了我们的医师基线。"——哈佛医学院 AI 实验室负责人、研究共同通讯作者 Arjun Manrai

研究局限与下一步建议

论文同时指出,本次研究仅测试了模型处理纯文本信息的能力,而"现有研究表明,当前基础模型在非文本输入推理方面仍有明显局限"。此外,研究团队并未声称 AI 已可在现实生活中做出生死攸关的决策,而是强调亟需开展前瞻性试验,在真实患者护理环境中评估这类技术。

贝斯以色列女执事医疗中心医生、研究共同通讯作者 Adam Rodman 接受《卫报》采访时补充道:目前围绕 AI 诊断责任尚无正式框架,患者仍希望由人类来引导他们完成生死决策和艰难的治疗决策。

延伸阅读

历史上的今天
5 月
4
 
内容管家

发表评论