.hd-box .hd-fr

医疗 AI 迎来大考,南洋理工发布首个 LLM 电子病历处理评测

2025-12-15 20:38新智元(LRST)8评

电子病历(EHR)是医疗体系中最核心的数据形态,集中呈现患者在诊断、检验、用药、生命体征监测与疾病管理过程中的关键临床信息,是临床决策的重要基础。

随着 LLM 逐步应用于医疗场景,如何使其有效理解和处理这些结构化的EHR,从而辅助医生完成关键的数据分析与临床推理,已成为推动医疗人工智能发展的重要问题。

因此,南洋理工大学的研究人员提出了首个全面评测 LLM 处理结构化电子病历能力的综合基准EHRStruct,由计算机科学家与医学专家共同构建,并按照临床场景、认知层级与功能类别进行层次化组织,全面的覆盖了 LLM 处理结构化 EHR 的 11 项核心任务,包含 2,200 个标准化样本,为医疗大模型的可控性、可靠性与临床可用性提供统一而严谨的可解释评测框架。

基于 EHRStruct,研究团队对 20 个主流 LLMs 与 11 种先进的增强方法进行了全面的评测,并在此基础上提出了一种代码增强框架EHRMaster。

EHRMaster 与 Gemini 联合,使 LLM 处理结构 EHR 的性能全面超越 SOTA 模型。研究成果已被 AAAI 2026 Main Technical Track 录取为 Oral 论文。

同时发布的还有 EHRStruct 2026 - LLM 结构化电子病历挑战赛(EHRStruct 2026 - LLM Structured EHR Challenge),旨在为研究者提供一个统一、严谨且可对比的 LLM 处理结构化 EHR 能力的评测平台,可直接作为论文实验结果的标准基准。

研究人员也将与国际会议洽谈合作事宜,预计将在后续推出联合征稿,接收基于 Challenge 的研究报告与论文成果。

Leaderboard 已正式在 Codabench 上线,携手探索 LLMs 在结构化数据理解与推理上的新边界。

挑战赛链接:https://www.codabench.org/competitions/12019/

任务定义与主要发现

结构化 EHR 任务总览。EHRStruct 涵盖 11 项任务,按场景(数据 / 知识)与认知层级(理解 / 推理)分类。数据驱动任务: D-U1/U2:基于条件的数据过滤 D-R1/R2/R3:数值聚合(计数 / 均值 / 求和) D-R4/R5:数值趋势算术推理。知识驱动任务: K-U1:临床代码识别 K-R1:死亡率预测 K-R2:疾病预测 K-R3:药物推荐。

EHRStruct 将 11 项结构化 EHR 任务按照「情境类型」(数据驱动与知识驱动)和「认知层级」(理解与推理)进行组织,并进一步划分为六类典型任务,包括信息检索、数据聚合、算术计算、临床识别、诊断评估和治疗规划。

基于这一任务体系,该文章对多种大型语言模型进行了系统性评估,其主要发现如下。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

下载IT之家APP,分享赚金币换豪礼
相关文章
大家都在买广告
热门评论
查看更多评论