Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
文章主要内容总结本文针对大型语言模型(LLMs)在临床决策中应用时的医学推理能力评估问题,提出了一套解决方案。核心内容包括:MedThink-Bench基准数据集:包含500个复杂医学问题,覆盖10个医学领域(如病理学、诊断、治疗等),每个问题均由医学专家标注细粒度、分步的推理轨迹,模拟真实临床逻辑。LLM-w-Ref评估框架:结合专家精心设计的细粒度推理过程与“LLM作为评判者”(LLM-as-a-Judge)机制,实现对LLMs中间推理过程的自动化、可扩展评估,且评估结果与专家判断高度一致。实验发现:对12个最先进的LLMs进行基准测试,发现较小的开源模型(如MedGemma-27B、HuatuoGPT-70B)在医学推理能力上可优于较大的专有模型(如OpenAI-o3、DeepSeek-R1);同时,传统评估指标(如文本相似度 metrics、无参考的LLM-as-a-Judge)与专家判断相关性较弱,而LLM-w-Ref表现出强相关性。创新点解决了LLMs医学推理评估中“自动化、可扩展性与专家级准确性难以兼顾”的长期挑战,提出的LLM-w-Ref框架实现了高效且贴近专家水平的评估。构建了高质量的MedThink-Bench数据集,其推理轨迹由专家标注(而非LLM生成),确保了评估的可靠性,覆盖10个医学领域的500个复杂问题。首次系统比较12个LLMs的医学推理能力,揭示了“小模型可能优于大模型