大语言模型在真实临床场景中文放射报告错误检测中的应用
Application of large language models in error detection of Chinese radiology reports within real-world clinical scenarios
摘要目的:评估大语言模型(LLMs)在真实临床场景中检测中文放射报告错误的能力.方法:回顾性分析2023年 1月至 2024年6月在放射报告系统内提交修改的放射报告.报告涵盖身体各个部位及不同检查类型.报告里面的错误均为医生在临床实践过程中产生,并由LLMs辅助放射科医生共同标注.运用LLMs包括GPT-4、GPT-4o(OpenAI)、DeepSeek-V3和DeepSeek-R1自动识别放射报告中的错误,比较其在整体和不同亚组中的性能,并进行外部验证.结果:共纳入含有1 431个错误的1 263份报告.DeepSeek-R1的错误检出率为88.6%,显著优于GPT-4(65.4%)、GPT-4o(76.2%)和DeepSeek-V3(66.7%),差异有统计学意义(均P<0.05).在不同亚组分析中,DeepSeek-R1均表现出显著优势(均P<0.05).在外部验证组中,DeepSeek-R1拥有最高的错误检出率(89.5%)、准确率(0.896)、精准率(0.971)、召回率(0.833)、F1分数(0.897)和最低的假阳性率(3%),并且显著优于另外三个模型(均P<0.05).结论:经过提示词工程优化后的LLMs,尤其是DeepSeek-R1在真实临床场景中文放射报告的错误检测中展现出优异的性能,可整合到放射工作流程中,辅助医生提高报告准确率.
更多相关知识
- 浏览2
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



