基于多标签文本分类任务的医学影像报告数据治理
Medical Imaging Report Data Governance Based on Multi-Label Text Classification Task
摘要目的 通过自动化拆分医学影像报告内容,推动医学影像多模态大模型的研究进展,增强数据的可用性与准确性.方法 回顾性收集来自安徽省影像云平台的39499条X线影像报告数据,涵盖25个检查部位.采用多标签文本分类方法,将检查所见和检查印象的文本数据集应用于微调预训练的Chinese-Roberta-WWM-ext模型和Chinese-BERT-WWM模型.为了验证最优模型在报告拆分任务中的表现,选取200份影像报告进行测试,并运用李克特量表对实验结果进行量化评估.结果 在微调过程中,Chinese-Roberta-WWM-ext模型的表现最佳,其检查所见和检查印象模型在25个标签上的平均曲线下面积分别为0.982和0.989.针对医学影像报告中检查所见和检查印象2个部分,经过微调后的不同预训练BERT模型在阈值为0.5的条件下,Chinese-Roberta-WWM-ext模型于25个标签上的平均F1得分分别为78.59%和82.31%;对于200份测试影像报告,模型完全正确拆分的比例达89%.结论 本研究提出的基于BERT模型的影像报告治理方法,为获取大规模图像-文本对齐数据集提供了有效手段.
更多相关知识
- 浏览4
- 被引0
- 下载1

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



