基于自发报告数据驱动机器学习模型预测严重药品不良反应
Prediction of Severe Adverse Drug Reactions Based on Spontaneous Reporting Data-Driven Machine Learning Models
摘要目的 基于药品不良反应(ADR)自发报告数据,构建严重ADR的智能预测模型,提升药物警戒效率,辅助早期识别高风险ADR,优化医疗资源分配.方法 纳入4 144例ADR自发报告.采用DeepSeek大语言模型标准化诊断信息和药品名称.选取24个临床特征,通过特征工程处理年龄、时间变量及无序类别数据.系统比较伯努利朴素贝叶斯(BNB)、随机森林(RF)等10 种机器学习算法,并评估SMOTE、ADASYN、TomekLinks等采样技术对数据不平衡(严重ADR占10.4%)的处理效果.模型性能以精确召回曲线下面积(AUPRC)为首要指标,曲线下的面积(AUC)、灵敏度(TPR)为次要指标,结合SHAP值解析特征贡献.结果 BNB结合TomekLinks表现最优,在内部验证集中的AUC=0.921、AUPRC=0.757、灵敏度=0.626,在模型外数据验证中AUPRC=0.711、AUC=0.901,泛化能力良好.通过SHAP解析,"导致住院或延长住院""年龄""免疫异常及感染"是显著的正向影响特征,"对原患疾病的影响不明显""胃肠、皮肤及皮肤附件损害""结果痊愈/好转"是负向影响特征.结论 将DeepSeek大语言模型应用于结构化ADR数据标准化处理,结果证实,针对高维稀疏特征,欠采样技术TomekLinks优于过采样方法.BNB算法作为贝叶斯定理的经典分类算法,高效的分类能力在众多算法中依然表现优异.局限性包括单中心数据偏倚和严重ADR样本量不足.未来需整合多中心数据、结合药物分子特征及自然语言处理技术,构建更精准的预警系统.
更多相关知识
- 浏览0
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



