构建XGBoost-SHAP可解释性2型糖尿病合并冠心病风险预测模型与网络应用
Constructing an XGBoost-SHAP explainability model for type 2 diabetes mellitus with coronary heart disease risk prediction and Web application
摘要目的 建立一种利用机器学习识别 2 型糖尿病(T2DM)患者合并冠心病(CHD)危险因素的预测模型,并构建预测网站促进临床应用.方法 回顾性调查研究,连续纳入 2017 年 1 月至 2022 年 1 月石家庄市第二医院 2 250 例 T2DM 患者为研究对象,其中男性 1 352 例,占比 60.1%,以随访 2 年内是否发生 CHD 为结局变量.采用简单随机抽样方法将患者按照 3:1 的比例分为训练集(1 688 例)和验证集(562 例).使用最小绝对收缩和选择算法(Lasso)筛选变量,训练了 6 种机器学习模型并进行 5 倍交叉折叠验证,最终选择极端梯度提升(XGBoost)方法构建预测模型.采用受试者工作特征(ROC)曲线和决策曲线分析(DCA)评估预测模型的效能,确定最佳预测模型.将该模型应用于同期河北医科大学第四医院收治的 1 047 例 T2DM 患者,其中男性 628 例,占比 60.0%,进一步验证模型性能.采用特征重要性分析和沙普利加和解释(SHAP)值依赖图详细解释关键特征对模型预测结果的贡献和影响.根据模型构建预测网站并验证实用性.结果 Lasso 回归分析共纳入15 个预测变量进行模型构建,其中,XGBoost 模型在所有训练模型中表现最佳,并在验证集中得到验证(ROC 曲线下面积为 0.840,准确度 0.780,敏感度 0.878,特异度 0.669,精确度 0.747).性能最佳的XGBoost 模型应用于外部数据集(ROC 曲线下面积为0.840,准确度0.770,敏感度0.857,特异度0.693,精确度 0.714).验证 DCA 分析结果显示,与其他机器学习模型比较,XGBoost 具有更大的净效益和阈值概率.SHAP 解释 XGBoost 特征变量重要性排序为:总蛋白、糖尿病病程、胆碱酯酶、低密度脂蛋白胆固醇、高血压病史、血红蛋白、血小板计数、肌酐、钙离子、血小板分布宽度、白蛋白、α-羟丁酸脱氢酶、乳酸脱氢酶、脂蛋白、脑梗死病史,上述是预测 T2DM 患者并发 CHD 的关键特征.根据XGBoost 最佳截断值 0.558 构建 CHD 预测网站,输入患者的特征变量证实了预测效果.结论本研究建立了 T2DM 患者 CHD 发病风险预测相关可解释性 XGBoost 模型和预测网站,为指导临床决策提供帮助.
更多相关知识
- 浏览0
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



