摘要目的 构建基于Stacking策略的集成学习模型,以提升高维小样本肺纤维化(PF)基因表达数据的特征筛选稳定性,并识别与疾病相关的候选关键基因.方法 从基因表达综合数据库(GEO)数据库获取 PF 转录组数据集 GSE70866 与 GSE48149,其中GSE70866作为训练集用于模型构建与特征筛选,GSE48149作为独立验证数据集用于评估模型的泛化能力,经数据预处理与差异表达分析筛选候选关键基因.在此基础上构建多个基学习器的Stacking集成框架,通过K折交叉验证生成元特征,并以逻辑回归(LR)和支持向量机(SVM)作为元学习器完成最终分类判别.采用F1-score与曲线下面积(AUC)评价模型性能,结合特征重要性排序筛选候选基因.结果 构建的集成学习模型在训练数据集GSE70866中表现出良好的判别能力,F1-score为0.955 9,AUC为0.948 2,整体优于单一模型方法.在独立验证数据集GSE48149上,混淆矩阵结果进一步表明该模型具有较好的泛化能力.基于多模型特征重要性综合分析,筛选获得硫氧还蛋白样蛋白4B(TXNL4B)、C-C基序趋化因子配体18(CCL18)、泛素结合酶E2 Z亚型(UBE2Z)等候选关键基因.结论 基于Stacking策略的集成学习框架可在高维小样本条件下提升模型稳定性与预测准确性,为转录组数据中的候选基因筛选提供了一种有效方法,为PF相关分子过程的探索提供数据层面支持.
更多相关知识
- 浏览1
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



