摘要

目的 构建遗传因素及临床风险因素相结合的骨密度机器学习回归模型,识别影响个体对骨质疏松易感性的最优特征组合。方法 以最大互信息系数与序列浮动前向选择作为两阶段特征选择方法选择最优特征子集,基于随机森林建立骨密度回归模型。结果 在2 263例白种人样本数据集进行十折交叉验证实验,结果表明当包含51个SNP位点,6个临床特征时,两阶段特征选择方法结合随机森林模型的均方根误差最低为0.093 598 g/cm3,相较仅以临床危险因素作为特征时RMSE降低了5.36%;与选用其他特征选择方法及回归模型的比较实验证实了本文提出模型的良好稳定性。结论 骨质疏松症致病因素分析方法能够发现隐藏的特征间相互作用,识别最优特征组合,从而更好地预测和诊断复杂疾病。