Diagnosing migraine from genome-wide genotype data: a machine learning analysis.
研究背景
偏头痛是常见原发性头痛障碍,全球疾病负担显著。遗传因素虽重要,但已知基因变异仅能解释部分遗传性。研究者试图用机器学习模型捕捉非加性和交互效应,提高诊断准确性。
方法速览
采用Trøndelag健康研究(HUNT)的基因型数据,用多种机器学习和深度学习方法构建模型。数据集分四个,含不同数量基因变异。用AUC等指标评估模型性能,还进行基因注释和通路富集分析。
主要发现
- 机器学习模型优于多基因风险评分:在四个数据集上,机器学习模型测试集AUC为0.62 - 0.63,多基因风险评分(PRS)为0.52 - 0.59,表明前者能更好捕捉基因非加性和交互效应。
- 非加性和交互效应的证据:小样本数据集上,Light Gradient Boosting Machine (LGBM) 模型表现佳,AUC 0.63 - 0.65,依赖部分变异,支持非加性和交互效应;大样本数据集上,Multinomial Naïve Bayes (MNB) 模型表现最佳,AUC 0.62,复杂模型因过拟合性能下降,简单加性模型更有效。
- 基因和通路的发现:小数据集上,模型识别出与信号传导和神经功能相关的独特基因和通路,如LGBM模型发现与降钙素基因样受体和肉毒杆菌毒素毒性相关通路;部分变异与GWAS风险位点重叠,大数据集独特基因比例增加,表明模型能发现GWAS未识别的基因和通路。
总结展望
本研究首次证明机器学习模型在捕捉基因非加性和交互效应上的优势,发现新基因和通路。但存在样本量限制、表型赋值敏感性低和外部验证不足等问题,结果需在独立队列中验证。