Options
運用機器學習整合臨床特徵及多基因風險分數建置阿茲海默症風險預測模型
Other Title
Developing a Risk Prediction Model for Alzheimer's Disease by Integrating Machine Learning with Clinical Characteristics and Polygenic Risk Scores
Type
thesis
Date Issued
2025-01-14
Author(s)
黃絹
Advisor
張資昊
Subjects
系所名稱:醫學資訊研究所碩士班
Publisher
醫學資訊研究所碩士班
Description
學位別:碩士
口試委員:吳育瑋; 許博凱; 張資昊
關鍵字:阿茲海默症、單核苷酸多態性、全基因體關聯分析、多基因風險分數、機器學習
口試委員:吳育瑋; 許博凱; 張資昊
關鍵字:阿茲海默症、單核苷酸多態性、全基因體關聯分析、多基因風險分數、機器學習
Abstract
研究動機:阿茲海默症是最常見的失智症類型之一,因目前尚無根治方法,早期識別高風險族群以進行預防尤為重要。已有多項研究聚焦於相關風險預測,但單一特徵(如年齡)可能對模型表現產生主導性影響,限制了其他潛在風險因子的發現。本研究綜合多篇文獻的重要特徵,並對年齡和性別進行傾向性匹配,旨在提升高齡族群的阿茲海默症風險預測模型效能。
研究方法:本研究基於UK Biobank數據,結合遺傳數據與臨床數據,建置高齡族群五年內及十年內的阿茲海默症風險預測模型。研究流程包括對433,589名樣本進行全基因體關聯分析(GWAS),對13,282名樣本計算多基因風險分數(PRS),並整合多種特徵以構建預測模型。GWAS分析分別基於三種p值閾值:p值 ≤ 0.05 篩選出379,360個SNPs,p值 ≤ 10−5篩選出1,113個 SNPs,p值 ≤ 5 × 10−8 篩選出206個顯著SNPs,並利用PRSice2和Lassosum計算PRS分數。最終,將37個臨床特徵、PRS和206個顯著位點分別輸入Logistic Regression、LightGBM、XGBoost及MLP四種機器學習模型進行預測及效能比較。
結果:在五年內風險預測中,最佳模型為採用37個臨床特徵與206個顯著位點的MLP模型,AUC達到0.88。在十年內風險預測中,最佳模型為採用37個臨床特徵、206個顯著位點以及基於這些位點計算的PRS的MLP模型,AUC達到0.89。
結論:本研究證明整合臨床特徵與PRS可有效提升高齡族群阿茲海默症風險預測的精度。然而,為進一步驗證多基因風險分數的應用效能,未來需進行更多跨族群與跨資料庫的合作研究,並持續探索其他潛在風險因子,以實現模型的臨床應用價值。
研究方法:本研究基於UK Biobank數據,結合遺傳數據與臨床數據,建置高齡族群五年內及十年內的阿茲海默症風險預測模型。研究流程包括對433,589名樣本進行全基因體關聯分析(GWAS),對13,282名樣本計算多基因風險分數(PRS),並整合多種特徵以構建預測模型。GWAS分析分別基於三種p值閾值:p值 ≤ 0.05 篩選出379,360個SNPs,p值 ≤ 10−5篩選出1,113個 SNPs,p值 ≤ 5 × 10−8 篩選出206個顯著SNPs,並利用PRSice2和Lassosum計算PRS分數。最終,將37個臨床特徵、PRS和206個顯著位點分別輸入Logistic Regression、LightGBM、XGBoost及MLP四種機器學習模型進行預測及效能比較。
結果:在五年內風險預測中,最佳模型為採用37個臨床特徵與206個顯著位點的MLP模型,AUC達到0.88。在十年內風險預測中,最佳模型為採用37個臨床特徵、206個顯著位點以及基於這些位點計算的PRS的MLP模型,AUC達到0.89。
結論:本研究證明整合臨床特徵與PRS可有效提升高齡族群阿茲海默症風險預測的精度。然而,為進一步驗證多基因風險分數的應用效能,未來需進行更多跨族群與跨資料庫的合作研究,並持續探索其他潛在風險因子,以實現模型的臨床應用價值。