Options
運用機器學習方法於東亞人種之第一孕期唐氏症風險預測
Other Title
Machine Learning-Based Prediction of First Trimester Down Syndrome Risk in East Asian Populations
Type
thesis
Date Issued
2024-07-16
Author(s)
陳彥廷
Advisor
林于翔
Subjects
系所名稱:醫學院人工智慧醫療碩士在職專班
Publisher
醫學院人工智慧醫療碩士在職專班
Description
學位別:碩士
關鍵字:機器學習; 深度學習; 第一孕期唐氏症篩檢; 特徵選取
論文公開日期:2024-12-31
關鍵字:機器學習; 深度學習; 第一孕期唐氏症篩檢; 特徵選取
論文公開日期:2024-12-31
Abstract
背景:
唐氏症為最常見的新生兒染色體異常,唐氏症患者常會有發展遲緩及先天性構造異常。第一孕期唐氏症篩檢使用生母體徵、胎兒超音波、生母血清指標等特徵,可測出胎兒唐氏症風險值。目前較少有相關文獻,探討使用不同之機器學習模型,去和第一孕期唐氏症篩檢原始預測模型比較,因此若是可以透過訓練機器學習模型,達到和原始預測模型類似的效果,將可優化整體篩檢流程。
方法:
使用台北長庚醫院之第一孕期唐氏症篩檢的資料,除原始資料集外,使用不同資料平衡演算法來進行組別不平衡之處理,再以五折驗證法,訓練機器學習模型,以原始第一孕期唐氏症預測模型之風險值為真實值,來評估機器學習成效。為增加機器學習模型之效率,對原有資料集進行特徵選取,選出五項重要特徵,即生母年紀、年紀對應之唐氏症背景值、頸部透明帶厚度、PAPP-A 和 Free beta HCG濃度,來和使用全部特徵之機器學習模型比較,並比較和原始第一孕期唐氏症預測模型之速度差異。最後,評估機器學習運行之邏輯性,使用機器自選特徵語法,讓機器學習模型選出最重要之五項特徵。
結果:
共有4061個案,在前處理後,有3812個案可供研究,其中高風險個案165位,低風險個案3647位。使用五折驗證之機器學習模型,在高風險個案中,最佳Recall為0.84,由Light GBM在random under sampling資料集中達成,而最佳之F1 Score為0.6,由LSTM在SVM-SMOTE資料集中達成,最佳之AUC為0.939,則由ANN及LSTM在random over sampling資料集中達成。使用特徵選取五項最重要特徵之模型,在高風險個案中最佳Recall為0.84,由SVM在random under sampling資料集中達成,而最佳之F1 Score為0.60,由ANN在SVM-SMOTE資料集中達成,最佳之AUC為0.929,則由ANN 在random over sampling資料集中達成。機器自選最重要之五項特徵,大部份機器學習模型(92.5%)都找出相同之五項特徵,即生母年齡、生母年齡對應之唐氏症背景值、胎兒頸部透明帶厚度、PAPP-A濃度,和free beta HCG濃度。使用特徵選取五項特徵之機器學習模型,輸入單一個案平均為10.4秒,而使用原始第一孕期唐氏症預測模型,輸入單一個案平均為109.1秒。
結論:
本研究證實,使用機器學習模型來預測唐氏症風險,可以達成和原始第一孕期唐氏症預測模型相似之成效,且可提昇運算速度約十倍,對於臨床工作之優化將有很大的幫助。
關鍵字: 機器學習、第一孕期唐氏症篩檢、深度學習、特徵選取
唐氏症為最常見的新生兒染色體異常,唐氏症患者常會有發展遲緩及先天性構造異常。第一孕期唐氏症篩檢使用生母體徵、胎兒超音波、生母血清指標等特徵,可測出胎兒唐氏症風險值。目前較少有相關文獻,探討使用不同之機器學習模型,去和第一孕期唐氏症篩檢原始預測模型比較,因此若是可以透過訓練機器學習模型,達到和原始預測模型類似的效果,將可優化整體篩檢流程。
方法:
使用台北長庚醫院之第一孕期唐氏症篩檢的資料,除原始資料集外,使用不同資料平衡演算法來進行組別不平衡之處理,再以五折驗證法,訓練機器學習模型,以原始第一孕期唐氏症預測模型之風險值為真實值,來評估機器學習成效。為增加機器學習模型之效率,對原有資料集進行特徵選取,選出五項重要特徵,即生母年紀、年紀對應之唐氏症背景值、頸部透明帶厚度、PAPP-A 和 Free beta HCG濃度,來和使用全部特徵之機器學習模型比較,並比較和原始第一孕期唐氏症預測模型之速度差異。最後,評估機器學習運行之邏輯性,使用機器自選特徵語法,讓機器學習模型選出最重要之五項特徵。
結果:
共有4061個案,在前處理後,有3812個案可供研究,其中高風險個案165位,低風險個案3647位。使用五折驗證之機器學習模型,在高風險個案中,最佳Recall為0.84,由Light GBM在random under sampling資料集中達成,而最佳之F1 Score為0.6,由LSTM在SVM-SMOTE資料集中達成,最佳之AUC為0.939,則由ANN及LSTM在random over sampling資料集中達成。使用特徵選取五項最重要特徵之模型,在高風險個案中最佳Recall為0.84,由SVM在random under sampling資料集中達成,而最佳之F1 Score為0.60,由ANN在SVM-SMOTE資料集中達成,最佳之AUC為0.929,則由ANN 在random over sampling資料集中達成。機器自選最重要之五項特徵,大部份機器學習模型(92.5%)都找出相同之五項特徵,即生母年齡、生母年齡對應之唐氏症背景值、胎兒頸部透明帶厚度、PAPP-A濃度,和free beta HCG濃度。使用特徵選取五項特徵之機器學習模型,輸入單一個案平均為10.4秒,而使用原始第一孕期唐氏症預測模型,輸入單一個案平均為109.1秒。
結論:
本研究證實,使用機器學習模型來預測唐氏症風險,可以達成和原始第一孕期唐氏症預測模型相似之成效,且可提昇運算速度約十倍,對於臨床工作之優化將有很大的幫助。
關鍵字: 機器學習、第一孕期唐氏症篩檢、深度學習、特徵選取