Options
MIMIC-III 資料庫之極低體重早產兒住院中死亡機器學習預測模型
Other Title
Machine learning models for prediction of in-hospital mortality of very low birth weight preterm infants using MIMIC-III database
Type
thesis
Date Issued
2024-01-17
Author(s)
陳瑛芳
Advisor
林明錦
Subjects
系所名稱:醫學院人工智慧醫療碩士在職專班
Publisher
醫學院人工智慧醫療碩士在職專班
Description
學位別:碩士
關鍵字:機器學習; 極低出生體重; 早產兒; 死亡預測
論文公開日期:2024-01-23
關鍵字:機器學習; 極低出生體重; 早產兒; 死亡預測
論文公開日期:2024-01-23
Abstract
背景:新生兒包含早產兒的相關重症和死亡率的預測研究不斷推陳出新,從利用傳統線性迴歸或統計分析的風險計算機,到近幾年來使用人工智慧和機器學習建立的預測模型,利用周產期特徵、生理數值、早產兒併發症等因子預測其死亡率。美國波士頓單一醫學中心的重症醫學資料庫MIMIC-III(Medical Information Mart for Intensive Care-III)為一數據龐大和結構化之資料庫,已被廣泛利用在重症醫學的機器學習,本研究試圖分析MIMIC-III 資料庫中新生兒加護病房住院中極低體重早產兒死亡個案之特徵並進行機器學習訓練,比較不同模型在預測新生兒加護病房住院中極低體重早產兒死亡病患之表現。希望能藉由死亡個案的特徵分析,改善新生兒加護病房品質,降低其死亡率。另一方面也希望能將此模型應用在前瞻式分析,作為臨床警示醫護及決策輔助工具使用。
目的:將MIMIC-III 資料庫中之新生兒加護病房極低體重早產兒病患資料進行前處理,建立結構化之新生兒加護病房極低體重早產兒資料庫,建立新生兒加護病房住院中極低體重早產兒死亡之預測模型,並使用衛生福利部雙和醫院之本地新生兒加護病房極低體重早產兒資料以進行模型外部驗證。
方法:從MIMIC-III 資料庫中將2001-2008 年之新生兒加護病房住院病患資料,篩選出極低體重早產兒,收集病患之人口統計資料、周產期資訊和事件發生(死亡/存活出院)前一日之24 小時內之生命徵象作為特徵項,使用邏輯式迴歸(Logistic Regression, LR)進行特徵分析。機器學習部分以80%資料作為訓練集,20%資料作為測試集,並且採用SMOTE(Synthesized Minority Oversampling Technique)進行資料平衡處理。機器學習部分使用邏輯式迴歸(Logistic Regression, LR)、隨機森林(Random Forest, RF)、K-近鄰演算法(K-Nearest Neighbors, KNN)、XGBoost(eXtreme Gradient Boosting)、AdaBoost(Adaptive Boosting),共5 種模型訓練新生兒加護病房住院中極低體重早產兒之死亡預測模型,以曲線下面積(Area Under Curve, AUC)、準確(Accuracy)、陽性預測值(Positive Predictive Value, PPV)及召回率(Recall)等四項指標評估。本研究更進一步使用衛生福利部雙和醫院新生兒科加護病房極低體重早產兒2021-2023 年之本地資料做為外部驗證以測試模型之適用性。
結果:本研究從MIMIC-III 資料庫中共收集765 筆符合分析條件之新生兒加護病房極低體重早產兒住院資料,使用新生兒之性別、出生週數、出生體重、出生後第一分鐘和第五分鐘之Apgar 分數及是否為多胞胎等6 項特徵,事件發生前一日之24 小時內之體溫、心跳速率、呼吸速率等12 項特徵共18 項進行特徵分析並以機器學習訓練住院中死亡預測模型。內部驗證之部分表現最好的是XGBoost 模型(AUC: 0.99; Accuracy: 0.98),最弱的是KNN 模型(AUC: 0.81; Accuracy: 0.88)。外部驗證中一樣以XGBoost 模型表現最佳,但曲線下面積僅0.71,其中邏輯式迴歸模型(AUC: 0.46)及KNN 模型(AUC: 0.55)預測能力極低。另外,不論是在內部或外部驗證中,存活預測的陽性預測值和召回率反而明顯優於死亡預測。因此,本研究之模型尚無法運用於本地極低體重早產兒之住院中死亡預測,將來需要更多的數據及分析以進行研究及建立準確之模型。
目的:將MIMIC-III 資料庫中之新生兒加護病房極低體重早產兒病患資料進行前處理,建立結構化之新生兒加護病房極低體重早產兒資料庫,建立新生兒加護病房住院中極低體重早產兒死亡之預測模型,並使用衛生福利部雙和醫院之本地新生兒加護病房極低體重早產兒資料以進行模型外部驗證。
方法:從MIMIC-III 資料庫中將2001-2008 年之新生兒加護病房住院病患資料,篩選出極低體重早產兒,收集病患之人口統計資料、周產期資訊和事件發生(死亡/存活出院)前一日之24 小時內之生命徵象作為特徵項,使用邏輯式迴歸(Logistic Regression, LR)進行特徵分析。機器學習部分以80%資料作為訓練集,20%資料作為測試集,並且採用SMOTE(Synthesized Minority Oversampling Technique)進行資料平衡處理。機器學習部分使用邏輯式迴歸(Logistic Regression, LR)、隨機森林(Random Forest, RF)、K-近鄰演算法(K-Nearest Neighbors, KNN)、XGBoost(eXtreme Gradient Boosting)、AdaBoost(Adaptive Boosting),共5 種模型訓練新生兒加護病房住院中極低體重早產兒之死亡預測模型,以曲線下面積(Area Under Curve, AUC)、準確(Accuracy)、陽性預測值(Positive Predictive Value, PPV)及召回率(Recall)等四項指標評估。本研究更進一步使用衛生福利部雙和醫院新生兒科加護病房極低體重早產兒2021-2023 年之本地資料做為外部驗證以測試模型之適用性。
結果:本研究從MIMIC-III 資料庫中共收集765 筆符合分析條件之新生兒加護病房極低體重早產兒住院資料,使用新生兒之性別、出生週數、出生體重、出生後第一分鐘和第五分鐘之Apgar 分數及是否為多胞胎等6 項特徵,事件發生前一日之24 小時內之體溫、心跳速率、呼吸速率等12 項特徵共18 項進行特徵分析並以機器學習訓練住院中死亡預測模型。內部驗證之部分表現最好的是XGBoost 模型(AUC: 0.99; Accuracy: 0.98),最弱的是KNN 模型(AUC: 0.81; Accuracy: 0.88)。外部驗證中一樣以XGBoost 模型表現最佳,但曲線下面積僅0.71,其中邏輯式迴歸模型(AUC: 0.46)及KNN 模型(AUC: 0.55)預測能力極低。另外,不論是在內部或外部驗證中,存活預測的陽性預測值和召回率反而明顯優於死亡預測。因此,本研究之模型尚無法運用於本地極低體重早產兒之住院中死亡預測,將來需要更多的數據及分析以進行研究及建立準確之模型。