Options
開發基於真實世界數據及機器學習之肺癌治療預後預測模型
Other Title
Developing Lung Cancer Prognosis Prediction Models Based on Real-world Data and Machine Learning
Type
thesis
Date Issued
2022-01-11
Author(s)
羅彩芝
Advisor
張資昊;徐之昇
Subjects
系所名稱:醫學資訊研究所碩士班
Publisher
醫學資訊研究所碩士班
Description
口試委員:張資昊 CHANG, TZU-HAO;徐之昇 HSU, CHIH-SHENG;吳立青 WU, LI-CHING;蘇家玉 SU, CHIA-YU;邵于宣 SHAO, YU-HSUAN
網際網路,開放日期為2022-07-01
網際網路,開放日期為2022-07-01
Abstract
肺癌是全球癌症死亡的首要原因。2020年全球約有221萬新發肺癌病例,約180萬例死亡。2019年發病率為29.21/10萬人,死亡率為26.40/10萬人。如何精準地預測疾病的預後及藥物治療的結果,乃至於作為治療決策與藥物選擇之參考輔助,是臨床醫學近年來的重要議題。近年來,人工智慧技術常被應用在醫療學術研究及臨床實務。利用大數據且經由機器學習或深度學習之演算法所開發的疾病風險及預後預測的模組,為近年來人工智慧應用在醫療領域之學術研究的一大主流。
本研究有三項研究目的:(1)建立非小細胞肺癌患者確診後二年存活預測模型;(2)建立非小細胞肺癌患者標靶藥物治療後二年存活預測模型;(3)建立非小細胞肺癌患者確診後腦轉移預測模型。
本研究的資料來源為臺北醫學大學臨床研究資料庫(Taipei Medical University Clinical Research Database, TMUCRD)。我們擷取了2008至2019年罹患非小細胞肺癌患者作為研究族群。本研究分別以每位患者的非小細胞肺癌確診日或標靶藥物治療日為起始日,以診斷後二年內死亡或腦轉移之發生作為結果,另以患者基本人口學特性、生活習慣、肺癌疾病特性、共病症、近期用藥情形、臨床檢驗數據、基因檢測結果等作為特徵因子。本研究同時使用多種不同的機器學習方式,包括邏輯斯迴歸(Logistic Regression)、套袋法集成學習(Bagging)、梯度提升(Gradien Boosting)、自適應增強法集成學習(AdaBoost)、隨機森林(Random Forest)、極限梯度提升(eXtreme Gradient Boosting, XGB)、線性判別分析(Linear Discriminant Analysis)及LightGBM(Light Gradient Boosting Machine)來建立預測模型。我們也根據外部測試結果,ROC曲線下面積AUC(Area Under Curve, AUC)最大的模型是最佳模型。
本研究中,總共收納 3,714 名患者(2,280 名用於訓練數據集,1,434 名用於測試數據集)。目的一(確診後二年存活預測)的結果顯示,在完整模式下,隨機森林模型(Random Forest)的 AUC 比其他模型高(AUC=0.869),且最重要的特徵因子是癌症期別、腫瘤尺寸、性別、確診年齡和身體質量指數。目的二(標靶治療後二年存活預測)的結果顯示,在完整模式下,梯度提升模型(Gradien Boosting)的AUC最高(AUC=0.785),且最重要的特徵因子為癌症期別、腫瘤尺寸、身體質量指數、ROS1、ALK和PD-L1。目的三(確診後腦轉移預測)的結果顯示,在完整模式下,梯度提升模型(Gradien Boosting)的AUC最高(AUC=0.703),且最重要的特徵因子是癌症期別、腫瘤尺寸、確診年齡及身體質量指數。
綜上所述,結合多種特徵因子(包括人口學特徵、疾病狀況、共病症、合併用藥、實驗室檢測結果和基因檢測結果)可以建立效能頗佳的非小細胞肺癌預後預測模型,且癌症期別、腫瘤尺寸及身體質量指數在本研究的不同模型下皆為重要特徵因子。使用隨機森林模型(Random Forest)或梯度提升模型(Gradien Boosting)演算法開發的模型具有最高的AUC,它們可能是最適合用於非小細胞肺癌預後預測的工具。
本研究有三項研究目的:(1)建立非小細胞肺癌患者確診後二年存活預測模型;(2)建立非小細胞肺癌患者標靶藥物治療後二年存活預測模型;(3)建立非小細胞肺癌患者確診後腦轉移預測模型。
本研究的資料來源為臺北醫學大學臨床研究資料庫(Taipei Medical University Clinical Research Database, TMUCRD)。我們擷取了2008至2019年罹患非小細胞肺癌患者作為研究族群。本研究分別以每位患者的非小細胞肺癌確診日或標靶藥物治療日為起始日,以診斷後二年內死亡或腦轉移之發生作為結果,另以患者基本人口學特性、生活習慣、肺癌疾病特性、共病症、近期用藥情形、臨床檢驗數據、基因檢測結果等作為特徵因子。本研究同時使用多種不同的機器學習方式,包括邏輯斯迴歸(Logistic Regression)、套袋法集成學習(Bagging)、梯度提升(Gradien Boosting)、自適應增強法集成學習(AdaBoost)、隨機森林(Random Forest)、極限梯度提升(eXtreme Gradient Boosting, XGB)、線性判別分析(Linear Discriminant Analysis)及LightGBM(Light Gradient Boosting Machine)來建立預測模型。我們也根據外部測試結果,ROC曲線下面積AUC(Area Under Curve, AUC)最大的模型是最佳模型。
本研究中,總共收納 3,714 名患者(2,280 名用於訓練數據集,1,434 名用於測試數據集)。目的一(確診後二年存活預測)的結果顯示,在完整模式下,隨機森林模型(Random Forest)的 AUC 比其他模型高(AUC=0.869),且最重要的特徵因子是癌症期別、腫瘤尺寸、性別、確診年齡和身體質量指數。目的二(標靶治療後二年存活預測)的結果顯示,在完整模式下,梯度提升模型(Gradien Boosting)的AUC最高(AUC=0.785),且最重要的特徵因子為癌症期別、腫瘤尺寸、身體質量指數、ROS1、ALK和PD-L1。目的三(確診後腦轉移預測)的結果顯示,在完整模式下,梯度提升模型(Gradien Boosting)的AUC最高(AUC=0.703),且最重要的特徵因子是癌症期別、腫瘤尺寸、確診年齡及身體質量指數。
綜上所述,結合多種特徵因子(包括人口學特徵、疾病狀況、共病症、合併用藥、實驗室檢測結果和基因檢測結果)可以建立效能頗佳的非小細胞肺癌預後預測模型,且癌症期別、腫瘤尺寸及身體質量指數在本研究的不同模型下皆為重要特徵因子。使用隨機森林模型(Random Forest)或梯度提升模型(Gradien Boosting)演算法開發的模型具有最高的AUC,它們可能是最適合用於非小細胞肺癌預後預測的工具。