李友專梁家維2026-06-142026-06-142018-07-04https://203.71.86.71/handle/123456789/58289學位別:碩士 語文別:中文 指導教授:李友專 口試委員:邱泓文;許明暉 中文關鍵字:癌症;預測;肝癌;深度學習;機器學習;罹癌;風險;歷史;診斷 英文關鍵字:Cancer;predict;liver;HCC;deep learning;CNN;machine learning;diagnosis history背景:在台灣,由於中央健保的覆蓋率高,以及每人每年的就診次數名列世界前茅,所以我們的健康狀況與我們的就診記錄息息相關。而健保資料庫又提供豐富的資料,我們得以據此而研究個人被診斷過的疾病及開立的藥物與肝癌的關聯。 方法:使用1999~2013年健保資料庫的門診及住院申報檔,從中找出肝癌病患(結果10506人),並取樣非肝癌案例40000人。以ICD-9-CM碼代表疾病診斷結果以及慢性病藥品的使用這兩種資訊當做特徵,以觀察三年資料為例,當觀察期間某天被診斷為某疾病時或被開立某慢性病藥物時,就把個人的特徵-日期二維表上當天設為1分,將每7天或3年期間分數加總,再與所有人在同樣期間及同樣疾病的分數做標準化至0~1後,一方面使用卷積法(CNN)或多層次法(MLP)的類神經網路訓練及驗證肝癌預測準確性;另一方面則以逐步抽取變數觀察準確性損失法,及隨機森林法,和風險係數,去得知各變數的重要性。若要預測提早一年的結果,則需要癌症被標示前一年起算的往前三年資料做訓練。 結果:以觀察3年而提早0.5年到3年的肝癌預測,在三年加總法的AUROC為0.883~0.880;每7天加總並使用CNN則為0.917~0.906。對於疾病做重要因子分析,使用逐步抽取法及隨機森林法的結果類似,重要性高到低前五名為:1.慢性肝病;2.年齡;3.肝炎;4.性別;5.惡性腫瘤掃描。其中惡性腫瘤掃描為負相關,原因為肝癌病人掃描一次後即停止計算,而非肝癌病人可以被掃描多次且被算入。 結論:本研究不只使用了疾病與藥物有或無的資訊,而且也利用了時間資訊,相當於考慮了它們遠近及嚴重程度。它也可視為使用隱藏在個人就醫記錄裡的共病進行癌症預測。由於使用的是大量數據,故不需要專家的知識即可得到預測模型及重要因子。因為使用的資訊是存在資料庫裡現成的資料,所以可以實現低價且快速的初步檢驗。台灣的中央健保提供個人過去三年的就醫診斷結果,保險人可以使用本研究的結果以進行肝癌預測。系所名稱:醫學資訊研究所利用深度學習以診斷及用藥歷史預測罹癌風險-以肝癌為例Use Deep Learning to Accurately Predict Cancer Risk - A Case Study on Hepatocellular Carcinomathesis