Options
應用具關鍵資訊提取能力之預訓練語言模型於出院後死亡風險預測
Other Title
Predicting Mortality Risk after Hospital Discharge using a Pre-Trained Language Model with Key Information Extraction Module
Type
thesis
Date Issued
2023-06-20
Author(s)
林志成
Advisor
張詠淳
Subjects
系所名稱:大數據科技及管理研究所碩士班
Description
學位別:碩士
語文別:中文
口試委員:張詠淳 CHANG, YUNG-CHUN;陳建錦 CHEN, CHIEN-CHIN;蘇家玉 SU, CHIA-YU
授權範圍:網際網路,開放日期為2023-07-18
語文別:中文
口試委員:張詠淳 CHANG, YUNG-CHUN;陳建錦 CHEN, CHIEN-CHIN;蘇家玉 SU, CHIA-YU
授權範圍:網際網路,開放日期為2023-07-18
Abstract
隨著電子健康紀錄(EHR)的快速發展和機器學習技術的成熟,使得海量數據的處理成為可能。然而大約80%的醫療數據在建立後仍然是非結構化格式,是高度未開發的資源,這些信息可能會被 EHR 的結構化資訊所遺漏。近幾年來,自然語言處理分類技術於醫學臨床的貢獻非常大,他可以快速的幫助醫生自動分類、更好地管理和理解醫療數據,進而協助醫生做最佳的疾病診斷和治療。
本研究使用MIMIC-III資料集之出院病摘臨床文本紀錄,採用基於變換器的雙向編碼器 (Bidirectional Encoder Representations from Transformers, BERT)預訓練語言模型,進行病患出院後之死亡風險預測。考量BERT基本模型長文本探索的效能不佳問題,本研究提出“關鍵臨床描述提取器 (Crucial Clinical Description Extractor, CCDE)”,將龐大的臨床文本提取摘要(平均1,800字濃縮摘要至510字以內),讓模型能完整學習到臨床文本的重要資訊。實驗證明,我們的模型不僅能大幅提升死亡案例的預測效能,同時也能保持原有存活案例的預測能力。
另外,本研究亦嘗試跨院驗證實驗,將MIMIC-III實驗模型參數,應用於TMUCRD資料集的預測。實驗結果,我們的模型確實能有效應用於不同醫院臨床資料。其中,我們也細究原因兩個資料集科別差異性,並解釋效能差異原因。
本研究使用MIMIC-III資料集之出院病摘臨床文本紀錄,採用基於變換器的雙向編碼器 (Bidirectional Encoder Representations from Transformers, BERT)預訓練語言模型,進行病患出院後之死亡風險預測。考量BERT基本模型長文本探索的效能不佳問題,本研究提出“關鍵臨床描述提取器 (Crucial Clinical Description Extractor, CCDE)”,將龐大的臨床文本提取摘要(平均1,800字濃縮摘要至510字以內),讓模型能完整學習到臨床文本的重要資訊。實驗證明,我們的模型不僅能大幅提升死亡案例的預測效能,同時也能保持原有存活案例的預測能力。
另外,本研究亦嘗試跨院驗證實驗,將MIMIC-III實驗模型參數,應用於TMUCRD資料集的預測。實驗結果,我們的模型確實能有效應用於不同醫院臨床資料。其中,我們也細究原因兩個資料集科別差異性,並解釋效能差異原因。