Options
以消化道內視鏡基礎標準術語第二版[MST2]名詞為範本的自動內視鏡報告分類系統
Type
thesis
Date Issued
2005
Author(s)
邱展賢
Advisor
劉建財
李友專
Subjects
系所名稱:醫學資訊研究所
Publisher
Graduate Institute of Biomedical Informatics / 醫學資訊研究所
Abstract
本研究以資訊擷取及自然語言處理的技術,將非結構化自由型態消化道內視鏡報告,以消化道內視鏡基礎標準術語(MST2)為本體,經過分析整理成「可延伸性標示語言」(Extensible Markup Language,簡稱XML)的消化道內視鏡報告,提供查詢,跨平台交換及醫學統計。未來也可與消化道內視鏡影像儲存系統結合,合成完整消化道內視鏡電子資料庫系統,提供醫學照顧與治療決策更精確的資訊。
研究方法:首先,評估國內消化道內視鏡檢查報告的結構性符合MST2架構的程度,依據MST2架構將消化道內視鏡檢查報告依檢查的部位、檢查的發現及診斷分三個部分,每一個部份有三個評估子項,每一子項依據與MST2符合程度給分,由完全符合給與3分至完全不符合給與0分,由一位消化系專科醫師對每篇文章評分,每篇報告最高總分共27分。其次,進行名詞剖析,以MST2同義字引擎將已剖析名詞進行同義字轉換成MST2標準名詞,處理文章切割則將文章依據四個文章中的關鍵詞 Esophagus、Stomach、Duodenum及Impression將文章分為以此四個字為首的四個區段。計算每一個標準名詞在各區段文章中的序位。將轉換後擷取出的標準名詞以XML進行文字索引及標示,最後形成以MST2為索引典的結構式自動分類內視鏡報告。預期經過處理後的消化道內視鏡報告其文件分類可以更為有效。評估方法將以公元2001年由某市立醫院5位消化系專科醫師紀錄的1266篇消化道內視鏡報告為訓練資料庫,以2005年某市立醫學中心1699篇檢查報告為測試資料庫,其中由六位消化系專科醫師撰寫的消化道內視鏡報告489篇及上消化道治療性內視鏡檢查報告30篇。以“回現率”與“精確率”二因素來衡量評估檢索效能。程式語言使用JAVA。轉換後檢查報告以XML格式儲存。
結果:選取1235篇訓練組資料庫進行MST2結構式相符評分分析,發現只有33 篇(2.7%)報告檢查內容能完全符合標準名詞規範,但是大部分(60%)的內視鏡報告9個子項中仍有4到6項符合MST2的要求。將訓練資料庫1266篇文字進行同義字分析後,設計十種MST2同義字轉換形式,發現轉換後可增加訓練資料庫標準名詞的擷取數達2.56倍以上。訓練資料庫與測試資料庫皆能以超過95%的精確率與回現率來將文章正確的切割成為以esophagus、stomach、duodenum與impression為段首的四個區段。若以stomach、ulcer及body三個標準名詞來評估文章檢索功能,將訓練資料庫調教至精確率為76.9%、回現率100%時,在測試資料庫精確率為68.75%、回現率100%。若能以”esophagus/varices/grade II/lower third”固定序位的次序模式擷取,文件檢索效能在訓練資料庫會由精確率:80.7%、回現率: 74.2%變為精確率:93.6%(44/47)、回現率: 70.9%(44/62)。
結果與討論:對非使用英文為母語的醫師,無法很精確使用英文準名詞來描述消化道內視鏡檢查結果,只有60%的檢查報告內容能部份符合MST2標準名詞規範,很少(2.7%)能完全符合,因此這類報告在資訊擷取或文章分析時,將無法得到正確結果。但是消化道內視鏡檢查內容皆具有一固定格式,因此可依據關鍵詞來進行文章分割,有超過95%的精確率與回現率。不過當有不同類型報告混合進行分析時,如將超音波或大腸鏡檢查報告一起分析時,精確率會下降至60%以下。在醫學報告中進行名詞檢索,若先經過同義字轉換成標準名詞後,有非常高的回現率,但是精確率只有70%,原因在於醫學專有名詞較統一且經過同義字轉換,容易擷取,但是檢索的名詞間是否在文章中有相關,則需經過自然語言處理來協助提高精確率。MST2標準名詞在報告內容中會有固定的出現序位,將序位模式列入分析時,可增進檢索精確率。同樣發現在一些檢查為正常的報告,醫師會以固定報告範本輸入,如檢索ulcer時,可發現ulcer出現於文章中第18個位置時,內容為no ulcer的可能有95%。但是當擷取名詞時,有多個從屬名詞出現時,如bleeding、erosion與ulcer都被檢索出時,需藉助三個名詞彼此間在文章中序位的向量分析,才能正確分類。自由型態非結構式消化道內視鏡檢查報告在自然語言處理後,是可以轉換成標準名詞結構式報告,且可進行檢索與分類。如此,可以達到更有效的分類,本研究發現轉換後的消化道內視鏡檢查報告分類,食道區的主要病變為Erosion及Ulcer且大都是單一病灶出現;在胃部主要病灶為多發的erosion,或是單一的superficial ulcer且沒有Bleeding;在12指腸以單一的cratered ulcer為主。不過分類仍會因為錯別字,自創簡寫及負面敘述,造成錯誤,需有更強大的字典庫及同義字庫與人工智慧來協助分辨,文字序位向量及文章模式或許可作為人工智慧分析的條件。
結論:在分析不是以英文為母語的文章撰寫者而言,不論在文字、文法及描述上有相當大的認知差距,再加上有自創縮寫及包括格式及打字錯誤的書寫錯誤,造成自然語言處理的困難,若能用標準名詞及架構、導入概念空間(Concept Space)及知識主體(Domain Knowledge)的協助,資訊擷取及文件將可更精確。本研究嘗試用世界消化內視鏡醫學會頒布的消化道內視鏡基礎標準術語第二版(MST 2)名詞作為同義字轉換及結構式資料庫轉換依據,以可延伸性標示語言〈XML〉作為轉換後標準語言格式,提供一種可行方式將非結構化自由型態消化道內視鏡報告以自然語言處理轉換成標準名詞結構且自動分類的消化道內視鏡報告,提高資訊擷取與文件分析的效能。
研究方法:首先,評估國內消化道內視鏡檢查報告的結構性符合MST2架構的程度,依據MST2架構將消化道內視鏡檢查報告依檢查的部位、檢查的發現及診斷分三個部分,每一個部份有三個評估子項,每一子項依據與MST2符合程度給分,由完全符合給與3分至完全不符合給與0分,由一位消化系專科醫師對每篇文章評分,每篇報告最高總分共27分。其次,進行名詞剖析,以MST2同義字引擎將已剖析名詞進行同義字轉換成MST2標準名詞,處理文章切割則將文章依據四個文章中的關鍵詞 Esophagus、Stomach、Duodenum及Impression將文章分為以此四個字為首的四個區段。計算每一個標準名詞在各區段文章中的序位。將轉換後擷取出的標準名詞以XML進行文字索引及標示,最後形成以MST2為索引典的結構式自動分類內視鏡報告。預期經過處理後的消化道內視鏡報告其文件分類可以更為有效。評估方法將以公元2001年由某市立醫院5位消化系專科醫師紀錄的1266篇消化道內視鏡報告為訓練資料庫,以2005年某市立醫學中心1699篇檢查報告為測試資料庫,其中由六位消化系專科醫師撰寫的消化道內視鏡報告489篇及上消化道治療性內視鏡檢查報告30篇。以“回現率”與“精確率”二因素來衡量評估檢索效能。程式語言使用JAVA。轉換後檢查報告以XML格式儲存。
結果:選取1235篇訓練組資料庫進行MST2結構式相符評分分析,發現只有33 篇(2.7%)報告檢查內容能完全符合標準名詞規範,但是大部分(60%)的內視鏡報告9個子項中仍有4到6項符合MST2的要求。將訓練資料庫1266篇文字進行同義字分析後,設計十種MST2同義字轉換形式,發現轉換後可增加訓練資料庫標準名詞的擷取數達2.56倍以上。訓練資料庫與測試資料庫皆能以超過95%的精確率與回現率來將文章正確的切割成為以esophagus、stomach、duodenum與impression為段首的四個區段。若以stomach、ulcer及body三個標準名詞來評估文章檢索功能,將訓練資料庫調教至精確率為76.9%、回現率100%時,在測試資料庫精確率為68.75%、回現率100%。若能以”esophagus/varices/grade II/lower third”固定序位的次序模式擷取,文件檢索效能在訓練資料庫會由精確率:80.7%、回現率: 74.2%變為精確率:93.6%(44/47)、回現率: 70.9%(44/62)。
結果與討論:對非使用英文為母語的醫師,無法很精確使用英文準名詞來描述消化道內視鏡檢查結果,只有60%的檢查報告內容能部份符合MST2標準名詞規範,很少(2.7%)能完全符合,因此這類報告在資訊擷取或文章分析時,將無法得到正確結果。但是消化道內視鏡檢查內容皆具有一固定格式,因此可依據關鍵詞來進行文章分割,有超過95%的精確率與回現率。不過當有不同類型報告混合進行分析時,如將超音波或大腸鏡檢查報告一起分析時,精確率會下降至60%以下。在醫學報告中進行名詞檢索,若先經過同義字轉換成標準名詞後,有非常高的回現率,但是精確率只有70%,原因在於醫學專有名詞較統一且經過同義字轉換,容易擷取,但是檢索的名詞間是否在文章中有相關,則需經過自然語言處理來協助提高精確率。MST2標準名詞在報告內容中會有固定的出現序位,將序位模式列入分析時,可增進檢索精確率。同樣發現在一些檢查為正常的報告,醫師會以固定報告範本輸入,如檢索ulcer時,可發現ulcer出現於文章中第18個位置時,內容為no ulcer的可能有95%。但是當擷取名詞時,有多個從屬名詞出現時,如bleeding、erosion與ulcer都被檢索出時,需藉助三個名詞彼此間在文章中序位的向量分析,才能正確分類。自由型態非結構式消化道內視鏡檢查報告在自然語言處理後,是可以轉換成標準名詞結構式報告,且可進行檢索與分類。如此,可以達到更有效的分類,本研究發現轉換後的消化道內視鏡檢查報告分類,食道區的主要病變為Erosion及Ulcer且大都是單一病灶出現;在胃部主要病灶為多發的erosion,或是單一的superficial ulcer且沒有Bleeding;在12指腸以單一的cratered ulcer為主。不過分類仍會因為錯別字,自創簡寫及負面敘述,造成錯誤,需有更強大的字典庫及同義字庫與人工智慧來協助分辨,文字序位向量及文章模式或許可作為人工智慧分析的條件。
結論:在分析不是以英文為母語的文章撰寫者而言,不論在文字、文法及描述上有相當大的認知差距,再加上有自創縮寫及包括格式及打字錯誤的書寫錯誤,造成自然語言處理的困難,若能用標準名詞及架構、導入概念空間(Concept Space)及知識主體(Domain Knowledge)的協助,資訊擷取及文件將可更精確。本研究嘗試用世界消化內視鏡醫學會頒布的消化道內視鏡基礎標準術語第二版(MST 2)名詞作為同義字轉換及結構式資料庫轉換依據,以可延伸性標示語言〈XML〉作為轉換後標準語言格式,提供一種可行方式將非結構化自由型態消化道內視鏡報告以自然語言處理轉換成標準名詞結構且自動分類的消化道內視鏡報告,提高資訊擷取與文件分析的效能。
File(s)
No Thumbnail Available
Name
C0173740.pdf
Size
9.92 MB
Format
Adobe PDF
Checksum
(MD5):e71346bc53ea81f2b3cd4012a1dfb3d8