Options
以不平衡學習方法於推特資料之藥物不良反應及藥物攝取辨識研究
Other Title
Identification of Adverse Drug Reactions and Medication Intakes from Twitter Data Using Imbalance Learning Methods
Type
thesis
Date Issued
2018-07-04
Author(s)
王振愷
Advisor
蘇家玉
戴鴻傑
Subjects
系所名稱:醫學資訊研究所
Description
學位別:碩士
語文別:中文
指導教授:蘇家玉
共同指導教授:戴鴻傑
口試委員:蔡銘峰;林明錦;張詠淳
中文關鍵字:藥物不良反應;社群網路;機器學習;文字探勘;藥物攝取
英文關鍵字:Adverse Drug Reactions;Social Media;Machine Learning;Text Mining;Medication Intake
語文別:中文
指導教授:蘇家玉
共同指導教授:戴鴻傑
口試委員:蔡銘峰;林明錦;張詠淳
中文關鍵字:藥物不良反應;社群網路;機器學習;文字探勘;藥物攝取
英文關鍵字:Adverse Drug Reactions;Social Media;Machine Learning;Text Mining;Medication Intake
Abstract
研究目的:
即時了解新藥上市後的各種藥物不良反應(英文:Adverse Drug Reaction,簡稱 ADR)情形,對於藥品製造商、醫療機構、政府部門以及一般民眾來說極為重要。因為一旦患者發生 ADR,輕則導致暫時性的不適症狀,重則導致住院、產生永久性殘疾甚而危及生命。藥物不良反應事件(英文:Adverse Drug Event,簡稱 ADE)是一個全球性的問題,主動通報在目前的監控機制中扮演了重要的角色,雖然世界各國政府皆提出各種藥物上市後的安全監控計劃與機制,2011 年的研究報告仍指出約有高達 90% 的未通報 ADR。近年來隨著網際網路的普及讓民眾有更多取得與分享健康資訊的管道,許多的線上資源如健康論壇,甚至是病患社群的出現,連帶產生了巨量的發文,以自然語言處理(英文:Natural Language Processing,簡稱 NLP)技術分析社群網路中所分享的巨量未結構化文字訊息也為藥物安全監控來源開啟新的契機。
研究材料與方法:
本研究以美國醫學資訊協會舉辦的Social Media Mining for Health Applications (SMM4H)競賽中的兩個任務為研究資料,分別為推特貼文中藥物不良反應描述事件的二元分類(task 1)和自動分類描述藥物攝取量的三元分類(task 2),該工作坊主要的目的是希望能夠用自然語言處理的技術來對社媒中與健康資訊相關的資料進行自動化的收集、提取、分析和驗證,該工作坊以推特作為社媒目標。其中在task 1包含了10,448篇未提及ADR的推文和1,130篇包含ADR提及的推文。在task 2包含了1,819篇提及藥物攝取的推文、3,009篇可能提及藥物攝取(不明確)的推文和4,742篇未提及藥物攝取的推文。在訓練資料集中包含了高度的不平衡,機器學習演算法遇到這樣資料不平衡的困難,在進行分類時會將大部分的推文歸類為多數類的訓練資料的類別。由此我們嘗試使用多種不同的資料不平衡處理方法,主要分為兩大類,前處理方法和成本敏感型方法,以解決此類問題。在訓練上我們使用Sequential Minimal Optimization(SMO)、Naïve Bayes Multinomial(NBM)、A Library for Support Vector Machines(LibSVM)和Convolutional Neural Networks(CNN)演算法來開發分類器。我們使用多種前處理方法和提取不同的特徵來開發模型,並使用十次交叉驗證進行實驗,以檢查其有效性。
結論:
本研究於task 1中最好的表現是使用Vote-based Ensemble資料不平衡處理方法,並基於n-gram、領域知識、否定和詞嵌入的特徵選取搭配拼寫檢查、劑量替換推文、lowercase和normalization的前處理組合。於task 2中最好的表現是使用LibSVM演算法並設置cost為0.01,對三個類別的權重依據資料比例分別設為3、2和1,並使用與task 1相同的前處理及特徵選取方法。實驗結果表示,本研究提出的方法分別在訓練資料和測試資料中分別獲得了53.7%、42.9%的macro-F分數(推文中提及ADR的二元分類)和68.1%、64.5%的micro-F分數(推文中描述藥物攝入量的三類分類)。
即時了解新藥上市後的各種藥物不良反應(英文:Adverse Drug Reaction,簡稱 ADR)情形,對於藥品製造商、醫療機構、政府部門以及一般民眾來說極為重要。因為一旦患者發生 ADR,輕則導致暫時性的不適症狀,重則導致住院、產生永久性殘疾甚而危及生命。藥物不良反應事件(英文:Adverse Drug Event,簡稱 ADE)是一個全球性的問題,主動通報在目前的監控機制中扮演了重要的角色,雖然世界各國政府皆提出各種藥物上市後的安全監控計劃與機制,2011 年的研究報告仍指出約有高達 90% 的未通報 ADR。近年來隨著網際網路的普及讓民眾有更多取得與分享健康資訊的管道,許多的線上資源如健康論壇,甚至是病患社群的出現,連帶產生了巨量的發文,以自然語言處理(英文:Natural Language Processing,簡稱 NLP)技術分析社群網路中所分享的巨量未結構化文字訊息也為藥物安全監控來源開啟新的契機。
研究材料與方法:
本研究以美國醫學資訊協會舉辦的Social Media Mining for Health Applications (SMM4H)競賽中的兩個任務為研究資料,分別為推特貼文中藥物不良反應描述事件的二元分類(task 1)和自動分類描述藥物攝取量的三元分類(task 2),該工作坊主要的目的是希望能夠用自然語言處理的技術來對社媒中與健康資訊相關的資料進行自動化的收集、提取、分析和驗證,該工作坊以推特作為社媒目標。其中在task 1包含了10,448篇未提及ADR的推文和1,130篇包含ADR提及的推文。在task 2包含了1,819篇提及藥物攝取的推文、3,009篇可能提及藥物攝取(不明確)的推文和4,742篇未提及藥物攝取的推文。在訓練資料集中包含了高度的不平衡,機器學習演算法遇到這樣資料不平衡的困難,在進行分類時會將大部分的推文歸類為多數類的訓練資料的類別。由此我們嘗試使用多種不同的資料不平衡處理方法,主要分為兩大類,前處理方法和成本敏感型方法,以解決此類問題。在訓練上我們使用Sequential Minimal Optimization(SMO)、Naïve Bayes Multinomial(NBM)、A Library for Support Vector Machines(LibSVM)和Convolutional Neural Networks(CNN)演算法來開發分類器。我們使用多種前處理方法和提取不同的特徵來開發模型,並使用十次交叉驗證進行實驗,以檢查其有效性。
結論:
本研究於task 1中最好的表現是使用Vote-based Ensemble資料不平衡處理方法,並基於n-gram、領域知識、否定和詞嵌入的特徵選取搭配拼寫檢查、劑量替換推文、lowercase和normalization的前處理組合。於task 2中最好的表現是使用LibSVM演算法並設置cost為0.01,對三個類別的權重依據資料比例分別設為3、2和1,並使用與task 1相同的前處理及特徵選取方法。實驗結果表示,本研究提出的方法分別在訓練資料和測試資料中分別獲得了53.7%、42.9%的macro-F分數(推文中提及ADR的二元分類)和68.1%、64.5%的micro-F分數(推文中描述藥物攝入量的三類分類)。