Options
Applications of Search Engine Query Data in Infodemiology Study: A Case Study of the Coronavirus Disease 2019 (COVID-19) Pandemic
Other Title
Applications of Search Engine Query Data in Infodemiology Study: A Case Study of the Coronavirus Disease 2019 (COVID-19) Pandemic
Type
thesis
Date Issued
2022-06-09
Author(s)
ATINA HUSNAYAIN
Advisor
蘇家玉
Subjects
系所名稱:醫學資訊研究所博士班
Publisher
醫學資訊研究所博士班
Description
口試委員:蘇家玉 SU, EMILY CHIA-YU;邵于宣 SHAO, YU-HSUAN;吳漢銘 WU, HAN-MING;莊定武 CHUANG, TING-WU;林煜軒 LIN, YU-HSUAN
網際網路,開放日期為2022-07-04
網際網路,開放日期為2022-07-04
Abstract
背景:在新型冠状病毒肺炎(新冠肺炎)疫情爆發之際,使用者於網路搜尋關鍵字之趨勢與新興流行病之疫情具高度關聯,因此運用訊息流行病學研究中利用搜尋引擎查詢資料之應用是相當重要的。
目標:研究目的主要於發展新冠肺炎預測方法,並分析網際網路相關查詢數據之可能用途(研究1-3),並評估線上搜尋模型於包括(研究4)位置(集群和非集群區域)、(研究5)時期(疫情爆發階段)和(研究6)模型種類這些不同情況下之預測表現。
方法:本研究使用來自 Google Trends 和 NAVER 搜尋引擎查詢數據以及新冠肺炎相關資料、Google 和 Apple 移動數據,並選擇台灣、菲律賓、美國和南韓為研究地點。在初步研究(研究1-3)中,研究使用時間序列、相關分析和地圖視覺化等方法。而在主要研究(4)中,採用正規化線性回歸模型、廣義線性模型和空間狀態模型做為預測模型之開發,並利用G 統計量來定義群聚樣式,以預測每日新增之新冠肺炎病例數和死亡人數(研究 5 和 6)。針對預測模型之開發,在第一例確診病例被報導後,將新冠肺炎資料分成疫情爆發後前3、6、12 和 18 個月之四個不同疫情時期之資料集。於資料分區時,取資料集前80%資料作為訓練集,其餘資料作為測試集。並使用均方根誤差、峰值日誤差和峰值幅度誤差作為模型預測能力之評估指標。
結果:研究結果顯示搜尋數據可用於定義(研究1)進行健康風險溝通之時機與地點,(研究2)可供民眾搜尋基本健康資訊類型,以及(研究3)民眾在新冠肺炎大規模流行初期對健康風險之看法。此外,本研究發現新冠肺炎病例數和網路搜尋關鍵字間呈中度至高度之相關性,研究結果亦顯示使用者搜尋之關鍵字可用於預測新冠肺炎之確診案例數。在評估不同(研究4)位置(集群和非集群區域)時,線上搜尋模型表現時顯示在美國不同州別和疫情時期之間,線上搜尋模型之預測能力存在差異。這代表在使用查詢數據時,必須在每個州別建立不同研究框架。基於發現搜尋數據與疫情具高度相關之情況下,使用者查詢數據可用於預測新冠肺炎。另外,在不同(研究5)時期(疫情爆發階段)下,本研究亦分析線上搜尋模型之預測能力,結果顯示搜尋數據對於預測每日新增新冠肺炎之病例數和死亡人數為有效變數。尤其於疫情爆發前六個月,研究結果發現搜尋數據在此時期具更高影響力。此外最後一項研究(研究6)顯示,使用時間序列之預測方法可提高線上搜尋模型之預測表現。
結論:本研究發現搜尋數據可作為預測每日新增新冠肺炎病例和死亡人數之解釋變數,建議研究人員可利用這些搜尋數據之框架以建立預測模型。本研究亦顯示線上搜尋模型在高度相關之區域、疫情爆發前六個月以及包含趨勢成分之模型中能獲更佳預測表現。
目標:研究目的主要於發展新冠肺炎預測方法,並分析網際網路相關查詢數據之可能用途(研究1-3),並評估線上搜尋模型於包括(研究4)位置(集群和非集群區域)、(研究5)時期(疫情爆發階段)和(研究6)模型種類這些不同情況下之預測表現。
方法:本研究使用來自 Google Trends 和 NAVER 搜尋引擎查詢數據以及新冠肺炎相關資料、Google 和 Apple 移動數據,並選擇台灣、菲律賓、美國和南韓為研究地點。在初步研究(研究1-3)中,研究使用時間序列、相關分析和地圖視覺化等方法。而在主要研究(4)中,採用正規化線性回歸模型、廣義線性模型和空間狀態模型做為預測模型之開發,並利用G 統計量來定義群聚樣式,以預測每日新增之新冠肺炎病例數和死亡人數(研究 5 和 6)。針對預測模型之開發,在第一例確診病例被報導後,將新冠肺炎資料分成疫情爆發後前3、6、12 和 18 個月之四個不同疫情時期之資料集。於資料分區時,取資料集前80%資料作為訓練集,其餘資料作為測試集。並使用均方根誤差、峰值日誤差和峰值幅度誤差作為模型預測能力之評估指標。
結果:研究結果顯示搜尋數據可用於定義(研究1)進行健康風險溝通之時機與地點,(研究2)可供民眾搜尋基本健康資訊類型,以及(研究3)民眾在新冠肺炎大規模流行初期對健康風險之看法。此外,本研究發現新冠肺炎病例數和網路搜尋關鍵字間呈中度至高度之相關性,研究結果亦顯示使用者搜尋之關鍵字可用於預測新冠肺炎之確診案例數。在評估不同(研究4)位置(集群和非集群區域)時,線上搜尋模型表現時顯示在美國不同州別和疫情時期之間,線上搜尋模型之預測能力存在差異。這代表在使用查詢數據時,必須在每個州別建立不同研究框架。基於發現搜尋數據與疫情具高度相關之情況下,使用者查詢數據可用於預測新冠肺炎。另外,在不同(研究5)時期(疫情爆發階段)下,本研究亦分析線上搜尋模型之預測能力,結果顯示搜尋數據對於預測每日新增新冠肺炎之病例數和死亡人數為有效變數。尤其於疫情爆發前六個月,研究結果發現搜尋數據在此時期具更高影響力。此外最後一項研究(研究6)顯示,使用時間序列之預測方法可提高線上搜尋模型之預測表現。
結論:本研究發現搜尋數據可作為預測每日新增新冠肺炎病例和死亡人數之解釋變數,建議研究人員可利用這些搜尋數據之框架以建立預測模型。本研究亦顯示線上搜尋模型在高度相關之區域、疫情爆發前六個月以及包含趨勢成分之模型中能獲更佳預測表現。