Options
利用腫瘤基因表現預測膀胱癌化療反應
Other Title
Prediction of chemotherapeutic response in Bladder cancer with gene expression profiling
Type
thesis
Date Issued
2018-07-02
Author(s)
蔡家蓁
Advisor
張資昊
Subjects
系所名稱:醫學資訊研究所
Description
學位別:碩士
語文別:中文
指導教授:張資昊
口試委員:蘇家玉;吳育瑋
中文關鍵字:膀胱癌;化療反應;預測模組;基因表現
英文關鍵字:Bladder Cancer, Chemo-response, Prediction module;gene expression
語文別:中文
指導教授:張資昊
口試委員:蘇家玉;吳育瑋
中文關鍵字:膀胱癌;化療反應;預測模組;基因表現
英文關鍵字:Bladder Cancer, Chemo-response, Prediction module;gene expression
Abstract
膀胱癌在男性癌症發生率中排名10名,女性癌症發生率則為16名。在民國104年膀胱癌的死亡人數占全部惡性腫瘤的死亡人數的1.93%。
膀胱主要是儲存尿液中空囊狀的器官,主要結構由肌肉組成,而膀胱癌所生成的位置通常起始於膀胱的最內層。最常見的類型為移形上皮細胞癌(transitional cell carcinoma)約占所有膀胱癌的90%。主要發生的族群集中在老年人,其中男性得膀胱癌的比率大於女性2-3倍。膀胱癌的治療以手術治療者為最多,次之則為化學治療。然而化學治療並非每個人都能夠適用,治療後是否達到療效,都有待評估,因此需要建立一個化療反應的預測模組,使用TCGA的gene expression當中的RNA-seq為數據集來標記基因,確定哪些高表現基因對化療有較好的反應,進而從這些基因來評估患者是否適合化療。
此次研究方法採用TCGA中膀胱癌的RNA-seq的HTSeq-FPKM-UQ和HTSeq-Counts這兩種資料,使用first-time的資料,再使用TCGA中的臨床資料篩選分類成兩大類,分別為完全緩解(CR)219筆與不完全緩解(IR)134筆,最終得到的gene symbol數量為18,242筆。
將18,242筆gene symbol 進行差異表現基因的篩選,使用DESeq2來分析,DESeq2是R工具內的一個套件,主要是用來做基因表現量差異分析,挑選完後可得到3,478個差異表現基因。
運用上述前處理完的資料來進行Data mining,使用Weka作為Data mining的工具,匯入資料後先檢查資料是否正確,或需要更改類型。確認完資料後再使用Classifier來進行分類,所使用的Classifier為J48、RandomForest、SMO、NaiveBayes、IBK這五種分類器。其中SMO的準確度為76.24%,為這五種分類器中準確度最高的分類器。從Classifier比較資料中可以看到SMO的總體數值相對其他來得好,次之則為RandomForest。
膀胱主要是儲存尿液中空囊狀的器官,主要結構由肌肉組成,而膀胱癌所生成的位置通常起始於膀胱的最內層。最常見的類型為移形上皮細胞癌(transitional cell carcinoma)約占所有膀胱癌的90%。主要發生的族群集中在老年人,其中男性得膀胱癌的比率大於女性2-3倍。膀胱癌的治療以手術治療者為最多,次之則為化學治療。然而化學治療並非每個人都能夠適用,治療後是否達到療效,都有待評估,因此需要建立一個化療反應的預測模組,使用TCGA的gene expression當中的RNA-seq為數據集來標記基因,確定哪些高表現基因對化療有較好的反應,進而從這些基因來評估患者是否適合化療。
此次研究方法採用TCGA中膀胱癌的RNA-seq的HTSeq-FPKM-UQ和HTSeq-Counts這兩種資料,使用first-time的資料,再使用TCGA中的臨床資料篩選分類成兩大類,分別為完全緩解(CR)219筆與不完全緩解(IR)134筆,最終得到的gene symbol數量為18,242筆。
將18,242筆gene symbol 進行差異表現基因的篩選,使用DESeq2來分析,DESeq2是R工具內的一個套件,主要是用來做基因表現量差異分析,挑選完後可得到3,478個差異表現基因。
運用上述前處理完的資料來進行Data mining,使用Weka作為Data mining的工具,匯入資料後先檢查資料是否正確,或需要更改類型。確認完資料後再使用Classifier來進行分類,所使用的Classifier為J48、RandomForest、SMO、NaiveBayes、IBK這五種分類器。其中SMO的準確度為76.24%,為這五種分類器中準確度最高的分類器。從Classifier比較資料中可以看到SMO的總體數值相對其他來得好,次之則為RandomForest。