訓練模型
研究方式
運用機器學習預測社群粉絲專頁中外部連結的真實性
Using Machine Learning to Predict The Authenticity of External Links in Community Fan Pages
指導教授:賴俊鳴 學生姓名:賴柏年、許絮婷、施盈琪
東海大學資訊工程學系
第56組
摘 要
隨著網路和社群媒體的發展,人人都可以發布各種訊息,而訊息洪流中,真假難辨,近年來也能夠看到因錯誤訊息而受害的案例。本專題基於 Cofact資料庫中被驗證真假之資料,使用CrowdTangle 截取 Facebook 粉絲專頁中,其發布擁有那些資料的貼文的詳細資訊。視覺化並觀察之後選擇部分特徵來做機器學習,並實驗其預測的準確度,希望能夠提供人們一個看到新資訊發表時的真偽參考。
資料來自經Cofact所驗證真假之外部連結,其範圍區間為 2016/12/17至 2022/02/27,共取得33454筆資料,其中有22847筆外部連結,不重覆粉絲專頁及社團數則有27842個。此外又將外部連結分為 isRumor 與 notRumor兩類,分別占59.4%與40.6%,如下表一所示。
研究範圍
檔案名稱 | 筆數 | 備註 |
isRumor.csv | 13591筆 |
|
notRumor.csv | 9256筆 |
|
mixRumor.csv | 22847筆 | 含isRumor和notRumor |
merge.csv | 33454筆 | 含isRumor、notRumor與其它未標記為Rumor或notRumor的資料 |
資料前處理
利用Cofact資料中的createdAt和URL透過CrowdTangle所提供的API爬取在FB上發布該URL的資料並存成JSON檔。
接著分別選用Page Id、Page Name以及Title作為目標特徵從JSON檔中取出,將其與isRumor和notRumor關聯。其中由於Title不是單一個單詞或字,因此使用CKIP斷詞做處理。
研究方式
關聯規則
Cofact & CrowdTangle
Titles
Page Names
Page IDs
CKIP 斷詞
Logistic Regression, KNN, SVC
資料取得 前處理 模型訓練與預測
後續實際預測,我們抓取Cofact 2022/02/28至2022/06/17共366筆有效資料,使用先前訓練的Page Id模型,預測謠言與否並比對Cofact的判定結果計算準確率,我們的模型在LR 的部份擁有高達73.5%的準確率,如圖三所示。
研究成果
研究流程
結 論
研究中,我們試圖找出最適合用於預測未來出現的新資訊是否為謠言的模型。雖然有達到團隊的預期,但仍有進步空間,舉例來說,雖然Page Id的準確率最高,但Id本身無法從任兩者中發現關聯並無法像Page Name的文字中得到組織或是地緣關係等。此外,由於驗證資料僅來自Cofact,不夠全面。
本著想要幫助民眾在媒體識讀的路上,能更安心地吸收所接觸到的知識的心,希望未來能夠研究出,預測更為準確、速度更快的模組,並將其建立成一個平台,供一般民眾使用。
研究主要採用三種方法做比較,分別為KNN、羅吉斯回歸 (LR)與SVC,先讀取JSON抓取所需特徵(Title、Page Name、Page Id、replyType),接著對有出現表情符號的特徵做處理,最後進行One Hot Encoding並標籤。
其中Page Id的LogisticRegression準確率最高,可以看出無論是Page Name還是Title,在一定程度上都會因為語言不同,影響到後續的自然語言處理或是機器學習等資料處理階段,進而導致模型的準確率不佳,如圖二所示。
表一、各檔案數量及其說明
訓練模型
由於Page Id為唯一性,因此將其視為獨立事件,並使用關聯規則去觀察各個Page之間的關聯,如下表二所示。
研究方式
Page ID | 支持度 | 提升度 |
16716330 v.s 19186645 | 0.24 | 2.79 |
19186645 v.s 17801895 | 0.21 | 3.05 |
表二、兩兩Page ID關聯