1 of 1

訓練模型

研究方式

運用機器學習預測社群粉絲專頁中外部連結的真實性

Using Machine Learning to Predict The Authenticity of External Links in Community Fan Pages

指導教授:賴俊鳴 學生姓名:賴柏年、許絮婷、施盈琪

東海大學資訊工程學系

第56組

摘 要

隨著網路和社群媒體的發展,人人都可以發布各種訊息,而訊息洪流中,真假難辨,近年來也能夠看到因錯誤訊息而受害的案例。本專題基於 Cofact資料庫中被驗證真假之資料,使用CrowdTangle 截取 Facebook 粉絲專頁中,其發布擁有那些資料的貼文的詳細資訊。視覺化並觀察之後選擇部分特徵來做機器學習,並實驗其預測的準確度,希望能夠提供人們一個看到新資訊發表時的真偽參考。

資料來自經Cofact所驗證真假之外部連結,其範圍區間為 2016/12/172022/02/27,共取得33454筆資料,其中有22847筆外部連結,不重覆粉絲專頁及社團數則有27842個。此外又將外部連結分為 isRumor 與 notRumor兩類,分別占59.4%與40.6%,如下表一所示。

研究範圍

檔案名稱

筆數

備註

isRumor.csv

13591

 

notRumor.csv

9256

 

mixRumor.csv

22847

isRumornotRumor

merge.csv

33454

isRumornotRumor與其它未標記為RumornotRumor的資料

資料前處理

利用Cofact資料中的createdAt和URL透過CrowdTangle所提供的API爬取在FB上發布該URL的資料並存成JSON檔。

接著分別選用Page Id、Page Name以及Title作為目標特徵從JSON檔中取出,將其與isRumor和notRumor關聯。其中由於Title不是單一個單詞或字,因此使用CKIP斷詞做處理。

研究方式

關聯規則

Cofact & CrowdTangle

Titles

Page Names

Page IDs

CKIP 斷詞

Logistic Regression, KNN, SVC

  資料取得      前處理    模型訓練與預測

後續實際預測,我們抓取Cofact 2022/02/28至2022/06/17共366筆有效資料,使用先前訓練的Page Id模型,預測謠言與否並比對Cofact的判定結果計算準確率,我們的模型在LR 的部份擁有高達73.5%的準確率,如圖三所示。

研究成果

研究流程

 結 論

  研究中,我們試圖找出最適合用於預測未來出現的新資訊是否為謠言的模型。雖然有達到團隊的預期,但仍有進步空間,舉例來說,雖然Page Id的準確率最高,但Id本身無法從任兩者中發現關聯並無法像Page Name的文字中得到組織或是地緣關係等。此外,由於驗證資料僅來自Cofact,不夠全面。

  本著想要幫助民眾在媒體識讀的路上,能更安心地吸收所接觸到的知識的心,希望未來能夠研究出,預測更為準確、速度更快的模組,並將其建立成一個平台,供一般民眾使用。 

  研究主要採用三種方法做比較,分別為KNN、羅吉斯回歸 (LR)與SVC,先讀取JSON抓取所需特徵(Title、Page Name、Page Id、replyType),接著對有出現表情符號的特徵做處理,最後進行One Hot Encoding並標籤。

  其中Page Id的LogisticRegression準確率最高,可以看出無論是Page Name還是Title,在一定程度上都會因為語言不同,影響到後續的自然語言處理或是機器學習等資料處理階段,進而導致模型的準確率不佳,如圖二所示。

表一、各檔案數量及其說明

訓練模型

由於Page Id為唯一性,因此將其視為獨立事件,並使用關聯規則去觀察各個Page之間的關聯,如下表二所示。

研究方式

Page ID

支持度

提升度

16716330 v.s 19186645

0.24

2.79

19186645 v.s 17801895

0.21

3.05

表二、兩兩Page ID關聯