1 of 34

連續7年美國微軟Microsoft全球最有價值專家MVP/ 宏碁Acer雲教授物聯網全球語言版書籍作者/ LIFE-C關鍵能力實驗室創辦人/ 亞太經合會APEC青年科學節國家代表/ 中華民國十大傑出資訊人才/ 台灣學術網路傑出貢獻人員/ 旺宏科學獎特殊貢獻獎/ LiveABC互動英語雜誌專欄作家/ 博客來與金石堂暢銷書排行榜第1名作家/ 從事教育工作超過20年/ 至各機關、學校、企業已進行數百場演講/ 著有60本書……�李啟龍 博士(JASON哥)

購物籃關聯分析的重要概念與PYTHON程式實作

2 of 34

自我介紹(李啟龍 JASON哥)

  • 學經歷:
    • 國立臺灣科技大學資訊管理博士(2020年台科大資管系傑出校友)、國立臺灣大學資訊網路與多媒體研究所博士研究、國立交通大學經營管理碩士、國立臺灣師範大學資訊教育碩士
    • 教育部部定助理教授:國立臺灣科技大學(大數據分析與應用)、國立臺灣師範大學(作業系統)
    • 國立臺灣師大附中教學組長、資訊中心主任、圖書館主任、國中部主任、學務處主任、資訊室主任
    • 行政院VR虛擬實境行動車諮商委員、資訊科技學科中心諮詢委員、新北市科技輔導團指導教授
    • LiveABC互動英語雜誌科技教育管理TEM專欄作家、ZDNet名家專欄作家、STEAMagazine專欄作家
    • 北薪扶輪社、瑞芳扶輪社、亞東扶輪社榮譽社友
    • 經常受邀進行講座 (英業達、微軟、日盛投顧、北捷、海巡署、Yahoo、HP、IBM、眾勤會計師事務所...等)
    • 著有60本書,並有物聯網書籍翻譯成全球語言版本

2

3 of 34

講綱:

  • 巨量資料與資料科學
  • 關聯規則與購物車分析
  • 用Python進行購物車品項關聯分析

3

4 of 34

�巨量資料�與資料科學

4

5 of 34

生活周遭的一些轉變

  • Google關鍵字的修正與建議
  • 影音網站(如 Netflix 網飛或愛奇藝)的影片推薦
  • 亞馬遜找書買書的推薦
  • 語音助理的語音識別與回應
  • Google 語言翻譯和語音輸入
  • 社群網站的「你可能認識的朋友」
  • 精準的網頁廣告投放

5

6 of 34

大數據時代的發展

  • 人類社會資訊化行動化之後的必然趨勢
  • 物聯網時代的來臨
  • 人工智慧、機器學習和資料探勘技術成熟
  • 大數據的效用原本在某些少數行業獲得驗證,逐漸推廣至各行各業

6

7 of 34

巨量資料 BIG DATA 名稱的由來

  • 2008 年 9 月 Nature 雜誌就以「BIG DATA」二字當封面
  • 美國麥肯錫全球研究院(MGI, McKinsey Global Institute) 於 2011 年 6 月 發 布 的 一 篇 文 章
    • 「Big data: The next frontier for innovation, competition, and productivity」(大數據:創新、競爭與生產力的下一個新尖端領域)

7

8 of 34

巨量資料

即便每個人物圖案都可以代表10,000 人甚至更多,但充其量也只是很大的數字,並沒有太大的實用性。

9 of 34

巨量資料

    • 然而若每個人帶著其他參數加入資料庫,情況就有所不同了。

擁有眾多特徵的資料相對上比較能夠產生價值。

10 of 34

何謂大數據(BIG DATA)

  • 大數據就是在巨量且快速變動多元訊息中,抽出有用的真實數據進行分析,並預測後續的發展,產生有價值的應用。
  • 大數據的5V特徵是資料量大(Volume)、速度快(Velocity)和多樣性高(Variety),再加上兩個限制條件,真實性(Veracity)和價值(Value)。

10

11 of 34

11

12 of 34

大數據時代的思維

  • 採用全數不用抽樣:由於大數據演算法和電腦運算能力的發展逐漸成熟,實現「全數」的計算變成可能,更貼近全體的真實樣貌。
  • 容許不精確:現在不再一味追求精確性,而是樂於接受資料的紛亂與複雜。例如:目測1大袋1元錢幣、Google導航。
  • 重視相關性:我們可以更容易與方便分析事物的相關性,並進一步掌握預測的可能性。例如:亞馬遜書店的協同過濾推薦機制、洛杉磯警方的預防犯罪系統PredPol(讓犯罪率下降36%)、Netflix的影片觀看75%都是系統推薦來的。

12

臨檢臨檢1影片 新聞臨檢1影片 新聞 臨檢2影片

13 of 34

GOOGLE導航

13

14 of 34

大數據的負面問題

  • 我們的數位足跡(Digital Trace)都被貼標籤了!在大數據時代,記憶變成常態。即使刪除,仍被搜尋引擎留下索引檔。(ex:喝醉的海盜
  • 其他問題
    • 數位視野(客製化服務與搜尋)
    • 資料濫用(資料擁有者的問題)
    • 資料安全(駭客的問題)
    • 資料品質(包括:真實性、完整性與一致性)
    • 責任問題(預測錯誤時的責任問題)

14

15 of 34

影片充電站:TED 演講:不只大數據,更要好數據(15:51)

16 of 34

資料科學

  • 近來由於巨量資料興起加上人工智慧進展快速,因而相關領域的研究通常被集合歸類稱為資料科學(Data Science),
  • 資料科學由「提出問題」出發,然後進行資料收集、資料量化、處理資料、選擇模型等方法來幫助我們理解問題及驗證假設,最後提出觀察結果或解決方案,目的不僅僅是為了商業價值,也期望能對社會的進步有所貢獻。
  • 資料科學在各行各業都已經有很多有效的應用,例如美國職棒、職籃隊伍幾乎內部都有資料科學家,他們會根據球的位置、球員的位置,跳多高、跳的角度等,來擬定有效的作戰策略,或是分析球員體能表現,並可作為球隊簽約時的重要決策依據。

16

17 of 34

資料科學家

  • 《哈佛商業評論》:是 21 世紀最吸引人/性感(sexiest)的職業
  • 資料科學家是未來 10 年 IT 業界最重要的人才。
  • 將堆積如山的資料爬梳分析,善用數學、統計、資料探勘、機器學習理論和工具,從千絲萬縷的交錯訊息中,找到隱藏其中的規則和樣態,甚至建立數學模式來對事物進行預測
  • 將所得有價值的結論用簡單易懂的視覺形式傳達給決策者,讓他們在業務的執行決策上獲得助益,使企業經營更上一層樓。

17

18 of 34

資料科學家的跨領域知識

18

19 of 34

資料科學家的跨領域知識(續)

1. 電腦科學

    • 「電腦科學」知識可能包括軟體工程、資訊系統開發、資料分析程式語言(如Scala、Java、Python、R 等 )、 分 散 式 資 料 處 理 技 術(Hadoop、Spark、Storm 等)、非結構化資料庫(NoSQL 族群)、平行處理、人工智慧/機器學習/資料探勘演算法開發、視覺化技術的應用等。

2. 數學

    • 「數學」知識可能包括建立數學模式、線性代數、作業研究、統計學、離散數學、組合數學、圖學、人工智慧/機器學習/資料探勘模式的推導和最佳化等。

3. 領域知識

    • 「領域知識」可能包括專案管理、商業知識(財務經濟、市場行銷、消費者行為、供應鏈等)、工程知識(電機、電子、土木、核能等)、醫藥、生物、科學知識等。

19

20 of 34

資料科學家「成功」的特質

  • 創業精神:以數據為中心開發出具有創意的產品和服務,有可能是過去所不曾想過和做過的,這種創造新產品和服務的創業精神正是資料科學家的天職之一。像過去Google、Amazon、Facebook 等公司透過各個面向的資料收集和分析,催生了新型態的網路公司及服務,都是透過資料科學家孜孜不倦努力的結果。
  • 好奇心:規模龐大、類型繁多和迅速變化流動的大數據,背後到底有什麼神祕的知識隱藏其中,需要一個充滿好奇心、想像力豐富的資料科學家方能一窺究竟。成功的資料科學家不可以眼光如豆,而必須具有廣泛領域的知識、好學的精神、敏銳的觀察力和豐沛的想像力,通過對各方面領域知識的整合及分析,才能發現空前絕後的觀點。
  • 溝通能力:在資料收集、整理、分析和建模過程中,免不了要與其他領域專家進行業務溝通,並且在大數據分析得到結果之後,還需要將結果推廣和落實在企業的業務流程上,因此,以資料為中心的溝通就變得非常重要。

20

21 of 34

�關聯規則與�購物車分析

21

22 of 34

關聯分析的例子:購物車分析

    • 在眾多資料探勘技術中,最容易理解的可算是關聯分析,而其最經典也容易應用的案例就是「購物車分析」。

購物車分析是關聯分析中的常見案例。

23 of 34

關聯(ASSOCIATION)分析

  • 關聯分析指的是找尋資料項目之間有意義的關聯關係, 其使用關聯規則(association rule)的形式(如X⇒Y)來描述,X稱為先行;Y稱為結果,X和Y 並非因果關係,只是一種相關性的描述,即X不必然導致Y 的發生。
  • 人類社會中,當某一個事件發生,其他事件也伴隨發生,這樣的一個關係叫做關聯,這種呈現事件之間相互關聯的知識稱為關聯型知識。例如中國的二十四節氣代表農民在觀察天地與大自然之後所歸納的一些關聯型知識,其中有些是「節氣現象」隱含「會發生什麼事」的知識,例如「驚蟄聞雷」⇒「稻穀豐收」。
  • 驚蟄(春雷初響驚醒了蟄伏中的蟲子)當天打雷,表示季節時序正常、當年風調雨順,因此又是稻穀豐收的一年,但它不表示因為打雷促進了稻穀的成長。

23

24 of 34

  • 關聯分析應用在零售業的場域,就是大家所熟悉的購物籃分析(market basket analysis),即根據顧客每一次購物的商品組合,找出哪一些商品經常被一起購買。例如「啤酒和尿布」之間的關聯是大家所熟悉的Walmart 經典案例,找出經常被同時購買的商品組合規則,可以依此訂定出適當的行銷活動和決策。
  • 關聯分析的核心步驟就是頻繁項集(frequent itemset)的挖掘,所謂頻繁項集是指出現次數最頻繁的項目組合,常用的頻繁項集挖掘演算法如Apriori演算法。

24

25 of 34

關聯分析的例子:購物車分析

定義問題

顧客每次結帳時,結帳櫃台都會將此次購物的所有資料存入資料庫。

選擇方法

採用關聯規則分析求解。

X ⇒ Y 代表買了 X 就會買 Y 的關聯規則。

26 of 34

  • 然後分別計算支援度S(Support)

信賴度C(Confidence),定義如下:

支援度S( X ⇒ Y ) = ( X 和Y 同時出現的次數 ) / 所有交易筆數

信賴度C( X ⇒ Y ) = ( X 和Y 同時出現的次數 ) / X 出現的次數

信賴度C( Y ⇒ X ) = ( X 和Y 同時出現的次數 ) / Y 出現的次數

26

27 of 34

關聯分析的例子:購物車分析

實作與分析

實作:假設我們從 5 次的顧客結帳中,收集到 5 筆交易記錄:

交易筆數

編號項目

T1

沙茶醬、豆皮、茼蒿

T2

沙茶醬、茼蒿

T3

沙茶醬、牛肉片、茼蒿

T4

冬粉、沙茶醬

T5

冬粉、牛肉片

28 of 34

關聯分析的例子:購物車分析

    • 以上表為例,我們列舉幾個例子計算如下:

支援度 S ( 沙茶醬 ⇒ 茼蒿 ) = 3 / 5 = 0.6

支援度 S ( 冬粉 ⇒ 沙茶醬 ) = 1 / 5 = 0.2

信賴度 C ( 沙茶醬 ⇒ 茼蒿 ) = 3 / 4 = 0.75

沙茶醬和茼蒿同時出現次數

總筆數

沙茶醬和茼蒿同時出現次數

沙茶醬出現次數

29 of 34

關聯分析的例子:購物車分析

    • 將所有可能的組合都計算完畢後,可得到如下表的結果:

關聯規則 X

Y

支援度S

信賴度C

沙茶醬

茼蒿

0.6

0.75

茼蒿

沙茶醬

0.6

1

冬粉

沙茶醬

0.2

0.5

茼蒿

豆皮

0.2

0.33

豆皮

茼蒿

0.2

1

豆皮

牛肉片

0

0

30 of 34

  • 小結:以上規則是由歷史資料導出的結論,可用來預測顧客未來的消費行為,而且當資料量愈大且愈接近目前時間時,預測的準確率也應該會愈高。
  • 精進:事實上,支援度S及信賴度C會隨著資料不斷輸入增加而產生新的值,因此,經理人應定時重新更新並檢視規則庫,才能找出最適當的商品擺設方式。

30

31 of 34

�用PYTHON進行購物車品項關聯分析

31

32 of 34

影片充電站:關聯規則的學習與Apriori 演算法�(12:51)

33 of 34

總結

  • 大人機時代(BAR Era):數據、工智慧、器人自動化。
  • 先驗演算法(Apriori Algorithm)是數據探勘中的經典算法,可以用於各式各樣的應用程式,如影片推薦引擎,或是在包含大量交易資料的數據庫中找出規則,讓客戶更容易在商店中購買所需商品,增加市場的銷售量。
  • 請注意關聯規則必須是有跡可循的,也就是必須是基於某些因素(例如:人類心理學、人類行為學)而導致的現象,若透過關聯規則進行純機率的預測是沒有意義的,關聯規則不能預測純機率問題

33

34 of 34

CONTACT INFORMATION

Email: jet.jason@gmail.com

FB: https://www.facebook.com/jason.lee.687

WebSite: https://sites.google.com/view/jasontem/

粉絲頁:科技博士Jason哥� 的TEM世界

34