讓綠能觸手可及-根據區域微氣候資料預測發電量
主持人:東華大學資工系 顏士淨教授
協同主持人:東華大學光電系 白益豪教授
助理:東華大學資工系彭英茜
兼任助理:古李傑驊、黃聖文
競賽背景與目標
1
緣起
太陽能從民國97年代至111年,逐漸成為再生能源的翹楚
台電再生能源歷年發電佔比(單位 : 萬瓩)
台電再生能源發電詳細佔比
1
緣起
台電各能源之發電量(單位 : 億度)
燃氣
燃煤
核能
再生能源
燃油
216.3億度
在永續節能的意識抬頭下再生能源的發電量逐漸增加
2
情境
太陽能 | |
優點🡪節能減碳 | 缺點🡪發電不穩定 |
機種 | 啟動時間 |
燃氣 | >= 10 min |
燃煤-冷啟動 | >= 300 min(5 h) |
燃煤-熱啟動 | >= 30 min |
核能 | >= 1 day |
3
使用微氣候資料預測當天太陽光電發電量
5
資料來源或獲取資料方式
6
太陽能數據收集裝置
8方位風向感測儀器
太陽能數據收集裝置主體
風速感測儀器
目前已上線之裝置 | 東華理工頂樓 一號機 | 東華理工頂樓 二號機 | 東華理二 3樓教室陽台 | 東華理二 1樓 | 花蓮市 自家住宅 |
預計上線之裝置 | 東華美崙校區 | 小雨蛙生態民宿 農田 | 七星潭 | 德興棒球場 | 新北市 住宅 |
4
ESP32S | DHT22 | BH1750 | BMP280 | INA219 |
MCU | 溫濕度 | 光照度 | 大氣壓力 | 電源監測 |
| | | | |
太陽能數據收集裝置
裝置內部感測模組
5
資料儲存
訊息傳遞示意圖
使用Line Notify優點
1.能夠快速得知裝置周圍天氣數據
2.方便維護
3.可將訊息打包成 TXT檔 或 串接Script
Line Notify 畫面
Wi-Fi
資料處理
6
比賽方式
比賽規則 | |
文字說明 | 題目 :使用微氣候資料預測當天太陽光電發電量 提供每個裝置每分鐘的氣象數據,利用預測前一天至預測當天早上9:00之前的各項數據,預測當天9:00之後的每10分鐘發電瓦數,持續預測直至當天晚上5:00,共有48筆預測。 ※預測日的下一天需要跳過,從預測日往後算的第二天起算為新的一次 ※部分裝置在光照度低於20勒克斯時會進入休眠模式(約為晚上5:00~5:30) |
排名計算 | 將每一筆資料(為每10分鐘的平均瓦數)與正確資料相比並計算誤差(取絕對值),最後將所有誤差加總在一起,加總誤差值越小名次排序則越前面。 |
1-10月
數據
資料訓練
氣象數據
公開資料訓練示意圖
時間(整點) | 9/1 | 9/2 | 9/3 | 9/4 | 9/5 | 9/6 |
07~09 | 提供 | 提供 | 提供 | 提供 | 提供 | 提供 |
09~17 | 預測 | 預測 | 預測 |
10/27 | 10/28 |
提供 | 提供 |
預測 |
正式比賽階段預測示意圖
7
比賽資料數據
資料數據 | |
裝置數量 | 約20台 |
資料月份 | 113/01 ~ 113/11 |
資料時序 | 每分鐘 |
提供數據 | 1.風速(m/s) 2.大氣壓力(百帕) 3.溫度(攝氏) 4.相對濕度(百分比) 5.光照度(勒克斯) 6.發電量(瓦特) |
氣象局資料(每小時) | 使用者自行網路下載 |
8
競賽獎勵方式(以網頁公告為準)
教育部獎項(含獎狀和獎金)
計畫辦公室獎項(僅電子獎狀)
12
獎項名稱 | 名額 | 獎金 |
金牌 | 1 | 6萬元整 |
銀牌 | 1 | 4萬元整 |
銅牌 | 1 | 3萬元整 |
優等 | 2 | 2萬元整 |
佳作 | 8 | 1萬元整 |
趨勢科技贊助獎項
獎項名稱 | 名額 | 獎金 |
創意獎 | 5 | 2萬元整 |
| | |
競賽時程規劃(以網頁公告為準)
13
競賽 | ||
日期 | | 事件 |
2024/9/2– 2024/11/20 | | 報名時程 |
項目 | 時程 | 注意事項與說明 |
報名時程 | 2024/9/2– 2024/11/20 | 開放報名 |
競賽訓練集Training Dataset下載 | 2024/9/23 11:00 AM – 2024/11/28 | 競賽隊伍可下載競賽訓練集Training Dataset |
比賽正式開始�競賽訓練集Training Dataset更新、競賽測試集Test Dataset下載與訓練模型預測 | 2024/11/18 11:00 AM – 2024/11/28 |
|
結果發佈 | 2024/12/2 11:00 AM | 公佈 Private Leaderboard成績 |
上傳報告 | 2024/12/2 – 2024/12/9 | 優勝隊伍提交預測模型的說明文件、自製之訓練資料集、與程式碼 |
公佈最後名次 | 2025/1/7 16:00 AM | 公佈本次比賽的最終名次 |
頒獎典禮 | 2025年初(暫訂第一季) | 頒獎典禮將與初階賽及進階賽一同辦理,細節將另行公佈 |
讓綠能觸手可及-根據區域微氣候資料預測發電量
主持人:東華大學資工系 顏士淨教授
協同主持人:東華大學光電系 白益豪教授
助理:東華大學資工系彭英茜
兼任助理:古李傑驊、黃聖文
微氣候數據處理-程式介紹
微氣候數據處理-選擇裝置
透過「選擇裝置」的下拉式選單,
選擇要查看的裝置。
*文件不能有標題
Use the "選擇裝置" dropdown menu to
choose the device you want to view.
*The document must not contain headers.
微氣候數據處理-選擇月份
透過「選擇月份」的下拉式選單,
選擇要查看的月份。
Use the "選擇月份" dropdown menu to choose
the month you want to view.
微氣候數據處理-選擇日期
橘色方框代表著資料「完整」收集的一天
The orange box represents a day where data was
"completely" collected.
綠色方框代表著資料「不完整」收集的一天
The green box represents a day where data was
"incompletely" collected.
灰色方框代表著無資料
The gray box represents a day with no data.
當方框被點擊後,可顯示當天資料
When the box is clicked, the data
for that day will be displayed.
*「完整」收集的一天:此天資料包含著7:00~16:59(含),且每10分鐘都至少會有一筆氣候數據
*「無完整」收集的一天:此天有收集到資料,但氣候數據有遺失
微氣候數據處理-重新整理
按下「重新整理」按鈕可清空畫面,並重新
讀取氣候數據
Clicking the "重新整理" button will clear the
screen and reload the climate data.
微氣候數據處理-計算資料量
按下「計算資料量」按鈕會開始計算資料
的完整天數有幾天、不完整的天數有幾天
*計算時間稍久
Clicking the "計算資料量" button will start
calculating how many days have complete data
and how many days have incomplete data.
*The calculation may take some time.
微氣候數據處理-加入一天
先點擊方框,再按下「加入一天」按鈕會將
資料記錄到表單之中,才可以進行表單匯出
*可跨越月份選擇,但不可跨裝置選擇
First, click on a box, then press the "加入一天"
button to record the data into the form, allowing the
form to be exported.
*You can select across months, but not across devices.
微氣候數據處理-刪除一天
要使用刪除功能,需先點擊表單中要刪除的列,
再按下「刪除一天」的按鈕,即可成功刪除�
To use the delete function, first click on the row
in the form that you want to delete, then press
the "刪除一天" button to successfully remove it.
微氣候數據處理-表單匯出
其中有三個檔案,第 1 個檔案是僅有再表單出現過的天數,
且資料時間是從9:00至當天收集結束為止;第 2 個檔案是取出指定數據後
剩下的氣候數據;第 3 個檔案則是記錄匯出時所選擇的天數
There are three files :
ranging from 9:00 to the end of the day’s collection.
2. The second file consists of the remaining climate data after the specified data
has been extracted.
3. The third file records the days selected at the time of export.
1.
2.
3.
微氣候數據處理-更新資料
更新資料時,可以透過「數據庫」(捷徑) 或是 進入「source」資料夾,找到「SolarData」資料夾,
把新的氣候數據存入
When updating data, you can use the "數據庫" (shortcut) or enter the "source" folder, find the "SolarData" folder,
and save the new climate data there.
微氣候數據處理-更新資料
當按下 「重新整理」 或是 重新開啟程式 時,新的氣候數據就會被載入;與此同時可以看到
被取出的橘色方框資料變成了綠色方塊,資料的時間也是從9:00開始被取出
When the "重新整理" button is pressed or the program is reopened, the new climate data will be loaded. At the same
time, the previously extracted orange box data will turn into green boxes, with the data extraction starting from 9:00.
微氣候數據處理-比賽格式
當按下比「比賽格式」按鈕後,會跳出選擇檔案的頁面,此時選擇要轉檔成符合比賽格式的文件
*比賽格式 : 格式形同要比賽題目與答案之文件
When the "比賽格式" button is pressed, a file selection window will appear. At this point, choose the file you want to convert to match the competition format.
*Competition Format: The format should match the document containing both the competition questions and answers.
微氣候數據處理-比賽格式
資料轉檔後,會生成在「source」資料夾內
*生成的資料未包含標題
After the data is converted, it will be generated in the "source" folder.
*The generated data will not include headers.
微氣候數據處理-資料平均
先選擇要平均處理的裝置
First, select the device you want to process for averaging.
再來點選「資料平均」�Next, click on "資料平均".
微氣候數據處理-資料平均
選擇「是」,代表只處理完整一天的資料,取出9:00 - 16:59,並按照本次比賽之平均規則, 製作出新的氣候數據檔案�Selecting "Y" means only processing data for complete days, extracting data from 9:00 to 16:59, and generating a new climate data file according to the averaging rules of the current competition.
選擇「否」,代表會將資料取出7:00 - 8:59,並按照本次比賽之平均規則, 製作出新的氣候數據檔案�Selecting "N" means that the data from 7:00 to 8:59 will be extracted, and a new climate data file will be generated according to the averaging rules of the current competition.
微氣候數據處理-檔案評分
使用「檔案評分」功能,請先選擇標準答案文件
*匯入檔案時記得把標題刪掉,標準答案文件格式應該是 🡪 序號,答案
To use the "檔案評分" function, please first select the standard answer document.
*When importing the file, remember to remove the headers. The standard answer file format should be: serial number, answer.
微氣候數據處理-檔案評分
再來選預測答案文件,選擇完後,系統會給出分數
*匯入檔案時記得把標題刪掉,預測答案文件格式應該是 🡪 序號,答案
*分數僅供參考
Next, select the predicted answer document. After making your selection, the system will provide a score.
*When importing the file, remember to remove the headers. The predicted answer file format should be: serial number, answer.
*The score is for reference only.
微氣候數據處理-檔案評分
檔案評分完後,也會生成一個記錄個別誤差的文件供使用者核對
*分數僅供參考
After the file scoring is completed, a file recording individual errors will also be generated for the user to verify.
*The score is for reference only.
LSTM氣候數據預測-程式介紹
Python 版本 : 3.9
tensorflow_gpu 版本 : 2.6.0
搭建神經網路的結構
搭建全連接層
搭建LSTM層
搭建正則化層
加載已經訓練好的模型
進行科學運算
進行數據處理
管理文件和目錄
LSTM氣候數據預測-程式介紹
Python 版本 : 3.9
tensorflow_gpu 版本 : 2.6.0
將 Python 代碼劃分為可執行的「代碼區塊」
LSTM氣候數據預測-資料介紹
範例程式 用測試資料
範例程式用 平均後的訓練資料
LSTM氣候數據預測-資料介紹
代碼14碼 = 西元年(4碼)+月(2碼)+日(2碼)+時(2碼)+分(2碼)+裝置代碼(2碼)
發電量(四捨五入)
範例程式 用測試資料
LSTM氣候數據預測-資料介紹
範例程式 用訓練資料
(9:00 - 當天結束收集為止)
平均後的檔案格式 🡪 代碼14碼,風速,大氣壓力,溫度,濕度,光照度,發電量
2024-01-01 09:50
|
2024-01-01 09:59
資料平均
LSTM氣候數據預測-資料介紹
範例程式 用訓練資料
(7:00 – 8:59)
2024-01-01 07:50
|
2024-01-01 07:59
資料平均
平均後的檔案格式 🡪 代碼14碼,風速,大氣壓力,溫度,濕度,光照度,發電量
LSTM氣候數據預測-程式介紹
從不完整資料找到相同的一天
取得7:00-8:59 供12筆資料
預測此天 9:00-16:59 共48筆資料
計算出9600個答案(200天 * 48)
從題目解構出時間與裝置
LSTM氣候數據預測-程式介紹
返回當前工作目錄
載入CSV檔案到程式裡面
留下指定的欄位
LSTM氣候數據預測-程式介紹
LSTM氣候數據預測-程式介紹
從 12 開始計數,並且要數整個CSV的長度
資料加入X_train
資料加入Y_train
將python的原生陣列轉換成numpy陣列
LSTM氣候數據預測-程式介紹
資料列 |
0 |
1 |
2 |
3 |
4 |
5 |
6 |
7 |
8 |
9 |
10 |
11 |
12 |
13 |
X
Y
LookBackNum = 12
AllOutPut = 14
假設第一次進入迴圈 🡪 i = 12
X_train 新增一行( AllOutPut [12-12 : 12 , 0] )
Y_train 新增一行( AllOutPut [12 , 0] )
X從這裡開始數
Y從這裡開始數
行
列
行
列
LSTM氣候數據預測-程式介紹
資料列 |
0 |
1 |
2 |
3 |
4 |
5 |
6 |
7 |
8 |
9 |
10 |
11 |
12 |
13 |
X
Y
LookBackNum = 12
AllOutPut = 14
假設第二次進入迴圈 🡪 i = 13
X_train 新增一行( AllOutPut [13-12 : 13 , 0] )
Y_train 新增一行( AllOutPut [13 , 0] )
X從這裡開始數
Y從這裡開始數
行
列
行
列
LSTM氣候數據預測-程式介紹
X_train
Y_train
LSTM氣候數據預測-程式介紹
LSTM需要的訓練格式為 🡪 樣本數(Samples),時間步長(Timesteps),特徵數(Features)
X_train.shape[0] 🡪 行的長度
X_train.shape[1] 🡪 列的長度
LSTM氣候數據預測-程式介紹
建置 Sequential 模型
第一層🡪 LSTM層( 設定單元數量 , 是否輸出整個序列 , 輸入形狀( 時間步長(Timesteps) , 特徵數(Features) ) )
第二層🡪 LSTM層( 設定單元數量 )
第三層🡪正則化層( 設定要丟棄的神經元比率 )
第四層🡪全連接層( 設定要有幾個輸出 )
編譯模型( 設定優化器 , 設定誤差計算方式 )
擬合模型( 輸入 , 標籤 , 迭代次數 , 批次大小 )
LSTM氣候數據預測-程式介紹
匯入時間函式
設定時間格式
儲存訓練好的模型
LSTM氣候數據預測-程式介紹
改成訓練好的模型名稱
題目總共行數
LSTM氣候數據預測-程式介紹
把題目的裝置代號解析出來
從透過裝置代號找到
不完整一天的平均資料
從資料中找到相同的一天
並提取7:00~8:59的發電瓦數
總共12筆資料
LSTM氣候數據預測-程式介紹
要做48次
把12行的資料加進X_test
把X_test變成3維的形狀
把資料丟進模型進行數值預測
並以四捨五入的方式儲存預測值
LSTM氣候數據預測-程式介紹
要做48次
當每預測完一次
就把預測值加回inputs
設 i = 1
inputs[1:13]
設 i = 2
inputs[2:14]
LSTM氣候數據預測-程式介紹
因為每次都預測48筆
所以結束後conunt + 48
直至超出題目範圍
LSTM氣候數據預測-程式介紹
將預測值匯出成csv檔
LSTM & 迴歸分析氣候數據預測-程式介紹
Python 版本 : 3.9
tensorflow_gpu 版本 : 2.6.0
搭建神經網路的結構
搭建全連接層
搭建LSTM層
搭建正則化層
加載已經訓練好的模型
進行科學運算
進行數據處理
管理文件和目錄
加載Scikit-learn的回歸模型
進行正規化
儲存與載入模型
Python 版本 : 3.9
tensorflow_gpu 版本 : 2.6.0
將 Python 代碼劃分為可執行的「代碼區塊」
LSTM & 迴歸分析氣候數據預測-程式介紹
範例程式 用測試資料
範例程式用 平均後的訓練資料
LSTM & 迴歸分析氣候數據預測-資料介紹
代碼14碼 = 西元年(4碼)+月(2碼)+日(2碼)+時(2碼)+分(2碼)+裝置代碼(2碼)
發電量(四捨五入)
範例程式 用測試資料
LSTM & 迴歸分析氣候數據預測-資料介紹
範例程式 用訓練資料
(9:00 - 當天結束收集為止)
平均後的檔案格式 🡪 代碼14碼,風速,大氣壓力,溫度,濕度,光照度,發電量
2024-01-01 09:50
|
2024-01-01 09:59
資料平均
LSTM & 迴歸分析氣候數據預測-資料介紹
範例程式 用訓練資料
(7:00 – 8:59)
2024-01-01 07:50
|
2024-01-01 07:59
資料平均
平均後的檔案格式 🡪 代碼14碼,風速,大氣壓力,溫度,濕度,光照度,發電量
LSTM & 迴歸分析氣候數據預測-資料介紹
從不完整資料找到相同的一天
取得7:00-8:59 供12筆資料(每筆有5個特徵)
計算出9600個答案(200天 * 48)
從題目解構出時間與裝置
LSTM & 迴歸分析氣候數據預測-程式介紹
LSTM 預測資料(每筆有5個特徵)
預測此天 9:00-16:59 共48筆資料
迴歸分析5個特徵計算發電量
LSTM & 迴歸分析氣候數據預測-程式介紹
返回當前工作目錄
載入CSV檔案到程式裡面
留下指定的欄位
LSTM & 迴歸分析氣候數據預測-程式介紹
LSTM & 迴歸分析氣候數據預測-程式介紹
將陣列內的特徵都壓縮到0與1之間
並暫存成一個正規化模型
把檔案丟進模型內進行正規化
並生成一個新的陣列
正規化前
正規化後
LSTM & 迴歸分析氣候數據預測-程式介紹
從 12 開始計數,並且要數整個CSV的長度
資料加入X_train
資料加入Y_train
將python的原生陣列轉換成numpy陣列
LSTM & 迴歸分析氣候數據預測-程式介紹
列1 | 列2 | 列3 | 列4 | 列5 |
0 | 0 | 0 | 0 | 0 |
1 | 1 | 1 | 1 | 1 |
2 | 2 | 2 | 2 | 2 |
3 | 3 | 3 | 3 | 3 |
4 | 4 | 4 | 4 | 4 |
5 | 5 | 5 | 5 | 5 |
6 | 6 | 6 | 6 | 6 |
7 | 7 | 7 | 7 | 7 |
8 | 8 | 8 | 8 | 8 |
9 | 9 | 9 | 9 | 9 |
10 | 10 | 10 | 10 | 10 |
11 | 11 | 11 | 11 | 11 |
12 | 12 | 12 | 12 | 12 |
13 | 13 | 13 | 13 | 13 |
X
Y
LookBackNum = 12
AllOutPut = 14
假設第一次進入迴圈 🡪 i = 12
X_train 新增一行( AllOutPut [12-12 : 12 , :] )
Y_train 新增一行( AllOutPut [12 , :] )
X從這裡開始數
Y從這裡開始數
行
列
行
列
LSTM & 迴歸分析氣候數據預測-程式介紹
列1 | 列2 | 列3 | 列4 | 列5 |
0 | 0 | 0 | 0 | 0 |
1 | 1 | 1 | 1 | 1 |
2 | 2 | 2 | 2 | 2 |
3 | 3 | 3 | 3 | 3 |
4 | 4 | 4 | 4 | 4 |
5 | 5 | 5 | 5 | 5 |
6 | 6 | 6 | 6 | 6 |
7 | 7 | 7 | 7 | 7 |
8 | 8 | 8 | 8 | 8 |
9 | 9 | 9 | 9 | 9 |
10 | 10 | 10 | 10 | 10 |
11 | 11 | 11 | 11 | 11 |
12 | 12 | 12 | 12 | 12 |
13 | 13 | 13 | 13 | 13 |
X
Y
LookBackNum = 12
AllOutPut = 14
假設第二次進入迴圈 🡪 i = 13
X_train 新增一行( AllOutPut [13-12 : 13 , : ] )
Y_train 新增一行( AllOutPut [13 , : ] )
X從這裡開始數
Y從這裡開始數
行
列
行
列
LSTM & 迴歸分析氣候數據預測-程式介紹
X_train.shape[0] 🡪 行的長度
X_train.shape[1] 🡪 列的長度
LSTM需要的訓練格式為 🡪 樣本數(Samples),時間步長(Timesteps),特徵數(Features)
LSTM & 迴歸分析氣候數據預測-程式介紹
建置 Sequential 模型
第一層🡪 LSTM層( 設定單元數量 , 是否輸出整個序列 , 輸入形狀( 時間步長(Timesteps) , 特徵數(Features) ) )
第二層🡪 LSTM層( 設定單元數量 )
第三層🡪正則化層( 設定要丟棄的神經元比率 )
第四層🡪全連接層( 設定要有幾個輸出 )
編譯模型( 設定優化器 , 設定誤差計算方式 )
擬合模型( 輸入 , 標籤 , 迭代次數 , 批次大小 )
LSTM & 迴歸分析氣候數據預測-程式介紹
匯入時間函式
設定時間格式
儲存訓練好的模型
LSTM & 迴歸分析氣候數據預測-程式介紹
搭建一個回歸模型
訓練回歸模型
特徵正規化
儲存訓練好的模型
標籤
LSTM & 迴歸分析氣候數據預測-程式介紹
係數1
係數2
係數3
係數4
係數5
截距
風速
大氣壓力
溫度
濕度
光照度
LSTM & 迴歸分析氣候數據預測-程式介紹
改成訓練好的模型名稱
題目總共行數
LSTM & 迴歸分析氣候數據預測-程式介紹
把題目的裝置代號解析出來
從透過裝置代號找到
不完整一天的平均資料
從資料中找到相同的一天
並提取7:00~8:59的5個特徵
總共12筆資料
LSTM & 迴歸分析氣候數據預測-程式介紹
要做48次
把12行的資料加進X_test
把X_test變成3維的形狀
把資料丟進LSTM模型進行特徵預測
並加入陣列裡面
把預測的特徵丟進回歸模型進行發電量預測,並以四捨五入的方式儲存預測值
LSTM & 迴歸分析氣候數據預測-程式介紹
要做48次
當每預測完一次
就把預測值加回inputs
設 i = 1
inputs[1:13]
設 i = 2
inputs[2:14]
LSTM & 迴歸分析氣候數據預測-程式介紹
因為每次都預測48筆
所以結束後conunt + 48
直至超出題目範圍
LSTM & 迴歸分析氣候數據預測-程式介紹
將預測值匯出成csv檔
AICUP 報名流程教學
Start
步驟二
步驟三
步驟四:
點選報名競賽
步驟五:
填寫基本資料
僅
學校名稱(英文)、
科系名稱(英文)
非必填
其餘皆為必填
填寫完畢按
儲存個人資料
步驟六:
再次點選報名競賽
步驟七:
選擇
根據區域微氣候資料預測發電量競賽
步驟八:
選擇
立即組隊 Form a team!
步驟六
步驟七
步驟八
步驟九:
填寫表格
指導教授及課程代碼請視自身情況填寫。
基於學校課程要求而參與比賽的參賽者,請於報名系統填寫課程代碼、並依循該課程之組隊要求,以利課堂評分。
(續前頁)
填寫完畢後勾選
我同意參賽者使用條款
並點選 立即組隊
(若需組隊,僅隊長需點擊)
即可完成第一步報名
請前往報名頁面二
https://tbrain.trendmicro.com.tw/Competitions/CompetitionList
點選 Sign In
步驟十:
進行登入(請使用與報名系統一相同之帳號登入)
步驟十一:
填寫資料
並勾選 我同意
按下確認
確認後即報名成功
步驟十二:
點選根據區域微氣候資料預測發電量競賽進入競賽說明頁
請確認是不是與報名系統一所使用之信箱相同
步驟十二:
於說明頁中找到
根據區域微氣候資料預測發電量競賽-前測問卷
點選進入填寫
填寫完畢記得按送出
根據區域微氣候資料預測發電量
機器學習步驟
機器學習專案建構流程
90
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
機器學習專案建構流程
91
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
專案問題解析
例如:利用保險公司的客戶交易資料,開發機器學習系統達到「提升業績」的目標。
92
考量資料量多寡、軟硬體設備、投入人力資源等,評估專案開發的可行性。
機器學習專案建構流程
93
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
資料前處理
94
資料過濾
將資料中跟結果不相干的特徵資料過濾掉。
資料結構化
將半結構資料和非結構化資料都轉換成結構化資料。
資料正規化
將資料處理限定於一定範圍內,用於加速演算法的收斂
資料補齊
將資料表中空缺的欄位進行填補。
資料結構
以矩陣結構儲存在資料庫的資料,可以透過二維表格結構來顯示。
按照一定的結構儲存,但不是二維的表格結構。
未經整理過的資料。例如:圖片、文字、語音等。
95
機器學習專案建構流程
96
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
特徵工程
97
特徵向量化
將特徵量化,例如ID、性別、區域、職業等。
特徵重要性評估
每個特徵對於目標列的影響程度。例如可透過邏輯迴歸的模型係數進行判斷。
特徵衍生
利用現有的特徵進行某種組合,產生具有新含意的特徵。例如利用產品的銷售記錄和銷售時間,可以組合算出產品熱度。
特徵維度縮減
處理高維度數據時,挖掘關鍵欄位,用以減少輸入維度。
�目的在:�(1)確保特徵間的相互獨立�(2)減少計算量�(3)去除雜訊
機器學習專案建構流程
98
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
演算法選擇
99
例如:�分類演算法
分群演算法
迴歸演算法
文字處理演算法
常規演算法
例如:�深度神經網路
卷積神經網路
遞歸神經網路
深度學習演算法
機器學習專案建構流程
100
專案問題解析
資料前處理
特徵工程
模型訓練
模型評估
選擇演算法
模型訓練與評估
101
模型參數設定
輸入大小、模型結構、學習率和迭代次數等
模型參數設定
尋求效率更好的模型
模型參數設定
評估指標包含:�正確率(Accuracy)�精確率(Precision)�召回率(Recall)�F值(F-measure)等。
THE END.