期中報告
從棲地環境與共現關係
推補台灣國家公園的
生態觀測盲區
以生物共同出現(co-occurrence)關係推測觀測資料的缺漏,
而非直接將未觀測紀錄視為物種不存在。
社13組_好問題:林語涵、黃寗堯、陳躍心、李若榛
01
問題意識
未觀測,不等於不存在
生物多樣性資料庫中的沒有紀錄,其實混合了兩種完全不同的意義
① 真實不存在
該物種確實不分布於此,屬於生態事實
② 資料空缺
物種可能存在,只是無人前往調查,屬於資料問題
4,258 格
七座公園中完全沒有任何生物紀錄的 1 公里網格
佔全部 7,148 格的
59.6%
這些空白不代表那裡沒有生物
只代表沒有人去過
02
現況診斷
0.4% 的網格佔了 57% 的紀錄
28 格
記錄最密集的網格數量
佔全部 7,148 格的 0.4%
57.0%
這 28 格佔全部紀錄的比例
前 5%(144 格)佔 82.5%
292,803
單一網格最高紀錄數(玉山)
全體中位數僅 7 筆
2,016 種
單一網格最高物種數
同一格內累積的物種數
各公園的網格涵蓋率
陽明山
150 / 150
100%
墾丁
396 / 400
99.0%
雪霸
828 / 853
97.1%
玉山
864 / 1,129
76.5%
台江
339 / 567
59.8%
澎湖南方四島
160 / 384
41.7%
東沙環礁
153 / 3,665
4.2%
[ 圖片區 ]
map_parks.png
七宮格網格紀錄數分布圖(灰色=無紀錄)
東沙環礁 3,665 格中僅 153 格有紀錄——海域公園幾乎是空白
03
期中成果
資料蒐集成果:243 萬筆觀測紀錄
各公園紀錄數
玉山
960,577
台江
576,529
墾丁
424,922
雪霸
221,713
陽明山
200,534
東沙環礁
24,664
澎湖南方四島
24,355
座標品質分級(本研究建立)
高(≤100 m)
8.5%
可做細緻空間分析
中(≤1 km)
30.9%
適用網格層級分析
未提供誤差
56.7%
原始資料未填,需保守處理
低(≤10 km 或僅 2 位小數)
3.0%
精度不足,建議剔除
極低(>10 km)與模糊化
0.6%
保育類刻意偏移,須排除
04
資料架構
四組資料整合至同一 1 公里網格
生物觀測
TaiBIF API v3
學名・中文名・分類階層
經緯度・縣市・地點
觀測年月日・數量
記錄者・資料集・授權
地形與地質
內政部 DTM 20m
農業部土壤圖
海拔・坡度
土壤質地與來源分級
氣候
WorldClim 2.1
ERA5・CoralTemp
年均溫・年降水
極端溫度・降水季節性
霜日・高溫日・海表溫
土地利用
國土利用調查
水系圖資
森林覆蓋率
土地利用分類
距河流距離・海岸屬性
05
方法(一)
分析技術:如何把共現關係轉成可計算的問題
①
建立位點—物種矩陣
以 1 公里網格為位點,僅採鑑定至種階層的紀錄。
納入條件:每格至少 50 筆紀錄 → 806 格;
每種至少出現於 20 格 → 1,581 種可建模
②
特徵工程
環境 23 項數值+3 項類別(獨熱編碼)
共現:1,581 維物種矩陣經奇異值分解壓至 30 維
(解釋變異 51.8%;計算目標種時先將其欄位歸零,避免答案外洩)
③
取樣努力量量化
紀錄數、調查年數、調查日數、資料集數、記錄者數
五項皆取對數後納入特徵,而非當成雜訊排除
④
模型與驗證
梯度提升分類器(HistGradientBoosting),逐物種各訓練一個
空間分塊交叉驗證:經緯度 0.05 度分組,共 120 塊,3 折
06
方法(二)
關鍵設計:把取樣努力量固定在高標
若不控制努力量,模型會學成「紀錄少的格子缺很多種」,所謂空缺分數其實只是紀錄數的倒數。
訓練時
努力量=該網格的真實值
讓模型學會「調查強度如何影響觀測結果」,
把偏差明確建模而非忽略
預測時
努力量統一設為第 90 百分位
約當 4,032 筆紀錄的調查強度。
消除各格調查強度差異,形成反事實比較
因此分數的定義是
若此網格被調查到與調查最徹底的地區同等強度,觀測到該物種的機率
僅對該物種目前未被觀測的網格輸出;分數高代表資料不完整,而非該處必有此物種
07
方法驗證
驗證:模型是否只是在複述「哪裡人多」
每個數字的意思
AUC 模型分辨「有/無此物種」的能力。0.5 等於瞎猜,1.0 為完美
0.916 完整模型的中位數,1,581 種逐一計算後取中位
0.770 僅用五項努力量指標的對照模型。此值偏高,本身即是取樣偏差嚴重的證據
+0.146 增益,即環境與共現帶來的額外解釋力
三道檢驗機制
1
對照組必須落敗
完整模型須勝過對照組 0.05 AUC 以上,否則該物種不輸出任何推測。1,581 種中 1,337 種通過(84.6%)
2
空間分塊交叉驗證
以 0.05 度分成 120 塊分組,不做隨機切分。氣候資料部分來自 25 km 粗網格,隨機切分會嚴重高估表現
3
遮蔽回收測試
隨機遮蔽已知出現紀錄,檢驗模型能否重新找回,作為對外說明的回收率指標
08
分析結果
初步結果:1,376 筆資料空缺推測
1,376 筆
被判定為資料空缺的
(網格 × 物種)組合
涉及 517 個網格
0.13%
佔全部可能組合的比例
806 格 × 1,337 種 ≈ 108 萬組合
1,337 種
通過驗證門檻的物種數
建模 1,581 種
類群差異:本方法對鳥類最有效
09
方法擴充
方法的盲點與修正:最大的空白原本不會被標出
共現法需要先看到一些物種才能推論還缺什麼。零紀錄網格沒有可條件化的觀測,結果反而偏向已有資料的地方
紀錄充分(806 格)
證據:環境條件 + 共現組合 → 資料空缺偵測
兩層證據互相佐證,可信度較高
紀錄稀少或為零(6,342 格)
證據:僅環境條件 → 環境適宜度推測
單層證據,須明確標示可信度較低
調查優先度 = 環境適宜度 × 資料匱乏程度
涵蓋 4,643 格(原 517 格),其中 2,554 格目前完全沒有任何紀錄
調查優先度前四名
網格
環境條件
現有紀錄
預期物種數
玉山_1118
798 m|坡度 38.8°
0 筆
106.7
玉山_1109
598 m|坡度 34.6°
0 筆
93.0
玉山_0136
2,646 m|坡度 26.8°
2 筆
97.6
台江_0479
0.5 m|平地
1 筆
83.5
表面效度:模型確實學到海拔梯度
玉山_0136(2,646 m)
冠羽畫眉、火冠戴菊等高山特有種
玉山_0076(2,660 m)
褐頭花翼等高山特有種
台江_0479(0.5 m)
紅鳩、珠頸斑鳩等平地鳩鴿
東沙環礁(環礁)
橫帶扁背魨等礁區魚類
10
研究限制
已知限制與適用邊界
資料本質
機會性資料而非系統性調查,紀錄密度受可及性主導。分析須以取樣努力量校正,不可直接視為物種豐富度
座標精度
56.7% 的紀錄未提供誤差,僅 8.5% 精度在 100 公尺內;保育類座標經刻意模糊化。已分六級標記
外推風險
訓練網格 741 格為陸域、僅 61 格為海域,卻須預測 1,917 個東沙海域網格,為 31 倍外推。海域結果應視為低可信度
假精度
東沙 1,917 格僅對應 72 種相異預測值——海域氣候源自 25 km 粗網格,數百個 1 km 格共用同一組數值
方法邊界
共現為統計關聯而非因果;對鳥類最有效(22% 物種產生 63% 空缺),對昆蟲幾乎無效。稀有種樣本不足無法建模
尚未完成
NDVI 未納入;遮蔽回收測試與實地驗證尚在規劃
11
網頁展示
後續工作
把「沒有紀錄」的空白,
轉譯成「應該去看」的清單。
補齊 NDVI 與植生指數
強化棲地描述,改善植物類群的解釋力
執行遮蔽回收測試
隨機遮蔽已知紀錄,量化模型的回收率
分類群個別調校
鳥類與植物的共現結構不同,應分開建模
產出優先調查清單
交付可實地驗證的網格與物種組合
資料來源:TaiBIF・內政部 DTM・農業部土壤圖・WorldClim 2.1・ERA5・NOAA CoralTemp