1 of 13

期中報告

從棲地環境與共現關係

推補台灣國家公園的

生態觀測盲區

以生物共同出現(co-occurrence)關係推測觀測資料的缺漏,

而非直接將未觀測紀錄視為物種不存在。

社13組_好問題:林語涵、黃寗堯、陳躍心、李若榛

2 of 13

01

問題意識

未觀測,不等於不存在

生物多樣性資料庫中的沒有紀錄,其實混合了兩種完全不同的意義

① 真實不存在

該物種確實不分布於此,屬於生態事實

② 資料空缺

物種可能存在,只是無人前往調查,屬於資料問題

4,258 格

七座公園中完全沒有任何生物紀錄的 1 公里網格

佔全部 7,148 格的

59.6%

這些空白不代表那裡沒有生物

只代表沒有人去過

3 of 13

02

現況診斷

0.4% 的網格佔了 57% 的紀錄

28 格

記錄最密集的網格數量

佔全部 7,148 格的 0.4%

57.0%

這 28 格佔全部紀錄的比例

前 5%(144 格)佔 82.5%

292,803

單一網格最高紀錄數(玉山)

全體中位數僅 7 筆

2,016 種

單一網格最高物種數

同一格內累積的物種數

各公園的網格涵蓋率

陽明山

150 / 150

100%

墾丁

396 / 400

99.0%

雪霸

828 / 853

97.1%

玉山

864 / 1,129

76.5%

台江

339 / 567

59.8%

澎湖南方四島

160 / 384

41.7%

東沙環礁

153 / 3,665

4.2%

[ 圖片區 ]

map_parks.png

七宮格網格紀錄數分布圖(灰色=無紀錄)

東沙環礁 3,665 格中僅 153 格有紀錄——海域公園幾乎是空白

4 of 13

03

期中成果

資料蒐集成果:243 萬筆觀測紀錄

各公園紀錄數

玉山

960,577

台江

576,529

墾丁

424,922

雪霸

221,713

陽明山

200,534

東沙環礁

24,664

澎湖南方四島

24,355

座標品質分級(本研究建立)

高(≤100 m)

8.5%

可做細緻空間分析

中(≤1 km)

30.9%

適用網格層級分析

未提供誤差

56.7%

原始資料未填,需保守處理

低(≤10 km 或僅 2 位小數)

3.0%

精度不足,建議剔除

極低(>10 km)與模糊化

0.6%

保育類刻意偏移,須排除

5 of 13

04

資料架構

四組資料整合至同一 1 公里網格

生物觀測

TaiBIF API v3

學名・中文名・分類階層

經緯度・縣市・地點

觀測年月日・數量

記錄者・資料集・授權

地形與地質

內政部 DTM 20m

農業部土壤圖

海拔・坡度

土壤質地與來源分級

氣候

WorldClim 2.1

ERA5・CoralTemp

年均溫・年降水

極端溫度・降水季節性

霜日・高溫日・海表溫

土地利用

國土利用調查

水系圖資

森林覆蓋率

土地利用分類

距河流距離・海岸屬性

6 of 13

05

方法(一)

分析技術:如何把共現關係轉成可計算的問題

①

建立位點—物種矩陣

以 1 公里網格為位點,僅採鑑定至種階層的紀錄。

納入條件:每格至少 50 筆紀錄 → 806 格;

每種至少出現於 20 格 → 1,581 種可建模

②

特徵工程

環境 23 項數值+3 項類別(獨熱編碼)

共現:1,581 維物種矩陣經奇異值分解壓至 30 維

(解釋變異 51.8%;計算目標種時先將其欄位歸零,避免答案外洩)

③

取樣努力量量化

紀錄數、調查年數、調查日數、資料集數、記錄者數

五項皆取對數後納入特徵,而非當成雜訊排除

④

模型與驗證

梯度提升分類器(HistGradientBoosting),逐物種各訓練一個

空間分塊交叉驗證:經緯度 0.05 度分組,共 120 塊,3 折

7 of 13

06

方法(二)

關鍵設計:把取樣努力量固定在高標

若不控制努力量,模型會學成「紀錄少的格子缺很多種」,所謂空缺分數其實只是紀錄數的倒數。

訓練時

努力量=該網格的真實值

讓模型學會「調查強度如何影響觀測結果」,

把偏差明確建模而非忽略

預測時

努力量統一設為第 90 百分位

約當 4,032 筆紀錄的調查強度。

消除各格調查強度差異,形成反事實比較

因此分數的定義是

若此網格被調查到與調查最徹底的地區同等強度,觀測到該物種的機率

僅對該物種目前未被觀測的網格輸出;分數高代表資料不完整,而非該處必有此物種

8 of 13

07

方法驗證

驗證:模型是否只是在複述「哪裡人多」

每個數字的意思

AUC 模型分辨「有/無此物種」的能力。0.5 等於瞎猜,1.0 為完美

0.916 完整模型的中位數,1,581 種逐一計算後取中位

0.770 僅用五項努力量指標的對照模型。此值偏高,本身即是取樣偏差嚴重的證據

+0.146 增益,即環境與共現帶來的額外解釋力

三道檢驗機制

1

對照組必須落敗

完整模型須勝過對照組 0.05 AUC 以上,否則該物種不輸出任何推測。1,581 種中 1,337 種通過(84.6%)

2

空間分塊交叉驗證

以 0.05 度分成 120 塊分組,不做隨機切分。氣候資料部分來自 25 km 粗網格,隨機切分會嚴重高估表現

3

遮蔽回收測試

隨機遮蔽已知出現紀錄,檢驗模型能否重新找回,作為對外說明的回收率指標

9 of 13

08

分析結果

初步結果:1,376 筆資料空缺推測

1,376 筆

被判定為資料空缺的

(網格 × 物種)組合

涉及 517 個網格

0.13%

佔全部可能組合的比例

806 格 × 1,337 種 ≈ 108 萬組合

1,337 種

通過驗證門檻的物種數

建模 1,581 種

類群差異:本方法對鳥類最有效

10 of 13

09

方法擴充

方法的盲點與修正:最大的空白原本不會被標出

共現法需要先看到一些物種才能推論還缺什麼。零紀錄網格沒有可條件化的觀測,結果反而偏向已有資料的地方

紀錄充分(806 格)

證據:環境條件 + 共現組合 → 資料空缺偵測

兩層證據互相佐證,可信度較高

紀錄稀少或為零(6,342 格)

證據:僅環境條件 → 環境適宜度推測

單層證據,須明確標示可信度較低

調查優先度 = 環境適宜度 × 資料匱乏程度

涵蓋 4,643 格(原 517 格),其中 2,554 格目前完全沒有任何紀錄

調查優先度前四名

網格

環境條件

現有紀錄

預期物種數

玉山_1118

798 m|坡度 38.8°

0 筆

106.7

玉山_1109

598 m|坡度 34.6°

0 筆

93.0

玉山_0136

2,646 m|坡度 26.8°

2 筆

97.6

台江_0479

0.5 m|平地

1 筆

83.5

表面效度:模型確實學到海拔梯度

玉山_0136(2,646 m)

冠羽畫眉、火冠戴菊等高山特有種

玉山_0076(2,660 m)

褐頭花翼等高山特有種

台江_0479(0.5 m)

紅鳩、珠頸斑鳩等平地鳩鴿

東沙環礁(環礁)

橫帶扁背魨等礁區魚類

11 of 13

10

研究限制

已知限制與適用邊界

資料本質

機會性資料而非系統性調查,紀錄密度受可及性主導。分析須以取樣努力量校正,不可直接視為物種豐富度

座標精度

56.7% 的紀錄未提供誤差,僅 8.5% 精度在 100 公尺內;保育類座標經刻意模糊化。已分六級標記

外推風險

訓練網格 741 格為陸域、僅 61 格為海域,卻須預測 1,917 個東沙海域網格,為 31 倍外推。海域結果應視為低可信度

假精度

東沙 1,917 格僅對應 72 種相異預測值——海域氣候源自 25 km 粗網格,數百個 1 km 格共用同一組數值

方法邊界

共現為統計關聯而非因果;對鳥類最有效(22% 物種產生 63% 空缺),對昆蟲幾乎無效。稀有種樣本不足無法建模

尚未完成

NDVI 未納入;遮蔽回收測試與實地驗證尚在規劃

12 of 13

11

網頁展示

13 of 13

後續工作

把「沒有紀錄」的空白,

轉譯成「應該去看」的清單。

補齊 NDVI 與植生指數

強化棲地描述,改善植物類群的解釋力

執行遮蔽回收測試

隨機遮蔽已知紀錄,量化模型的回收率

分類群個別調校

鳥類與植物的共現結構不同,應分開建模

產出優先調查清單

交付可實地驗證的網格與物種組合

資料來源:TaiBIF・內政部 DTM・農業部土壤圖・WorldClim 2.1・ERA5・NOAA CoralTemp