野境有跡
WILD TRACES
用資料找出
下一次最值得補查的地方
野境有跡
臺灣保育哺乳類資料缺口與補查優先度決策地圖
我們不是在找哪裡沒有動物;
我們在找哪些地方仍沒有被充分看見。
CMGI vNext|Phase 1
稜鏡實驗室|臺南市立家齊高中
圖片:Abu0804(CC BY-SA 3.0)|資料定位:本研究 Phase 1 data lock
02 / 研究動機
一張紀錄地圖,為什麼不夠?
公開資料中的「沒有看到」,可能有兩種完全不同的原因。
A
真的沒有相關紀錄
資料尚未收錄,或該區目前確實少有可查到的公開紀錄。
B
原本就很少有人觀察
可達性、季節、調查資源與來源偏誤,都可能讓同一個地方留白。
所以,我們不直接把資料空白翻譯成「沒有動物」。
臺灣穿山甲|Manis pentadactyla pentadactyla
資料:TBIA;本研究整理|圖片:Licheng Shih(CC BY 4.0)
野境有跡
WILD TRACES
研究問題 / RESEARCH QUESTION
我們真正想回答的是:下一次,應該先去哪裡補查?
不是預測動物存在,而是把不均勻的觀察證據轉成可驗證的補查順序。
03 / 22
→
→
01
看見多少
觀察覆蓋度(Observation Coverage)
先判斷每一格有多少觀察基礎。
02
不知道多少
觀察努力校正缺口(Effort-adjusted Gap)
在相近觀察條件下,比較觀察值與期望值。
03
去哪裡補查
保育哺乳類補查優先度指數(CMGI)
讓高潛力且高缺口的地方優先被看見。
SEE → KNOW → DECIDE
研究定位:公開出現紀錄(Occurrence Records)的資料缺口;不等同族群量或棲地存在機率
野境有跡
WILD TRACES
資料 / DATA
五類資料與空間骨架,各自回答不同問題
從物種紀錄、分類標準到棲地與可近性資訊,統一放進 5 km 空間框架中分析。
04 / 22
公開成果皆依資料授權與敏感物種保護規範處理,對外僅呈現聚合網格,不公開原始精準點位。
資料與空間骨架:TBIA、TaiCOL、5 km 陸域網格、保護區/國土利用、步道/道路|系統角色不等於直接計分
資料/空間來源
系統角色
實際用途
TBIA
主物種紀錄來源
年度分布、紀錄密度、時間缺口與物種出現紀錄分析
TaiCOL
物種分類與名稱標準
統一學名、中文名與 taxonID,避免跨資料來源名稱不一致
5 km 陸域網格
統一空間分析單位
將不同來源資料聚合至相同尺度,兼顧分析一致性與敏感物種位置保護
保護區/國土利用
棲地與保育環境資訊
提供棲地潛力、保育相關性與空間背景資訊;支援 Potential 相關分析
步道/道路
補查可近性資訊
協助判斷實地補查的可達性、調查入口與現場條件,作為補查決策輔助資訊
野境有跡
WILD TRACES
資料處理 / DATA PIPELINE
先建立完整臺灣,再把紀錄放進固定 5 km 網格
原始點位無法直接比較;固定分析母體,才能保留真正的零紀錄格。
05 / 22
→
→
→
→
RAW
1,600,520
原始哺乳類紀錄
CLEAN
1,577,040
座標與分析範圍 QA 後
DEDUPE
1,577,037
確定性去重後
GRID
1,712
固定 5 km 陸域網格
AGGREGATE
8,560
5 個年層的格網單元
為什麼先建完整網格?
若只從有紀錄的點位開始,中央山脈與低紀錄區會從分析中消失。
public-safe aggregate
輸出只有 5 km 網格、年層與統計摘要;不公開原始精準點位。
資料:CMGI vNext Phase 1 ingestion and deduplication QA;固定 5 km 分析母體
野境有跡
WILD TRACES
方法一 / METHOD 1
Observation Coverage:先問每個網格「被看了多少」
Mᵢ 是全部哺乳類紀錄數;它是 observation effort proxy,不是實際調查時數。
06 / 22
先做什麼
先數每一格的全部哺乳類紀錄 Mᵢ。數量越多,代表這格被觀察、回報或被資料系統捕捉的機會通常越高。
Eᵢ = log(1 + Mᵢ)
Coverageᵢ = scale₀₋₁(Eᵢ)
•
① 先數 Mᵢ:全部哺乳類紀錄
這是每一格「被看多少」的共同起點。
•
② 再算 Eᵢ = log(1 + Mᵢ)
壓縮熱門地點長尾,避免少數超大量紀錄主宰尺度。
•
③ 最後轉成 0–1 相對覆蓋度
0 接近低觀察基礎;1 接近相對高觀察基礎。
0
1
低觀察基礎
相對高觀察基礎
方法界線:observation effort proxy,不是實際調查時數或相機陷阱日|下一步:用準二項平均模型(Model F)估計 μᵢ
野境有跡
WILD TRACES
方法銜接 / METHOD BRIDGE
從「被看多少」到「應該看到多少」
先建立觀察基礎,再用準二項平均模型(Model F|最終採用)估計期望值,最後與實際紀錄比較。
07 / 22
→
→
→
→
被看多少
Mᵢ
全部哺乳類紀錄�這裡被看多少
建立基礎
Eᵢ
log(1 + Mᵢ)�壓縮並標準化
準二項平均模型
(Model F)
μᵢ
在相近觀察基礎下�估計合理期望
實際看到
Yᵢ
實際保育類紀錄�這裡看到多少
比較
μᵢ − Yᵢ
期望高於實際時�形成正短缺
三個符號,一句話記住
Mᵢ 是觀察基礎;μᵢ 是模型期望;Yᵢ 是實際觀察。
台上講法
先看多少 → 再算應有多少 → 最後看實際少了多少。
直覺橋接:Mᵢ → 建立觀察基礎 → 準二項平均模型(Model F)估計 μᵢ → 與實際 Yᵢ 比較
野境有跡
WILD TRACES
方法二 / METHOD 2
準二項平均模型(Model F|最終採用):在相近觀察基礎下估計期望 μᵢ
本研究最終採用的期望值估計模型;回答「應該看到多少紀錄」,不是預測物種是否存在。
08 / 22
先抓住它的唯一任務
以每格的觀察基礎與模型變數估計期望值 μᵢ;接著才把 μᵢ 與實際 Yᵢ 比較,形成努力校正後的短缺。
•
工作:估計 μᵢ
在相近觀察基礎下,估應看到多少保育類紀錄。
•
平均結構
準二項平均模型(Model F|最終採用)
Quasi-Binomial Mean Model
•
離散修正
Grouped Pearson overdispersion correction.
•
基準對照
負二項迴歸模型(Model A|基準比較)
候選比較後不進入正式 CMGI 計算鏈
Mᵢ → 準二項平均模型 → 合理期望
Quasi-Binomial Mean Model|Grouped Pearson Overdispersion Correction
Mᵢ
第 i 格的觀察努力代理
μᵢ
準二項平均模型(Model F)估計的合理期望
Yᵢ
第 i 格的實際保育類紀錄
φ
群組 Pearson 過度離散修正
準二項平均模型(Model F)已選定|負二項迴歸模型(Model A)作基準比較|Predictive validity not established
野境有跡
WILD TRACES
方法二 / METHOD 2
一格看懂:期望 6、實際 2,為何形成正短缺?
有觀察基礎時,若實際 Yᵢ 低於期望 μᵢ,就形成 effort-adjusted positive shortfall。
09 / 22
完整故事|Mᵢ = 120 → μᵢ = 6.0 → Yᵢ = 2
→
→
① 這格被看多少
Mᵢ = 120
已有 120 筆全部哺乳類紀錄
② 模型認為應有多少
μᵢ = 6.0
理論上應有 6 筆保育類紀錄
③ 實際看到多少
Yᵢ = 2
實際只有 2 筆保育類紀錄
6.0 − 2 = 4:期望高於實際
→ 正短缺(effort-adjusted positive shortfall)
這不是「少了 4 隻動物」;而是模型期望與公開紀錄之間的相對短缺訊號。
示意:Observed < Expected → 努力校正正短缺提高
野境有跡
WILD TRACES
解讀原則 / INTERPRETATION
同樣是 0 筆,觀察基礎不同,意義就不同
先看 Mᵢ 是否足以比較,再看 Yᵢ 是否低於模型期望 μᵢ。
10 / 22
GRID A
Yᵢ = 0|保育類
Mᵢ = 1|全部哺乳類
證據不足:先不排名
只看過 1 筆全部哺乳類紀錄,0 筆保育類不足以支持缺口判讀。
GRID B
Yᵢ = 0|保育類
Mᵢ = 300|全部哺乳類
可比較:再看 μᵢ
已有 300 筆全部哺乳類紀錄,0 筆保育類才有比較意義。
同樣是 Yᵢ = 0,Mᵢ 不同,證據強度就不同:先判斷可比較,再談缺口高低。
判讀規則:Evidence Status 先於 Gap Ranking;觀察門檻目前仍為 provisional
野境有跡
WILD TRACES
決策指標 / DECISION INDEX
CMGI vNext=100 × Potential × Gap
只有潛力與資料缺口同時偏高,網格才會進入較前面的補查順序。
11 / 22
潛力分數(Potential Score)
0.44H + 0.31I + 0.25C
H
棲地代理(Habitat Proxy)
已接
I
多物種交集(Multi-species Intersection)
已接
C
保育相關性(Conservation Relevance)
已接
A
調查可行性(Survey Feasibility)
決策輔助
缺口分數(Gap Score)
0.40D + 0.25T + 0.20S + 0.15Q
D
努力校正正短缺|準二項平均模型(Model F)
已鎖定
T
時間缺口(Temporal Gap)
已接
S
來源偏誤缺口(Source Bias Gap)
已接
Q
連續性缺口(Continuity Gap)
已接
CMGI vNext = 100 × Potential Score × Gap Score
調查可行性資訊已接入系統,作為決策輔助、不直接計分;CMGI vNext 僅作補查排序。
CMGI vNext 計分結構|準二項平均模型(Model F)驗證結果|步道/道路等可近性資訊作補查決策輔助、不直接計分
野境有跡
WILD TRACES
模型驗證 / MODEL VALIDATION
準二項平均模型的三組驗證:誤差與校準是否穩定?
分別以時間、縣市與空間區塊切分資料,檢查模型離開原始資料後是否仍維持合理表現。
12 / 22
驗證誤差(RMSE)
越低代表 Observed 與 Expected 的整體誤差越小
觀察值/期望值(Observed / Expected)
O/E Calibration|O/E = Observed / Expected
模型驗證完成 ≠ CMGI 已具有預測效度
這三組驗證支持準二項平均模型(Model F)作為期望值估計工具;但 CMGI 的回溯辨識力仍未達完整預測效度門檻,因此目前用途仍是補查優先排序與決策支援,而不是物種存在或移動方向預測。
準二項平均模型(Model F)validation|Temporal OOS/County-block CV/Spatial-block CV|Expected estimation only
時間外樣本|未參與建模的時間資料
縣市區塊|檢查離開原地理區域後的表現
空間區塊|降低鄰近樣本相似造成的樂觀偏誤
時間外樣本
Temporal OOS
275.50
縣市區塊
County-block CV
233.43
空間區塊
Spatial-block CV
254.48
0
100
200
300
0.990
1.000
1.020
1.040
1.060
1.080
1.090
時間外樣本
縣市區塊
空間區塊
1.077 (+7.7%)
1.017 (+1.7%)
1.033 (+3.3%)
O/E = 1.000|理想校準位置
RMSE 衡量 holdout 中期望值與實際值的整體誤差;絕對數值仍需配合資料尺度與其他驗證指標解讀。
O/E = 1:量級一致|> 1:Observed 略高|< 1:Observed 略低
三組 O/E 均接近 1,整體量級沒有明顯系統性偏離。
野境有跡
WILD TRACES
驗證 / VALIDATION
完整驗證摘要:模型驗證完成,CMGI 回溯辨識仍有限
工程可重現性、準二項平均模型(Model F)選定與三組切分驗證均已完成;CMGI 回溯辨識仍未達預測效度門檻。
13 / 22
工程驗證|完成
137 PASS
自動化測試
11 / 11
位元一致成果
科學結論|功能成立,預測效度有限
準二項平均模型(Model F)經時間與空間切分驗證;CMGI 回溯辨識力未達門檻。
目前僅作補查優先排序,不作物種存在機率預測。
準二項平均模型(Model F)validation:Temporal/County-block/Spatial-block|CMGI retrospective limitation retained
項目
方法/驗證
結果
定位
準二項平均模型
(Model F)
Quasi-Binomial Mean Model
+ Grouped Pearson Overdispersion
最終採用 · violations 0
模型驗證完成
負二項迴歸模型
(Model A)
Negative Binomial Regression
比較完成
基準比較
Temporal OOS
時間外樣本驗證
RMSE 275.50 · O/E 1.077
完成
County-block CV
縣市區塊驗證
RMSE 233.43 · O/E 1.017
完成
Spatial-block CV
空間區塊驗證
RMSE 254.48 · O/E 1.033
完成
CMGI 回溯辨識力
2020–2024 holdout
整體未達預測效度門檻
補查排序/決策支援
第一層|工程與準二項平均模型(Model F)驗證
第二層|CMGI 回溯辨識力
通過工程驗證,不等於通過科學預測驗證。
野境有跡
WILD TRACES
展示 / WEBGIS DEMO
網站把模型變成一張可操作、可追問的決策地圖
正式站可切換年層與圖層;選取 5 km 網格後,右側直接呈現分數、Observed vs. Expected、主要缺口與補查建議。
14 / 22
觀眾會看到三件事
01
切換年層與圖層
比較不同時期的觀察覆蓋度(Observation Coverage)與 CMGI。
02
點選一個 5 km 網格
查看資料狀態(Data Status)、觀察值與期望值(Observed vs. Expected)。
03
追問為什麼優先
看到主要缺口、可說與不可說的範圍,以及建議的現地補查方法。
正式站實際截圖|1600 × 900
Production WebGIS:wild-traces.vercel.app/map|2020–2024|CMGI vNext|selected grid
野境有跡
WILD TRACES
研究結論 / FROM DATA TO PARTICIPATION
CMGI 不是答案,而是一個讓保育更容易被參與的起點
這不是經權威機構認證的標準模型,而是本研究首次公開的探索性補查優先度指標;目前尚未建立完整預測效度。
15 / 22
CMGI vNext|exploratory prioritization|public-safe 5 km grids|ARK: ark:/35232/d1livqy0
1|零散紀錄
2|物種 × 年份
3|環境圖層
4|5 km 聚合網格
5|候選補查區
2005 2015 2024
棲地 · 保護區
一筆紀錄,只是一個點;
當年份、物種與環境圖層疊在一起,
動物的「觀察足跡」才逐漸浮現。
而是協助判斷「哪裡值得再去看看」
我們不是要用模型取代野外調查,而是希望讓更多人知道:下一次,可以往哪裡看。
不是預測「牠在哪裡」
野境有跡
WILD TRACES
APPENDIX A1
資料清理 :每一筆排除都有可追溯原因
附錄用於回答資料量、排除規則與 retained corpus 的追問。
16 / 22
01
原始紀錄
1,600,520
TBIA Mammalia raw
02
無效 WGS84
−8,218
座標不合法
03
分析範圍外
−15,262
不屬固定陸域母體
04
清理後
1,577,040
座標與範圍 QA 完成
05
完全重複
−3
確定性去重
06
最終保留
1,577,037
所有後續分析共用
RETAINED
CORPUS
保育類
248,859
其他哺乳類
1,328,178
資料快照:phase1-8acac05018ec|ARK: ark:/35232/d1livqy0
野境有跡
WILD TRACES
APPENDIX A2
候選模型比較:準二項平均模型已選定,負二項迴歸模型作基準
選模結論與預測效度分開解讀:平均結構已鎖定,但 CMGI 回溯辨識力未通過。
17 / 22
模型
結構
驗證結果
科學限制
狀態
準二項平均模型
Quasi-Binomial Mean Model
+ Grouped Pearson
Temporal/county/spatial
皆完成
回溯辨識力未通過
最終採用
負二項迴歸模型
Negative Binomial Regression
基準比較完成
不是最終模型
基準比較
其他候選
候選模型組合
比較完成
無更強證據取代準二項模型
archived
負二項迴歸模型(Model A)適合過度離散計數,僅作基準比較;Expected 由準二項平均模型(Model F)估計。
準二項平均模型(Model F)|最終採用|負二項迴歸模型(Model A)|基準比較|Predictive validity not established
野境有跡
WILD TRACES
APPENDIX A3
門檻敏感度(Threshold Sensitivity):不要把暫定值藏起來
Minimum M 影響哪些網格可以進入 Observed vs. Expected 比較。
18 / 22
Minimum M
比較目的
需要回報
風險
目前狀態
M ≥ 1
最大涵蓋
係數 / dispersion / n
證據太薄
待 validation
M ≥ 3
寬鬆門檻
係數 / dispersion / n
不穩定
待 validation
M ≥ 5
目前暫定
係數 / dispersion / n
需驗證
PROVISIONAL
M ≥ 10
中等嚴格
係數 / dispersion / n
樣本減少
待 validation
M ≥ 20
嚴格比較
係數 / dispersion / n
排除過多
待 validation
要比較的不是哪個門檻看起來最好看,而是排序穩定性、尾端行為與空間泛化。
M ≥ 5 僅為 provisional;正式選擇需由 sensitivity report 支持
野境有跡
WILD TRACES
APPENDIX A4
缺口轉換已鎖定為 effort-adjusted positive shortfall
以準二項平均模型(Model F)的 Observed vs. Expected 形成主要缺口;用途是補查排序,不是顯著性檢定或存在預測。
19 / 22
中文名稱(English Name)
核心想法
優點
風險
狀態
皮爾森殘差(Pearson Residual)
依模型變異調整差距
統計尺度一致
極端值敏感
比較
努力校正正短缺(Effort-adjusted Positive Shortfall)
由準二項平均模型(Model F)的
Observed vs. Expected 形成
直接支援補查排序
不等於存在機率
採用
穩定化短缺(Stabilized Shortfall)
加平滑常數抑制爆值
穩定尾端
平滑參數需解釋
比較
離差(Deviance)
比較模型似然差異
模型一致
一般觀眾難解讀
比較
低尾機率(Lower-tail Probability)
觀察值落在低尾的機率
直接量化罕見程度
依模型校準
比較
百分位(Percentile)
依殘差排序轉百分位
跨期比較方便
失去原始尺度
比較
CMGI vNext 使用準二項平均模型(Model F)的努力校正正短缺;模型驗證已完成,但 CMGI 回溯辨識仍有限。
Gap method:準二項平均模型(Model F)effort-adjusted positive shortfall|decision support only
野境有跡
WILD TRACES
APPENDIX A5
完整資料血緣(Data Lineage):從 occurrence 到 CMGI
每一層都有可追溯輸入、固定規則、驗證輸出與公開安全界線。
20 / 22
→
→
→
→
→
→
→
→
→
TBIA
clean
taxonomy
dedupe
5 km grid
period
coverage
準二項平均模型
(Model F)
gap
CMGI
研究資料邊界
不公開原始 occurrence 精準點位;不把 occurrence 當成個體數或真實豐度。公開面只展示 public-safe aggregate。
Data lineage:TBIA → public-safe aggregate → 準二項平均模型(Model F)→ gap → CMGI|ARK: ark:/35232/d1livqy0
野境有跡
WILD TRACES
APPENDIX A7
參考資料(References)|資料與方法
主頁簡短標示來源;完整來源集中於附錄與每頁 speaker notes。
21 / 22
01
野境有跡研究團隊. (2026). CMGI vNext Phase 1 data lock. ARK: ark:/35232/d1livqy0.
02
Taiwan Biodiversity Information Alliance. (n.d.). Occurrence API. https://tbiadata.tw/api/v1/occurrence
03
Taiwan Catalogue of Life. (n.d.). TaiCOL API. https://api.taicol.tw/v1
04
林業及自然保育署. (n.d.). 保育類野生動物名錄. https://data.gov.tw/
05
農業部資料開放平台. (n.d.). 保護區圖資. https://data.moa.gov.tw/
06
國土測繪中心. (n.d.). 行政區與土地利用資料. https://data.gov.tw/
註:準二項平均模型(Model F)已選定且三組驗證完成;CMGI 回溯辨識未通過,僅作補查排序與決策支援。
Appendix|References and method traceability|ARK: ark:/35232/d1livqy0
野境有跡
WILD TRACES
APPENDIX A8
影像授權(Image Credits)
動物主視覺皆保留來源與授權,不使用無法追溯的 stock imagery。
22 / 22
臺灣黑熊
Abu0804. Formosan black bear [Photograph]. Wikimedia Commons. CC BY-SA 3.0.
臺灣穿山甲
Licheng Shih. Manis pentadactyla pentadactyla [Photograph]. Wikimedia Commons. CC BY 4.0.
石虎
SilverSea Design / Chofy Lin. 石虎2 [Illustration]. Wikimedia Commons. CC BY 4.0.
Appendix|Image credits|點擊上方區塊前往野境有跡正式網站