真正的預測實測,第一步不是算分,而係「賽前鎖死」
足球預測 實測最常見的假進步係:賽後覺得自己「本來都估到」,但賽前根本冇留概率。要做真實評測,至少先連續記30場,保存時間戳、1X2概率、資料版本與最終結果,再用 Brier Score、Log Loss 同校準分組看質量。
如果冇賽前時間戳,就唔算完整實測。30場亦唔足以證明模型長期有效,但足以建立第一批可檢查紀錄。評估時不要只計「猜中幾場」;概率預測要獎勵合理的信心程度,亦要懲罰過度自信。
30場表至少要有呢八欄
| 欄位 | 例子 | 原因 |
|---|---|---|
| Match ID | 2026-001 | 唯一追蹤 |
| 資料截點 | T-24h | 防止偷看正選 |
| P(Home) | 0.50 | 主勝概率 |
| P(Draw) | 0.28 | 和局概率 |
| P(Away) | 0.22 | 客勝概率 |
| 版本 | model-v1 | 重現計算 |
| 結果 | H/D/A | 評分 |
| 備註 | 紅牌/大幅輪換 | 做錯誤分析 |
如果概率來自市場賠率,先用 足球賠率工具 去水;如果係自己模型,就保存原始輸出,唔好賽後手改。
它唔只問「中唔中」,而係問你有幾自信
你給主隊勝率70%,結果主隊贏:誤差平方係 (0.70−1)² = 0.09。若你只給55%,同樣贏波則 (0.55−1)² = 0.2025。前者因為較接近實際結果,分數更低。
1X2係三類結果,實際應同時對主勝、和局、客勝三個概率計算,而唔係只抽主勝一欄。
極端錯誤會被罰得更重,專門捉過度自信
實際結果只給40%
錯得有限,懲罰存在但仍可接受。
實際結果只給1%
模型幾乎話「不可能」,Log Loss 會重罰。
Gneiting & Raftery 對 proper scoring rules 的整理指出,合適評分規則應鼓勵預測者報出自己真正的概率判斷。對足球模型而言,呢點比「貼士中了幾場」更接近科學評估。
把60%預測放埋一組,長期應該大約六成發生
| 預測區間 | 場數 | 實際發生率 | 解讀 |
|---|---|---|---|
| 50–59% | 樣本累積後填 | — | 看是否過高/過低 |
| 60–69% | 樣本累積後填 | — | 理想接近預測區間 |
| 70–79% | 樣本累積後填 | — | 特別留意過度自信 |
30場通常太少,分組會很嘈;所以呢張表係開始收集,不是30場後就宣稱「校準完成」。
四條規則令你的「實測」可以被第二個人重做
- 每場只保留一個正式賽前版本;後續更新另開版本,不覆蓋。
- 概率總和必須等於100%(容許小數四捨五入誤差)。
- 賽後先記結果,再計分;不因結果改模型輸入。
- 每30場只做一次錯誤回顧,規則修改由下一批開始。
三類概率一定要一齊評分,唔可以只挑自己最有信心的一格
| 結果 | 預測概率 | 實際值 | 平方誤差 |
|---|---|---|---|
| 主勝 | 0.50 | 1 | 0.25 |
| 和局 | 0.30 | 0 | 0.09 |
| 客勝 | 0.20 | 0 | 0.04 |
如果主隊最後贏,三格平方誤差合計0.38;不同文獻與實作可能再取平均或使用不同尺度,所以比較模型時必須固定同一公式。最重要的唔係某個「好分數門檻」,而係同一批比賽用同一算法比較。
Log Loss 同樣要按實際發生類別的預測概率計算。模型如果把最後發生的結果只給極低概率,就會被明顯懲罰;呢個特性特別適合檢查「經常自信到話某結果幾乎不可能」的模型。
足球概率實測 FAQ
30場夠唔夠證明模型有效?
唔夠。30場主要用來建立紀律與發現明顯錯誤,長期結論要更多樣本。
Brier Score越高越好?
通常係越低越好,因為它計概率與實際結果的平方誤差。
命中率高但Log Loss差代表咩?
可能模型在少數錯誤場次過度自信,極端錯誤把分數拉差。
可以只測自己覺得有把握的比賽?
可以,但要賽前定義選取規則,否則容易事後挑樣本。
「實測」唔係故事,而係一份可重現的時間序列
先鎖概率,再讓結果評分。