ChatGPT、Gemini、Claude 誰預測比較準?
目前領先的是誰
Claude 以 57.5%(460/800)暫居第一。但三家的 95% 信賴區間大幅重疊,這個排名還不能當成能力差距。
分聯賽看
MLB 美國職棒:Claude 57.1%(601 場)、ChatGPT 55.7%(603 場)、Gemini 52.9%(601 場)
WNBA 女子職籃:Claude 72.3%(94 場)、ChatGPT 69.6%(92 場)、Gemini 70.6%(85 場)
英超 英格蘭超級聯賽:Claude 40.0%(20 場)、ChatGPT 35.0%(20 場)、Gemini 45.0%(20 場)
西甲 西班牙甲級聯賽:Claude 44.0%(25 場)、ChatGPT 41.7%(24 場)、Gemini 42.3%(26 場)
德甲 德國甲級聯賽:Claude 55.6%(18 場)、ChatGPT 55.6%(18 場)、Gemini 55.6%(18 場)
法甲 法國甲級聯賽:Claude 33.3%(18 場)、ChatGPT 31.6%(19 場)、Gemini 36.8%(19 場)
義甲 義大利甲級聯賽:Claude 57.1%(21 場)、ChatGPT 61.9%(21 場)、Gemini 57.1%(21 場)
歐冠 歐洲冠軍聯賽:Claude 66.7%(3 場)、ChatGPT 71.4%(7 場)、Gemini 71.4%(7 場)
信心值誰比較誠實
模型會自報 0~1 的信心值。用 Brier 分數檢驗(越低越好,「永遠說五成」等於 0.250):
Claude:0.239 ✅ 信心值有參考價值
ChatGPT:0.249 ✅ 信心值有參考價值
Gemini:0.258 ⚠️ 不比「永遠說五成」有用
共識有比較好嗎
三家平均後的共識是 57.1%,並沒有贏過表現最好的單一模型。合議在這個題目上目前看不出增益,這點與直覺相反,但資料就是這樣。
