算逑 1on9 查看完整榜单 →
1on9
公告 · 2026 年 7 月 21 日

休赛期公告

写给关注算逑 1on9 的朋友们 —— 关于决赛、关于 104 场 AI 预测的成绩单,以及接下来我要做的事。
39 天 104 场比赛 21 个 AI 模型

决赛:西班牙捧杯

世界杯结束了。

7 月 19 日,纽约/新泽西的大都会人寿体育场,加时赛第 106 分钟,第 62 分钟才替补登场的费兰·托雷斯在禁区内抢到一个弹起的球,左脚贴着横梁下沿捅进球门。

2026 FIFA 世界杯 · 决赛 · 加时赛
🇪🇸
西班牙
1
-
0
🇦🇷
阿根廷
⚽️ 费兰·托雷斯 106′
大都会人寿体育场 · 新泽西
比赛统计
65%
控球
35%
20
射门
2
12
射正
0
9
角球
4
21
犯规
25
0
黄牌
5
0
红牌
1

这场决赛的过程其实没什么悬念。西班牙 20 脚射门、12 次射正;阿根廷全场零射正,梅西只触球 54 次。中场恩佐·费尔南德斯因为对库巴西的一次鲁莽犯规被红牌罚下之后,比赛就更是一边倒了。

西班牙拿到队史第二座世界杯,也是 2010 年之后的第一座,同时成为第一个同时持有男足和女足世界杯冠军的国家。

梅西没能卫冕。他说过,这是他最后一届世界杯。

39 天,104 场球。谢谢每一位陪着算逑走完这一程的朋友。

AI 到底预测得怎么样?

这是我做这个网站最想知道的答案。现在有了 104 场完整的样本,可以说几句实话。

查看完整榜单与每场对错明细 →

有几点我觉得挺有意思,也说给你听

一、模型大小和预测准确率的关系,没有想象中那么直接

胜平负榜首是一个 26B 的小模型,而参数量大得多的旗舰模型们挤在它后面一两个百分点的位置。足球本身的不确定性可能才是天花板 —— 再聪明的模型,也算不出恩佐第几分钟会吃红牌。

二、不同任务的排序完全不一样

GPT-5.5 在胜平负榜上排第三,在比分榜上排第十(47%);Claude Opus 4.7 在比分榜上断层第一。「哪个模型更强」这个问题,取决于你问它什么。

三、66% 和 61% 是什么水平?

说实话,比我预期的高,但也没有高到可以让你闭着眼睛跟单。这是一个「比瞎猜好不少、离稳赚差很远」的区间。算逑做的事情是把这些预测摊开给你看,包括它们错的时候 —— 榜单上每个模型点开都能看到具体哪场对了哪场错了。这一点我会一直坚持。

接下来做什么

足球进入休赛期,算逑不休息。这段时间我会做一轮比较大的升级:

1

接入五大联赛和欧冠

世界杯是一次性的,联赛才是常态。我会引入英超、西甲、意甲、德甲、法甲以及欧冠的数据与赛程,同样做预测和赛后点评。样本量从 104 场变成一个赛季几千场,这些 AI 模型的真实水平会暴露得更彻底。

2

全面更新 AI 模型阵容

世界杯只有短短 39 天,但 AI 圈这 39 天发生的事情不少:GLM 升级到了更稳定的 5.2,腾讯混元 V3 转正式版,GPT-5.6 的部分性能甚至反超了 Claude。榜单上的模型阵容我会做一次整体的升级和调整,让它反映当下真实的竞争格局,而不是一个月前的。

3

从「预测」走向「辩论」:做能思考的预测 Agent

这是我最想做的一件事。

现在榜单上每一个 AI 的预测,都是一次孤立的动作:给它一场比赛的数据,它给出一个结果,然后结束。它不记得自己上一场为什么错了,也不知道隔壁的模型是怎么想的。65% 和 66% 之间的差距,很可能只是噪声。

接下来我要做的是预测 Agent —— 让 AI 有记忆,能复盘自己过往的判断;也让 AI 之间围绕同一场比赛互相质疑、互相反驳。一个模型说主队必胜,另一个把伤停名单和近期客场数据甩出来,双方过几轮,你看到的就不再是一个孤零零的百分比,而是一场结论是怎么被推出来的完整过程。

我相信这比多一个百分点的准确率更有价值。哪怕最后它们还是猜错了,你至少知道错在哪一步。

休赛期重点
4

给付费用户更好的数据和资讯

更高质量的比赛数据、更及时的新闻源。付了钱的朋友应该拿到明显不一样的东西,这件事我做得还不够,会补上。

5

手机端体验优化

现在的移动端说实话有点将就。我会重做一遍,同时接入微信支付通道 —— 之前很多朋友反馈付款太麻烦,这是我的问题。小程序或者 App 也在考虑,但不承诺时间。

6

国际版

会做,但会挑一个合适的时机。不着急。

最后说一句。

算逑做到今天,靠的是一群愿意认真看数据、也愿意在我做得不好的时候直接告诉我的朋友。世界杯这 39 天,后台收到的每一条反馈我都看了。

休赛期见。有什么想让我优先做的,随时告诉我 —— hi@1on9.com

—— Hugo · 算逑 1on9