201720262017 → · 序章
2017 → 2026.07 · 序章 + 九关

大模型是怎么
一步步走到今天的

它从头到尾只会一件事:猜下一个字。
九年,九次绕道,都是为了让这件事更便宜、更符合人类预期。

往下滚。先看这台机器怎么跑。

九关按因果排,不按年份排:有三处年份会倒回
数字都挂着出处,文末可查
讲对比的那几段可以停、可以倒着滚回看
讲机制的那几段自己循环播,不用管
图都自己循环播,往下滚就行,不用管它们
2026.07 → ?

再往前,画卷就断了

前九关,每一关都能说清哪里走不通、怎么绕过去、代价是什么。
第十关不行。没有任何工具能测量它,这跟保不保密无关。
所以这里不画外推曲线。只标三条断头路。

2026.07 → 2028 · 以下全是判断

大胆的那部分

上面三条是「测不了」。这一节是「我认为会怎么走」。
五条全是判断。所以每一条都写上它会被什么证伪。明年回来,可以一条条对。

01

能力增益会继续从模型转移到 harness

未来两年最大的一次能力跃迁,不会来自参数或数据,会来自编排层。「模型多强」和「系统多强」正在变成两个独立的数。

依据RAH 那篇把 backbone 锁死在 GPT-5,只换 harness,在 Oolong-Synthetic 上 71.75% → 81.36%。论文自己说这 +9.61 分来自 harness 而不是模型。
会被什么证伪如果下一代模型在不换 harness 的前提下,把同类长上下文任务再推 10 分以上,这条就错了。
02

「上下文长度」这个指标会失效

两年内它不再是有意义的横向对比项。取而代之的问题是:它能管多大的外部状态

依据第 4、5、8 三关都在为「把窗口做长」付账。而递归 harness 的做法是根本不放进窗口:放在磁盘上按需读,4M token 的任务靠的是文件系统。
会被什么证伪如果厂商继续把窗口当主要卖点,并且长窗口在实测上持续压过「外部状态 + 按需读」,这条就错了。
03

稀疏化会再往上爬一层:参数 → agent → 记忆

MoE 是「每个 token 只激活 2/8 的参数」。动态 workflow 是「每个子任务只激活一个子 agent」。同一个思想在往上爬,下一层是记忆:每次只激活相关的那一小块。

依据这三层的动机完全一样:总量可以很大,单次代价必须小。前两层已经发生了,而且都是先在论文里出现、一年内进产品。
会被什么证伪如果两年内长期记忆的主流做法仍然是「全量塞进上下文」或「向量库粗检索」,没有出现类似路由的门控结构,这条就错了。
04

最不乐观的一条:没有测试的领域,自我校验解决不了

第四代的全部可行性押在「它能判断子 agent 干对了没有」。代码领域已经成立。写作、研究、决策这些没有可执行判据的地方,并行会放大错误而不是收敛。两年内不会有通解。

依据Anthropic 的 codebase 迁移明确把「现有测试套件」当作标准,这恰恰说明校验依赖外部判据。而 METR 已承认超过 16 小时的测量不可靠。
会被什么证伪如果出现一个在无测试领域(比如长篇研究报告)上,多 agent 并行稳定优于单 agent 的控制变量评测,这条就错了。
05

反预测:不会出现「一个模型统治一切」

格局会是少数几个底座模型 + 大量场景化 harness,而不是一家通吃。因为增益转移到 harness 之后,harness 是和场景绑定的,而场景是碎的。

依据同一份数据里:换 harness 不换模型 +9.61 分(71.75 → 81.36),换模型不换 harness +8.41 分(81.36 → 89.77)。两个量级相当,说明这是两个独立的乘数,谁也吸收不了谁。
会被什么证伪如果某一家的通用 harness 在跨场景评测上普遍压过场景专用 harness,这条就错了。

每个数字的出处

下面每一行对应页面里的一个数字。primary = 厂商官方公告 / arXiv 论文, 条;secondary = 百科、二手报道或厂商报价推算, 条,标红,可信度低于前者。

展开出处表
第几关数字口径来源
纯 SVG + 原生 JS · 无框架 · 无 CDN · 单文件自包含
SVG 内零文字(全部走 HTML 浮层)· 描边 non-scaling-stroke · 色块无描边,三条都是为了不糊
prefers-reduced-motion 下退化为静态图,信息一条不少