它从头到尾只会一件事:猜下一个字。
九年,九次绕道,都是为了让这件事更便宜、更符合人类预期。
往下滚。先看这台机器怎么跑。
前九关,每一关都能说清哪里走不通、怎么绕过去、代价是什么。
第十关不行。没有任何工具能测量它,这跟保不保密无关。
所以这里不画外推曲线。只标三条断头路。
上面三条是「测不了」。这一节是「我认为会怎么走」。
五条全是判断。所以每一条都写上它会被什么证伪。明年回来,可以一条条对。
未来两年最大的一次能力跃迁,不会来自参数或数据,会来自编排层。「模型多强」和「系统多强」正在变成两个独立的数。
两年内它不再是有意义的横向对比项。取而代之的问题是:它能管多大的外部状态。
MoE 是「每个 token 只激活 2/8 的参数」。动态 workflow 是「每个子任务只激活一个子 agent」。同一个思想在往上爬,下一层是记忆:每次只激活相关的那一小块。
第四代的全部可行性押在「它能判断子 agent 干对了没有」。代码领域已经成立。写作、研究、决策这些没有可执行判据的地方,并行会放大错误而不是收敛。两年内不会有通解。
格局会是少数几个底座模型 + 大量场景化 harness,而不是一家通吃。因为增益转移到 harness 之后,harness 是和场景绑定的,而场景是碎的。
下面每一行对应页面里的一个数字。primary = 厂商官方公告 / arXiv 论文,– 条;secondary = 百科、二手报道或厂商报价推算,– 条,标红,可信度低于前者。
| 第几关 | 数字 | 值 | 口径 | 来源 |
|---|
prefers-reduced-motion 下退化为静态图,信息一条不少