按发布会来数,这是一个前沿模型密集发布的季度。按我们的应用事后有什么不同来数,它只是一件事:在大多数寻常的生产工作上,其中几个系统现在落进了彼此的误差带。
这是一次结构性变化,不是一次排行榜事件。有必要精确地说清楚它意味着什么、不意味着什么。
收敛不意味着什么
它不意味着这些模型是一样的。它们的差异恰恰落在运维上重要、而均值会掩盖的地方:长工具链下的指令遵循、证据稀薄时的行为、工具返回垃圾时的失败方式、拒答的校准、以及同一条输入反复运行时的输出稳定性。两个头条分数相同的系统,方差可以很不一样 —— 而生产路径经历的正是方差。
它不意味着能力停止前进。它意味着头部几家之间的差距,在分布的中段 —— 也就是寻常生产任务上 —— 收窄了;而剩下的差异,转移到了尾部,以及行为层面,而不是原始能力层面。
它也不意味着选型从此不重要。它意味着选型不再是优势的来源。任何人都可以在同一周、以同样的价格,做出同样的选择。
它改变了选型的什么
我们的选型判据本来就在远离跑分。收敛把这件事做完了。
我们现在依据的是排行榜不报告的性质:
- 行为稳定性。 同一条输入反复运行,按轨迹离散度打分。在我们跟踪过的所有指标里,它对生产体验的预测力最好。
- 失败的教养。 面对畸形的工具响应、自相矛盾的上下文、无法回答的问题,它会怎么做。我们想要一个会停下来的模型 —— 停下来我们能围绕它建东西;自信的即兴发挥,我们没法围绕它建任何东西。
- 长度下的指令遵循。 在我们的路径真实运行的上下文长度上测量遵循度,而不是在写 eval 比较方便的那个长度上。
- 运维表面。 限流、延迟分布 —— 看尾部,不看中位数 —— 以及供应商在状态不好的那天怎么表现。
这些都不新奇。它们只是在原始能力不再区分候选者之后,还留下来的那些性质。
它改变了路由的什么
我们此前论证过,路由是架构问题,不是选型问题。收敛把这个论证推向了一个意外的方向:它让顶部的路由变简单,让底部的路由更有价值。
在顶部,当几个前沿模型对某一类请求近乎平价时,这一类内部的路由决策就不再是”哪个更好”,而是”可替换性”。这是一种韧性属性,值得为它做工程:当一个供应商劣化时,路径应当在不重新部署的情况下切走 —— 而确认它真的能切走的唯一办法,是定期地、刻意地切一次。
在底部,路由的价值上升了。便宜档位的进步比前沿更快,于是”不需要前沿模型”的请求占比变大了。值得问的路由问题不再是”用哪个前沿模型”,而是”这条请求到底需不需要前沿模型” —— 而回答它的是应用自己的证据,不是跑分。
什么没有变
基础模型到可靠应用之间的那些层,还在原来的位置。上下文构造、检索、评估、编排、失败处理、降级路径 —— 没有哪一样因为模型收敛而变简单了。甚至相反:当模型不再是差异化来源,其他一切就是;而其他一切都是工程。
前沿收敛对任何”优势本来就不在模型上”的团队都是好消息。要避免的是那个结论:选型不再重要了。它和过去一样重要 —— 只是它不再是一个能赢的地方,而变成了一个不能输的地方。