按发布会来数,这是一个前沿模型密集发布的季度。按我们的应用事后有什么不同来数,它只是一件事:在大多数寻常的生产工作上,其中几个系统现在落进了彼此的误差带。

这是一次结构性变化,不是一次排行榜事件。有必要精确地说清楚它意味着什么、不意味着什么。

收敛不意味着什么

它不意味着这些模型是一样的。它们的差异恰恰落在运维上重要、而均值会掩盖的地方:长工具链下的指令遵循、证据稀薄时的行为、工具返回垃圾时的失败方式、拒答的校准、以及同一条输入反复运行时的输出稳定性。两个头条分数相同的系统,方差可以很不一样 —— 而生产路径经历的正是方差。

它不意味着能力停止前进。它意味着头部几家之间的差距,在分布的中段 —— 也就是寻常生产任务上 —— 收窄了;而剩下的差异,转移到了尾部,以及行为层面,而不是原始能力层面。

它也不意味着选型从此不重要。它意味着选型不再是优势的来源。任何人都可以在同一周、以同样的价格,做出同样的选择。

它改变了选型的什么

我们的选型判据本来就在远离跑分。收敛把这件事做完了。

我们现在依据的是排行榜不报告的性质:

这些都不新奇。它们只是在原始能力不再区分候选者之后,还留下来的那些性质。

它改变了路由的什么

我们此前论证过,路由是架构问题,不是选型问题。收敛把这个论证推向了一个意外的方向:它让顶部的路由变简单,让底部的路由更有价值。

在顶部,当几个前沿模型对某一类请求近乎平价时,这一类内部的路由决策就不再是”哪个更好”,而是”可替换性”。这是一种韧性属性,值得为它做工程:当一个供应商劣化时,路径应当在不重新部署的情况下切走 —— 而确认它真的能切走的唯一办法,是定期地、刻意地切一次。

在底部,路由的价值上升了。便宜档位的进步比前沿更快,于是”不需要前沿模型”的请求占比变大了。值得问的路由问题不再是”用哪个前沿模型”,而是”这条请求到底需不需要前沿模型” —— 而回答它的是应用自己的证据,不是跑分。

什么没有变

基础模型到可靠应用之间的那些层,还在原来的位置。上下文构造、检索、评估、编排、失败处理、降级路径 —— 没有哪一样因为模型收敛而变简单了。甚至相反:当模型不再是差异化来源,其他一切就是;而其他一切都是工程。

前沿收敛对任何”优势本来就不在模型上”的团队都是好消息。要避免的是那个结论:选型不再重要了。它和过去一样重要 —— 只是它不再是一个能赢的地方,而变成了一个不能输的地方。