研究与复盘。
决策值得记录时,我们发布。
它们不是教程,不是观点文章,是我们在生产 AI 系统中做出的具体工程决策的记录,以及事后学到的。
-
胶水层变成了标准
把模型接到内部系统上,过去是一次性写完、然后安静腐烂的胶水代码。这一层现在是一份有治理的协议,而工作只是转移了,并没有消失:一个 agent 可以碰哪个系统、以谁的权限、留下什么审计轨迹。这篇讨论标准化替我们解决了什么,以及它把哪些问题交还给了我们。
-
当前沿模型彼此收敛
2026 年的短短几周里,几乎每个主要实验室都发布了新的前沿模型 —— 而且第一次,其中几个在大多数生产任务上落进了彼此的误差带。如果“选最强的模型”不再构成差异化,差异化就转移到你围绕它构建的东西上。这篇讨论收敛改变了我们选型与路由决策的哪些部分,以及没有改变哪些部分。
-
价格崩塌之后
推理的价格已经是两年前的一个零头,本能反应是把省下来的预算换成更多 token。我们正是这么做的,然后回头读了自己的调用链。约束条件已经转移 —— 从每 token 成本,转移到延迟预算、上下文纪律,以及更多调用带来的失败面。这篇记录价格不再是上限之后,我们重构了什么。
-
更大的窗口不是上下文策略
上下文窗口越过百万 token,很多团队做的第一件事是不再裁剪。我们的调用链显示,注意力在窗口填满之前很久就开始衰减 —— 你移除什么,依然比你现在付得起保留什么更重要。这篇给出我们自己检索路径上的测量,以及活下来的那几条裁剪规则。
-
先设计降级路径
每个 AI 功能都有状态不好的那天:供应商变慢、检索索引过期、工具返回了畸形结果而模型自顾自地绕了过去。大多数团队设计顺利路径,然后在一次事故里遇见另一条。我们先写降级路径 —— 系统在没有把握时返回什么 —— 再让它反过来约束功能本身。
-
活不到生产的那个数字
跑分报告的是单次运行的成功率。生产会用同一个问题问同一个 agent 一千次 —— 工具会超时,输入会漂移。这两个数字之间的差距不是噪声,而是没有人评估过的那部分系统。我们如何评估轨迹而不是结果,以及这件事改变了我们最终上线哪些 agent。
- 即将
上下文工程才是产品本身
基于基础模型构建的团队,在生产六个月后不断发现同一件事:模型从来不是瓶颈。进入上下文窗口的东西才是。这篇笔记是我们停止优化 prompt、开始架构上下文时学到的。
- 即将
先写 Evals 再写 Prompts
大多数 AI 应用以错误的顺序构建:先写 prompt,后补 eval(或从不补)。正确的顺序是反过来 —— 先用可度量的方式定义“好”是什么,再写满足 eval 的 prompt。我们解释为什么这个顺序比看起来重要得多。
- 即将
模型路由作为架构
“我们应该用哪个模型?” 几乎总是错误的问题。生产系统根据请求特征在多个模型之间路由。我们讨论如何设计路由、为什么跑分经常误导路由决策、以及路由层本身如何成为一个应用。