一架飞机失事了。调查组赶到现场,却只找到一张纸条,上面写着两行字:"北京起飞。上海坠毁。"至于中间发生过什么——发动机转速、高度变化、驾驶舱对话、哪个系统先报警——全部丢失。调查报告只能写一句话:"飞机没飞到目的地。"
这就是今天绝大多数AI Agent的处境。
它们调用十几种工具、经历数次失败和重试、最终完成一个任务后,训练团队保存下来的只有"用户提问"和"最终答案"。中间的一切——工具调用链、环境反馈、失败恢复、结果验证——在数据清洗时被压扁成一张"到没到"的标签。下一轮训练只能对着答案打分,却不知道模型缺的是知识、规划、工具选择,还是停止时机。2026年9月,TokenRhythm团队给这个问题交了一份答案——答案不在更复杂的算法里,而在你公司那台路由器的日志里。
你的Agent明明"学会了",为什么一上线就翻车?
先看清那个看似琐碎、实则致命的问题:把Agent的执行过程压扁成问答对,到底丢掉了什么。
NeoHorse-1的论文用了一个三层结构来保留这些易碎的信息。最外层是完整轨迹,保存从任务发起到终止的全部交互,相当于飞行记录仪的整段录音。中间层是用户轮次——从一次用户请求延伸到下一次请求或终止。最内层是子场景,把围绕同一局部目标的相邻轮次合并。三层保留父子关系,清洗、标签、路由和结果验证才能互相对齐。
训练时的处理比结构更关键。当前轮次中模型自己的推理、工具调用和回答,参与损失计算——也就是说,模型在这些输出位置上的预测错误会被用来推动参数更新;更早轮次的工具返回和推理过程只保留为上下文,不参与训练。这个简单的"面具"策略同时解决了两个矛盾:Agent必须知道前面做过什么才能继续操作;但你不能让它学会"背诵环境"——把工具返回的JSON逐字复述出来,那是对算力的浪费,而且换一个接口格式就全部失效。
还有一个更隐蔽的陷阱。今年初一项研究做了一个令人警觉的实验:把训练好的Agent测试环境里的动作名称改掉——语义完全不变,只是换了标签。结果Agent性能从61.2断崖式跌到4.44,几乎归零。这叫"接口捷径化"——模型不是在学"怎么解决问题",而是在学"训练集里的按钮长什么样"。真实部署日志天然包含不同环境、不同工具、不同失败模式,比人工构造的合成数据更不容易被模型背答案。
路由器:从省钱工具到"能力传感器"
现在来看这项研究最妙的洞察。你公司里那台用来省钱的模型路由器,其实是一台持续运转的训练数据生成器——只是你一直没接上它的输出端。
多模型路由的原理不复杂:简单请求发给小模型省成本,复杂请求转给大模型保质量。但NeoHorse-1团队注意到,路由器在做调度决策的同时,已经在干一件更有价值的事:它给每个请求估算了"能力需求分数",从C0到C3四个等级。C0是边界清楚的低风险任务,比如纯格式转换。C3是需要全套工具链和多重验证的高难度请求,比如跨多个日历和邮件系统的排期与冲突解决。关键是,这个分层不是基于"曾被GPT-4回答过"来贴标签——模型会升级、价格会变化——它用的是需求语义:请求本身和历史所体现出来的能力要求。
论文把这个分数变成了训练课程的总指挥。训练分三阶段推进,每阶段约三分之一数据:第一阶段偏重低需求样本打基本功,第二阶段扩大范围,第三阶段大幅增加高难度交互。但有一个反直觉的设计——即使在后期也刻意保留了一部分低分样本。因为如果训练尾巴全被C3级复杂交互占据,模型会"忘记"怎么处理简单任务。这恰恰是很多课程学习容易犯的贪心错误。
课程排好了,训练怎么跑?NeoHorse-1用了两阶段策略。第一阶段是常规监督微调——即给模型看大量"问题+标准答案"让它模仿学习。第二阶段是一步更关键的操作——"在策略蒸馏"。常规监督微调有一个致命盲区:学生只在教师写好的"完美前缀"上学习。但部署时学生要自己生成每一个token(模型输出文本的最小单位,类似一个字或词)——一旦早期token偏离了教师在训练时走过的路径,后续状态就进入训练从未覆盖的区域,错误像雪球越滚越大。在策略蒸馏解决的就是这个:让学生从自己的当前策略出发生成回答,然后一个更大的固定模型在学生实际走过的每个前缀上纠正偏差。训练状态和推理状态是同一回事——这相当于飞行员在自己的驾驶舱里被纠正,而不是在地面模拟器上看别人的操作录像。

一组控制实验直接比较了数据来源的重要性。同样的基座模型、同样的课程安排、同样的训练设定和预算,唯一的变量是Agent数据从哪来:一组用公开合成工具数据,另一组用真实路由轨迹。五项评测的非加权平均(即每项评测同等重要,不偏向某一类任务),真实轨迹高出6.26分。其中代码能力差距最大,差了8.54分。但这个实验有一个诚实的注脚:它只告诉我们"真实轨迹更有效",却没有拆开它的构成——是任务分布更合理?工具反馈更丰富?失败恢复样本更多?还是验证信号更完整?笼统的"更真实"不能当方法论用。
数据飞轮的天花板在哪里?
NeoHorse-1描绘的路线图,最直接的受益者是已经部署了多模型路由的Agent产品团队。他们手头本来就有路由日志,之前当废料扔了。现在可以把它从"成本优化工具"升级为"模型改进引擎"——投入主要集中在轨迹治理(对原始日志做清洗、去隐私、结构化)和训练计算上。
但这条路上的坑比论文能展示的深得多。
第一道坎是日志结构。请求、模型调用、工具结果、重试、终止、产物和验证器输出——这七样东西必须通过统一的ID关联,否则"完整轨迹"只是在时间线上拼接的一段文本,无从判断哪一步操作对上了哪个结果。路由器还必须分开记录三件事:原始预测("系统认为该走C3")、策略修正("因容量不足降级到C2")、实际服务("最终用了C2模型")。三者混成一个标签,下一轮课程会学到被容量妥协污染过的能力边界。

第二道坎是隐私。真实轨迹里漂着用户数据、凭据片段、内部文件和业务决策。脱敏、访问控制和训练授权的合规成本,在很多团队里比训练本身还高。
第三道坎更隐蔽,也更具讽刺意味:数据飞轮可能在系统变好之后反而停转。特斯拉的自动驾驶是一个经典教训——系统越好,人类驾驶员需要接管的次数越少,可用于训练的"纠错信号"也越少。剩下那一点点接管,99%是误触发。飞轮不是轰然崩塌,而是一声不响地停了下来。一项来自卡内基梅隆大学的经典实验早已预言了这个困境:纯模仿学习的模型看了一百万帧人类驾驶数据仍然失控撞墙,因为它从未见过"人类如何从错误中恢复"——它只会模仿不会自救。
更根本的风险来自"模型崩溃"——2024年《自然》杂志证明,当模型反复在自生成数据上训练时,分布尾部(那些不常见但真实存在的边缘情况)先消失,然后模型输出的多样性逐渐萎缩,最终退化到只会输出少数几种模式。NeoHorse-1目前只验证了一轮闭环。谁也不知道第二代以后数据分布会不会收窄、评测会不会被过拟合、路由器会不会开始只生产模型已经擅长的任务。
"Towards"——一道还没跑完的闭环
论文标题里最诚实的词是"Towards"——"迈向"递归自我改进。
目前验证的是:一条"执行→评测→选数→更新→再执行"的路线在单轮内走得通。4B模型在十项评测上,非加权平均从58.94提升到64.87,涨了5.93分。提升最明显的是多步执行、工具交互和代码类任务,而不是静态指令遵循——模型真正学到的是"怎么做事",不只是"怎么说话"。
但"走得通"和"能持续跑下去"之间,还隔着几块硬证据。多代稳定性曲线——第二代以后数据分布会不会收窄、评测会不会被过拟合——全部悬而未决。全矩阵消融实验(逐一关掉课程、在策略蒸馏、数据分配等模块,看每个模块各自贡献了多少)尚未完整拆开。成本核算——轨迹量级、教师调用量、训练token总量——仍然粗略。评测覆盖面也有限:十项评测集中在Agent、代码和指令遵循,不能外推到知识更新、长文一致性或安全对齐。
指出这些局限,不等于否定这项工作的价值。恰恰相反,NeoHorse-1最值得被记住的,不是"4B涨了5.93分"这个数字,而是它把"线上数据飞轮"从一句口号拆成了可追责的对象——什么是一个用户轮次、哪些token参与损失、结构错误怎样隔离、路由分数怎样影响课程、评测缺口怎样回到数据配比。每一个环节都可以被检查、被证伪、被安全停下来。
对大多数Agent团队来说,第一步甚至不需要复现整套训练流水线。先回答四个问题就够了:工具调用和结果能不能通过ID一一对应?任务结束有没有可验证的产物?路由记录的是能力需求还是成本妥协?失败有没有被分拆成结构错误、能力不足和环境阻塞?
答不上来,再多日志也只是数据垃圾场。黑匣子只有在你愿意打开它的时候才有用——而打开它的第一步,不是训练更好的模型,是建立一套能告诉你"模型到底哪里不行"的语言。