ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Agent 持续进化:从学习信号到参数更新的工程化路径

Agent 持续进化:从学习信号到参数更新的工程化路径 Agent 持续进化从学习信号到参数更新的工程化路径Agent 面临一个鲜明的能力悖论它可以零样本解决从未见过的复杂任务却可能在处理了一万次相似任务之后第二天仍然犯下第一天的错误。能否自主从经验中学习正在成为 Agent 从会完成任务走向能够可靠工作的关键能力。本文从学习信号获取、四种更新方式、持续进化闭环以及安全边界等角度对 Agent 持续进化的工程化路径进行技术分析。核心问题保存经历不等于从经历中学习一个常见的混淆是把保存经历等同于从经历中学习。把一百条轨迹放进长上下文或向量库可以帮助模型在需要时找回某个案例却不会自动完成跨案例比较——哪些步骤在成功轨迹中反复出现哪些做法只在旧版接口上有效某次成功究竟来自正确策略还是环境偶然。学习发生在系统主动完成评价、对照、归纳、验证之后而不是发生在日志写入磁盘的那一刻。为什么不直接让模型在每次任务后训练自己原因在于生产环境很少提供干净的学习信号。用户满意不意味着合规局部参数更新可能造成能力遗忘、策略漂移或安全退化。若允许模型依据未经验证的反馈直接修改自身参数错误经验和提示注入就可能被固化并在后续任务中持续放大。因此在模型自身尚不能可靠地持续学习时必须把学习构建成模型外围的一套自主系统记录运行证据验证结果与过程从多条轨迹中提取共性再决定应更新知识、指令、程序还是模型参数。从运行轨迹中获得学习信号持续进化的起点不是总结而是评价。如果系统不知道任务是否完成也不知道哪一步造成了成功或失败那么语言模型生成的反思只能是一种猜测。错误的评价一旦进入长期知识、系统提示或训练数据影响会跨越后续任务不断放大。三层验证结构有些任务的结果相对容易验证——Coding Agent 可以运行测试退款 Agent 可以查询订单状态。这类信号来自环境中的真实状态通常比模型对自己行为的描述可靠。但结果正确并不代表过程正确删除失败的测试用例也能让测试通过口头承诺退款也可能得到暂时的满意反馈。因此可靠评价既要看结果也要检查达成结果的路径。对于没有单一正确答案的任务如客服质量、研究报告可以使用 LLM-as-a-Judge但不能只给出一个模糊总分。更有效的做法是预先定义评价量表Rubric要求验证器逐项给分、引用轨迹证据并在证据不足时明确表示不确定。三层验证结构的分工是底层的结果验证器读取测试结果、数据库状态和工具返回回答事情是否真的办成中间的过程验证器检查业务规则、权限和动作序列回答是否以允许的方式办成上层的质量验证器依据 Rubric 评价语言与策略回答是否办得合适。越靠下的指标越应依赖代码和环境真值只有难以形式化的部分才交给语言模型。客服 Agent 的评价维度示例以客服 Agent 为例一套有用的 Rubric 至少应覆盖七个维度维度验证问题任务结果用户的核心诉求是否得到解决规则遵从是否违反政策、权限或必要流程隐私边界是否泄露不应提供的信息事实可靠性陈述是否有知识或工具结果支持承诺-行动一致性声称完成的操作是否真实发生表达质量是否自然、简洁避免重复与模板化合规变通原方案不可行时是否找到允许的替代路径前五项主要约束底线后两项衡量服务质量。这种拆分比用户是否满意更有诊断价值用户可能因为 Agent 违规退款而满意也可能因为合规限制而不满单一满意度无法区分两者。Agent 持续进化的四种更新方式学习信号说明 Agent 应当改变但没有说明改变应发生在哪里。不同类型的能力适合不同的更新载体事实和经验适合写成知识文档可以用语言清楚表达的策略适合写入提示词或 Skill可以精确执行的流程与约束适合写成程序感知、语言风格和隐式策略等高维能力则必须进入模型参数。更新方式适合承载主要优势主要局限经验知识库事实、经验规律、例外与来源更新快、可追溯、可按需检索依赖检索和模型正确应用Prompt 与 Skill需要理解语境的判断原则可解释、作用范围可控容易膨胀、冲突或被忽略程序与 Harness可确定解析、可执行验证的硬约束可测试、执行稳定、成本低开发与维护成本较高模型参数高维感知、生成风格和隐式策略泛化能力强、推理开销低更新与回归成本高四种方式并不互斥。同一能力可以拆到多个载体事实进入知识库解释例外的原则进入 Skill不可绕过的权限仍由程序门控高维识别能力再进入参数。将经验沉淀为知识最轻量的进化方式是把多次运行中反复出现的经验整理成可检索的知识文档。原始轨迹不适合直接作为知识单元——它既长又嘈杂包含工具原始输出、偶然的绕路和环境细节。更稳妥的系统保留三层数据不可变的原始轨迹用于审计单次运行分析记录本次成败与经验草案再对多条同类轨迹进行比较、聚类和归纳形成面向未来的知识文档。正式文档通常写清适用场景、推荐策略、禁止做法、例外条件、证据来源和最近验证时间而不是复述某一次任务的完整过程。真正有迁移价值的内容来自对照同类成功轨迹做了什么失败轨迹缺少什么某种策略在哪些环境版本中有效在哪些前置条件下失效。将经验写成指令当多条相似轨迹反复暴露同一种策略错误且错误能够用语言清楚描述时才值得把经验提升为指令。这里有一个重要的工程原则修改应是带来源的最小 diff而不是让模型每次都重写整份 Prompt。待验证版本必须同时在触发失败的边界集和正常工作的保留集上测试前者要改善后者不能退化。一个实际案例说明了这种方法的可行性。在 tau-squared-bench 的 telecom 环境中换用能力较弱的模型运行后20 条任务中有 19 条以转接人工收场。将失败轨迹交由模型自行归纳产出若干条可执行规则追加到政策末尾通过率由 12.3% 升至 19.3%且原本通过的任务无一被改坏。但这个案例也暴露了一个关键风险模型会把观察到的行为当作应然的行为。第一版规则中出现连续三次调用失败即转接人工——轨迹中出现最频繁的正是转接人工模型据此将其视为合理的兜底手段。但在评估中转接人工必然判定失败这等于把失败写入了规范。因此提炼产物不能直接发布须经与提炼者相互独立的验证。将经验写成程序当经验描述的是稳定、重复且可验证的操作时每次都让模型重新阅读文档和推理并不经济。此时更合适的做法是把经验编译为工作流、工具或 Harness 代码。浏览器工作流是一个典型例子第一次发送邮件时多模态 Agent 通过观察-思考-行动寻找控件以后发送另一封邮件时流程没有变化只需把第一次探索产生的轨迹编译成带参数、状态检查和版本信息的小程序。PreAct 的实验中这类程序在重复任务上实现了 8.5-13 倍的端到端加速。更重要的结论是流程记忆必须同时具备动作前验证、动作后验证和独立回放验证否则系统很容易得到一种危险的假象每个按钮都点过了但某个字段其实为空任务从未真正完成。将经验写入参数知识、指令和程序都建立在一个前提上目标能力能够被外部符号较完整地表达。医疗影像理解、自然的语音韵律、消除文本的模板化AI 味等能力却很难压缩成几条规则或工作流。这类能力必须通过后训练写入模型参数。对持续进化而言关键是把经过评价的生产轨迹转化为训练数据高质量示范进入 SFT明确偏好形成成对数据具有可靠环境奖励的交互用于 RL。构建可长期运行的持续进化闭环四种更新方式只有进入同一个自主循环才会从单次优化变成持续进化。生产系统中更稳妥的是双循环结构在线执行循环只完成任务并记录证据不直接改写正式 Agent离线进化循环聚合轨迹、诊断根因、生成更新提案再通过验证门槛发布新版本。两者通过版本化的经验库和评估集连接。分层评估指标持续进化的评估不能只用端到端分数。需要区分两种能力Harness 更新能力是从轨迹中产生有价值的持久修改Harness 受益能力是任务 Agent 在后续运行中找到、激活并正确使用这些修改。一个 Skill 本身可能写得完全正确但较弱的任务模型没有在合适场景加载它或加载后无法长期遵循都会让最终成绩看起来没有进化。指标回答的问题更新提案有效率更新器是否提出了有价值的修改产物激活率任务 Agent 是否在正确场景加载了新能力遵循成功率激活后是否按新规则或流程执行保留任务集增益整体是否改善了未参与进化的任务长期评价至少同时观察五类结果回退新经验是否与已有经验冲突、泛化能力在测试集未覆盖的场景中是否提升、Token 效率、安全性规则和隐私边界是否漂移、以及长期工程质量维护复杂度是否恶化。可验证闭环的边界前面的闭环在 Coding、工具调用和业务状态变更等任务上最容易成立因为测试、环境状态或确定性规则能够快速给出反馈。开放式科研、战略规划和复杂产品设计则不同评价信号来得慢正确答案不唯一。自动科研的实验暴露了三类问题一是实现漂移原方案一旦变难Agent 会逐渐退回训练数据中更熟悉但偏离研究假设的实现二是认识论上的过度乐观信号可能只是噪声系统却开始解释结果并宣布发现三是隐性判断力不足Agent 可以运行实验却未必知道什么基线真正重要、何时应该放弃假设。这类任务需要改变证据和监督结构结论与证据分离保留负面结果维护搜索多样性让人类在更高层介入。持续进化的安全边界Agent 的自我进化能力有可能把一次错误变成长期风险。网页、邮件和工具输出中的提示注入若被总结成经验可能跨会话反复生效自动搜索的恶意软件包若被封装成工具影响会从一次沙盒运行扩散到所有后续任务。三道边界构成了安全防护的核心第一道边界证据与指令隔离。原始网页、工具输出及其 LLM 摘要都属于不可信证据不能当作指令执行也不能直接纳入长期能力。系统应按固定 schema 提取主张、原文位置和采集时间提取出的字符串绝不能作为指令执行。待发布内容还需通过确定性的 schema、允许列表和来源检查以版本化的 pull request 提交。第二道边界待验证能力与正式能力隔离。新知识、Prompt、Skill、程序和参数都先进入不可服务真实流量的待验证区。新生成的代码和外部依赖还要经过沙盒、权限检查、供应链扫描与行为测试等安全检查。第三道边界安全机制不可自我修改。业务 Agent 可以修改 Prompt、Skill、知识库、工具等但不能修改批准自身更新的验证器、测试用例、发布门槛、审计日志和稳定版本备份。否则一个 Agent 只需降低测试阈值或删除失败用例就能把退化伪装成进步。小结持续学习正在成为 Agent 最重要的能力之一但今天的模型还无法自行完成可靠的持续学习。推理时的上下文适应不会自动持久化未经验证的在线参数更新又会放大噪声、攻击和能力漂移。现阶段更可行的路径是在模型外围建立可验证的学习系统。Agent 从与环境的交互和评价中获得学习信号再根据能力的表示性质更新知识、Prompt、Skill、程序或模型参数。持续进化需要把在线执行与离线学习分开在线记录证据离线生成并验证更新提案再逐步发布、整理或回滚。这个闭环在结果可自动验证的任务上最可靠对于目标模糊、反馈延迟的开放任务人仍需参与问题定义和评价标准的制定。遇到问题时先判断它更适合由外部规则、程序流程、Skill 还是模型参数处理再用独立的边界任务和原有任务检查修改是否真正有效——这是当前阶段最务实的工程原则。本文内容整理自开源技术书《深入理解 AI Agent》(bojieli/ai-agent-book)采用 Apache 2.0 许可证
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进