ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

awesome-agentic-ai-zh 进阶阅读:以失败证据驱动 Agent 复杂度决策(Stage 7.5 精读)

awesome-agentic-ai-zh 进阶阅读:以失败证据驱动 Agent 复杂度决策(Stage 7.5 精读) 教程文档AI Agent人工智能大模型【免费下载链接】awesome-agentic-ai-zhA trilingual (繁中 / English / 简中) learning roadmap for agentic AI: from LLM basics to multi-agent systems, with 240 curated resources and hands-on examples. 中文 AI agent 學習地圖。项目地址https://gitcode.com/gh_mirrors/aw/awesome-agentic-ai-zh点击查看免费下载本文基于仓库内 stages/07.5-advanced-agentic-concepts.en.md 展开。这一关Stage 7.5不是名词收藏柜而是一道工程决策题哪个已复现的失败才值得你多加一层检查、故障测试、自主权分级或 Harness 组件读完本文你将能用白话讲清四个进阶核心词及各自处理的失败类型从一张短选择表中只挑一个候选做法用同一组 Eval、成本与安全结果决定复杂度去留并对 Harness 组件做出 KeepSimplifyRemove 判断且保留可回退路径。本文全程不要求写代码、购买 API 或公开模型的私有 Chain-of-Thought。这一关回答的唯一问题加复杂度之前先拿出证据Stage 7.5 在整条学习路线中的定位是进阶阅读站reading-map而不是第六个动手实现章。仓库设计文档 stages/DESIGN.md 明确写到Stage 7 负责基础Stage 7.5 只保留进阶选择它不再重教 Harness、Loop、Graph、Eval 的定义——这些是前一关的内容本文只在其上做取舍判断。全章只回答一个问题哪个已复现的失败值得你多加一层检查、故障测试、自主权分级或 Harness 组件而且默认答案就是先不加先量出单一 Agent 的 baseline只有新做法在同一组 Eval 中带来可重现的改善才保留它。最短进入条件完成 Stage 7 — Agent 上线工程能用Eval、Trace、Approval、Recovery证明系统可测、可看、可停、可恢复已有一组能重跑的 Eval cases、停止条件以及单一 Agent 的 baseline。如果上述条件不满足文档的建议是先回 Stage 7 补齐证据而不是先加一个 Agent。这体现了本章的第一原则没有可复现的失败证据就没有增加复杂度的资格。三份必读分别支撑一类决定Anthropic — Building Effective Agents先用最简单的 workflow只有能证明分工有价值时才增加 Agent支撑该不该多 Agent。Anthropic — Demystifying Evals for AI Agents把失败变成可重跑案例再比较 Outcome、Trajectory、成本与稳定性支撑该不该留。OpenAI — Harness Engineering看真实 codebase 如何用清晰边界、文档与机械 gate 让 Agent 稳定工作这只是一个案例研究不是所有系统的唯一架构。四个进阶核心词先看白话地图再看技术边界文档先用一张 2×2 分组总览表给出白话入口前两个词属于先找出真正的失败后两个词属于再控制新增的复杂度。先处理什么核心词白话说法何时使用技术边界先找出真正的失败Evaluator–OptimizerAgent-as-Judge评估者—优化者由 Agent 评分一个做一个照清单检查内容需要判断品质时才用Judge 也会犯错不能单独决定真相先找出真正的失败Failure InjectionChaos Eval故障注入混沌评测故意拔掉一块小积木看房子会不会安全停下只在隔离环境制造可控的小故障不能拿真实资料随意做实验再控制新增的复杂度Autonomy GradientsTrust Layers自主权梯度信任层级事情越危险AI 可以自己走的路越短依风险缩小权限付款、删除、发布或外部消息要先问人再控制新增的复杂度Model–Harness Fit模型—Harness 适配换了新引擎就一次拿掉一个零件再重考用同一组 Eval 决定组件要保留、简化或移除安全责任不能因模型变强就删除这张表的结构不是随意的——仓库测试 scripts/test_stage075_content.py 对它有硬性契约四个粗体核心词必须以Evaluator–Optimizer → Failure Injection → Autonomy Gradients → Model–Harness Fit的顺序出现在可见正文中且四个词必须集中在唯一一张带两个rowspan2分组的两两表格里。也就是说这四件事是两个阶段里的平行选择不是按顺序都要安装的四件套。下面四段不是第二份名词表而是补充每个做法何时有用、以及最容易踩到的边界。1. Evaluator–OptimizerAgent-as-Judge让另一个检查者照规则挑错一个角色产生输出另一个角色按照明确的 rubric评分规则找出问题产生者只在检查者提供新证据时做有界修正bounded revisions。适用场景答案不是简单的对或错必须判断完整性、忠实度faithfulness或写作质量。技术边界Judge 也会犯错不能让它单独决定真相。至少要搭配固定案例、可编程检查、人工抽样以及修正次数上限。易混概念Constitutional AI是基于原则principle-based的训练与批判方法不等于所有 runtime LLM judge——它是训练方法不是运行时评分器。2. Failure InjectionChaos Eval故意弄坏一小块确认系统会安全停下主动制造可控、可恢复的小故障——例如 timeout、旧数据、坏格式malformed output或工具不可用——然后检查停止stopping、降级fallback与恢复recovery是否符合预期。命名澄清Failure InjectionChaos Eval 是本章采用的编辑社群统称不是跨供应商公认的标准名称。技术边界先在隔离环境测最小故障不能拿真实生产数据随意做事故实验。启动方法可先参考 Anthropic — Demystifying Evals 的设计思路把故障变成可重跑案例。3. Autonomy GradientsTrust Layers风险越高Agent 能自己决定的越少按任务风险给 Agent 分配不同程度的自主权只读查询可以自动执行付款、删除、发布或外部消息则应先成为提案交给人类核准。命名澄清这同样是本章采用的编辑社群统称不是单一官方标准。常见阶梯suggest → propose → execute但实际层级由风险、权限与责任归属人决定不由模型自评决定——模型不会自己给自己升权限。4. Model–Harness Fit模型变强后重新证明每个外加步骤的价值更换模型或版本后一次只拿掉一个 Harness 组件做删除测试再用同一组质量、安全、成本与延迟 Eval 决定保留、简化还是移除。命名澄清Model–Harness Fit 是本章的编辑简称不是公认标准术语。最重要的边界它不代表用更强模型取代权限least privilege、sandbox、audit log、人工核准或 rollback。这些是长期责任不能因为模型升级就直接删除。其他候选模式看到这种证据才选除了四个核心词文档还给出一张五行的候选模式短表。规则是一次只从表里选一个且必须先在对应场景看到证据。候选模式白话说法先看到什么证据官方原始入口Parallel Exploration平行探索同时试几条互不依赖的路再比较问题真的能分开且增加的成本与合并工作小于品质或时间收益Anthropic parallelization workflowHierarchical Delegation阶层式委派大工作逐层拆给较小角色单一 context 放不下或子任务有清楚输入、输出与验收人Anthropic orchestrator-workers新 Microsoft 项目可从 Microsoft Agent Framework 开始AutoGen 已进入 maintenance modeMulti-Agent Handoff多 Agent 交接把控制权、必要数据与完成证据一起交棒不同角色必须直接接手且交接后的错误率低于单一 Agent baselineOpenAI Agents SDK orchestrationPlan–Act–Reflect规划—行动—回看先计划、执行、读证据再有限次修正测试或 grader 能指出可修正失败不是把同一句话再试一次Reflexion 论文arXiv:2303.11366Dynamic Workflows动态工作流程让 Agent 写出可重跑的分工脚本任务可平行、可重跑且固定 workflow 不足以表达当次分工Claude Code Dynamic Workflows这张决策地图的摆放位置同样受测试约束test_stage075_content.py要求它必须出现在四个核心词与五个候选模式都用正文解释之后last_term diagram_ref且在最小决策记录小节之前——即正文必须先定义图中名词图片只做总结不做首次教学。这与设计文档中正文必须先定义图中名词的原则一致。最小决策记录加任何东西之前先填完五行文档给出一段可直接复制的决策记录模板这是要不要加复杂度的唯一入场券已复现的失败哪个 case 失败Outcome 或 Trajectory 哪里不合格 单一 Agent baseline品质、成本、延迟、安全结果是多少 只加的一个做法它要防住哪个失败 接受门槛同一组 Eval 至少改善什么而且不能牺牲什么 停止回复没改善、变贵或变危险时怎么撤掉判定规则很硬如果第一行没有证据先补 Eval case如果第四、五行写不出来没有接受门槛或没有停止回退方案就先不要增加复杂度。这个模板本身就是一个最小可验证单元它把感性的加个功能翻译成可复现失败、可量化基线、可执行删除测试三件事。Model–Harness Fit 决策表保留、简化还是移除模型变强时某个重复提醒 prompt、context reset 或额外 plannerreviewer 可能不再需要。操作纪律只有一条一次只改一个组件task、数据、工具、环境、grader 与门槛全部保持不变再比较多次 trials。决定你看到的证据下一步保留 Keep拿掉后同一个可复现失败又回来或安全门槛退步放回去记下它防住的 case 与版本简化 Simplify保护仍有用但较少步骤也能通过同一组 Eval一次再少一个步骤重跑相同 trials移除 Remove删除测试通过品质与安全未退步成本或延迟相同或更好移除后持续监测保留可验证的回退方法动手前先给组件分类因为两类组件的判定边界完全不同先分哪一类例子判断边界可能补某代模型弱点的组件context reset、重复提醒 prompt、额外 plannerreviewer模型变更时可以做删除测试但只能由同一组 Eval 决定长期安全责任最小权限、sandbox、audit log、人工核准、rollback实现可以更换责任不能靠模型变强直接删除设计文档特别强调图中 KeepSimplifyRemove三个判断是平行结果不是成熟度阶梯——你不需要先 Keep 再 Simplify 最后 Remove它们是互斥的三种结论取决于删除测试的实际结果。展开Bitter Lesson、人机分工与删除测试的限制每加一层记录三件事哪个可复现失败需要它、哪个 Eval 证明它有效、哪个删除测试能证明它已不再需要。Bitter Lesson 的边界这与 Rich Sutton 的 The Bitter Lesson 思路相呼应但那篇文章并没有把它当成Agent Harness 设计的定律引用时不应过度拔高。人机分工的观察数据Anthropic 对 2025-10 到 2026-04 的 Claude Code 使用数据进行分析平均观察到用户做出约70% 的 planning decisions而 Claude 做出约80% 的 execution decisions。文档明确提醒这是特定产品与数据集的观察不是每个团队都该硬套的比例。真正可带走的原则是人负责目的、边界与验收Agent 负责范围内的执行。Dynamic Workflows当 Agent 把分工写成可重跑的脚本这是 Claude Code 的 Agent 编排orchestration功能不是模型也不是 OpenRouter、Airflow 或 n8n 的替代品。只有任务能安全 fan out扇出、结果可比较、重跑有价值时才选它。当前可用条件现行官方文档列出所有付费方案、Anthropic API以及 Amazon Bedrock、Google Cloud Agent Platform、Microsoft FoundryPro 用户可从/config启用。工作机制Claude 生成 JavaScript 编排脚本由后台 runtime 执行中间结果留在脚本变量里只有最终结果回到对话 context。启动方式明确要求use a workflowrun a workflow或使用ultracode/effort ultracode需要 Claude Codev2.1.203且模型支持xhigheffort。当前上限最多16 个并发 agents、每次 run 累计1,000 个 agents。文档强调这是防 runaway失控的上限不是建议你用满的目标。安全边界subagent 的工具仍受 permission 与 sandbox 规则约束workflow 脚本本身没有任意 shellfilesystem 访问权。长 run 会消耗更多 token启动前要先看清 scope 与成本。限制run 进行中不能插入一般用户输入共享状态很多、或只需一个 Agent 的工作不适合 fan out。一个容易误读的历史事实2026-05-28 的发布公告把它称为 research preview并与 Opus 4.8 同日公布。这只是一段历史不代表该功能今天绑定 Opus 4.8现行规则以 Dynamic Workflows 官方文档为准。仓库测试甚至专门禁止旧版本号v2.1.154出现在正文里并要求v2.1.203、16、1,000等事实保持最新。深读证据三个失败案例与读 benchmark 的正确姿势三个案例教了什么——以及如何避免读错分工后风格对不上Cognition 的 Flappy Bird 案例提醒多个 subagent 若拿不到共同背景最后产出的碎片很难拼在一起。来源Cognition — Dont Build Multi-Agents。研究 Agent 补进未验证的推测Anthropic 的 Research 系统用 source quality、引用与 evaluator 来降低 speculative leap推测性跳跃。来源Anthropic — How we built our multi-agent research system。文字规则没有变成机械防线2025-07 的 Replit production database 事件是第三方记录案例AI Incident Database #1152 与 The Register 报道。它提醒 permission gate 的重要性但不代表所有产品或版本都会发生相同行为。文档给出一个非常克制的结论事故不会自动变成最佳实践。只有当教训被写成权限、测试、review 与 recovery gate 时系统才真的改变。怎么读 Agent benchmark才不会被单一分数骗Agent benchmark 同时量到模型、prompt、tool、harness、硬件、timeout 与 grader。对比时至少要固定 task、scaffold、工具、数据与环境重跑多次 trials分开基础设施错误infrastructure error与解题失败使用 held-out cases留出集让 Judge 搭配确定性检查deterministic checks与人工抽样。依据Anthropic 2026 年的研究显示基础设施差异可能大到超过排行榜上模型之间的差距因此小幅领先不等于稳定更强。这条提醒正好呼应本文的核心方法论任何更好都必须在同一组受控 Eval 上可重现否则只是噪声。精选阅读与完整学习资源先挑一条路径Anthropic — Building Effective Agents⭐⭐⭐⭐⭐第一次读进阶 Agent pattern先从这里开始。OpenAI — Harness Engineering⭐⭐⭐⭐⭐看边界、文档与机械 gate 怎么放进真实 codebase。Anthropic — Demystifying Evals for AI Agents⭐⭐⭐⭐⭐想知道怎么验收 Agent先读这篇。Microsoft Agent Framework⭐⭐⭐⭐⭐要看现行 Microsoft multi-agentworkflow 实现不要从 maintenance-mode 的 AutoGen 开新项目。datawhalechina/hello-agents⭐⭐⭐⭐⭐想用中文把概念接到完整实现。完整学习资源与限制24 项分类资源适合读什么编辑评分限制状态基本设计与 ContextAnthropic — Building Effective AgentsWorkflow、Agent 与常用 pattern⭐⭐⭐⭐⭐2024 年的基础文章不是最新产品清单基本设计与 ContextEffective Context Engineering怎么挑 context不把窗口塞满⭐⭐⭐⭐⭐供应商文章原则可跨模型使用基本设计与 ContextOpenAI Harness Engineering可读 codebase、SoR、invariant⭐⭐⭐⭐⭐单一 OpenAI codebase case study基本设计与 ContextEffective Harnesses for Long-running Agents跨 session artifact 与增量进度⭐⭐⭐⭐特定 coding harness 实验基本设计与 ContextHarness Design for Long-running AppsPlannerGeneratorEvaluator⭐⭐⭐⭐2026 Labs case study不是唯一架构OrchestrationContractsAnthropic Multi-Agent Research SystemOrchestrator-workers 的生产经验⭐⭐⭐⭐⭐最适合 breadth-first researchtoken 开销高OrchestrationContractsLangGraphStateful graph、checkpoint、HITL⭐⭐⭐⭐低阶框架要自己设计 state 与 EvalOrchestrationContractsMicrosoft Agent FrameworkPython.NET Agent 与 workflow⭐⭐⭐⭐⭐AutoGenSemantic Kernel 的现行后继入口OrchestrationContractsOpenAI Agents SDK Sandbox AgentsWorkspace、session、snapshot、sandbox⭐⭐⭐⭐Beta接口仍可能变化OrchestrationContractsClaude Code Dynamic WorkflowsAgent 编写、可重跑的编排⭐⭐⭐⭐Claude Code 功能高 token、非通用 workflow engineEvalResilienceDemystifying Evals for AI AgentsCapability、regression 与 transcript Eval⭐⭐⭐⭐⭐先从小而能重现的 failure set 开始EvalResilienceInfrastructure Noise in Agentic Evals硬件与环境如何扭曲分数⭐⭐⭐⭐特定 benchmark 实验不要外推精确幅度EvalResilienceBest Practices for Rigorous Agentic BenchmarksTask、reward 与环境设计缺陷⭐⭐⭐⭐研究论文需搭配 benchmark 现行版本EvalResiliencetau2-benchTool-Agent-User interaction 与 pass^k⭐⭐⭐⭐Benchmark 不是 production SLAEvalResilienceSWE-bench真实 GitHub issue 的 coding Eval⭐⭐⭐⭐⭐分数受 harness、版本与环境影响Research patternsReActarXiv:2210.03629ReasoningActionObservation loop⭐⭐⭐⭐⭐教可观察行动不要求公开私有 CoTResearch patternsReflexionarXiv:2303.11366Feedback 后修正策略⭐⭐⭐⭐研究设定不等于每个 production loopResearch patternsConstitutional AIarXiv:2212.08073Principle-based critique 与 revision⭐⭐⭐⭐训练方法不能直接等同 LLM-as-judgeResearch patternsCAMELarXiv:2303.17760Role-playing multi-agent research⭐⭐⭐研究原型高风险责任仍需固定 ownerResearch patternsDSPyTyped signatures、program optimization⭐⭐⭐⭐框架持续更新先锁版本与 Eval中文动手入口datawhalechina/hello-agents中文完整 Agent 教材⭐⭐⭐⭐⭐篇幅长按本章概念挑章节中文动手入口Microsoft AI Agents for Beginners18 课 Agent 入门与多语教材⭐⭐⭐⭐供应商范例较多先看概念再选 SDK中文动手入口LangChain Deep AgentsPlanning、subagent、filesystem harness⭐⭐⭐⭐较高阶抽象不是所有任务都需要中文动手入口李宏毅生成式 AI 课程中文课程与研究背景⭐⭐⭐⭐⭐依年份挑主题产品接口仍查官方 docs这张 24 项资源表是本章的完整学习资产分类结构55554与每项评分都被scripts/test_stage075_content.py逐条锁定确保三个语言版本共享同一批 URL 与评分不出现版本漂移。完成检查五条通过标准我能用白话解释四个进阶概念并说出三个编辑社群命名的边界它们不是跨供应商正式标准。我先有单一 Agent baseline 与可重跑失败才从选择表增加一个模式。我会用同一组 Eval 比较品质、安全、成本与延迟不只看一次漂亮回答。我能对一个 Harness 元件做 KeepSimplifyRemove 决定并指出证据与回退方法。我知道 Judge 也要被检查故障注入先在隔离环境做高风险动作不由模型自行升级权限。五项都做到就可以进入 Stage 8 — Agent 操作界面如果还没有 baseline 或失败证据先回 Stage 7 补齐而不是再加一个 Agent。这一页在仓库中的契约内容如何被测试与保鲜Stage 7.5 页面本身在仓库里是一等公民有独立的自动化契约保护这是它区别于随手笔记的地方内容结构测试scripts/test_stage075_content.py验证四个核心词的顺序与 2×2 表格结构、五个候选模式全部出现在可见正文、决策地图图片的位置在所有概念解释之后、决策记录之前、四个details折叠块全部闭合、资源表 24 项 URL 与评分逐条匹配。三语镜像一致性繁中简中英文三个版本共享相同的 freshness 标记verified_on2026-09-13、max_age_days90与相同的外部来源列表英文正文不得残留未翻译的中文字符。过时声明拦截测试明确禁止正文出现Replit Agent 2024、Context 200k、3.5 PR/day、75% reward hacking、v2.1.154等已过时或无法证实的主张——这正是有证据才写的仓库级执行。定位契约设计文档 stages/DESIGN.md 与图片提示日志 resources/diagrams/locale-variant-prompts.md 共同约定本页为四张平行概念卡 三个平行判断不是成熟度阶梯且 Stage 7.5 不包含 example-hardening 第二层不做代码练习。换句话说本文讲的每一句边界和默认不加在仓库里都被测试与设计文档固化成可执行契约。如果你要在一个真实 Agent 系统里实践本章最小可行的第一步是先复现一个失败把它写进 Eval case量出单一 Agent baseline——然后才轮到考虑要不要加第二个 Agent、一个 Judge、一层故障注入或一个 workflow。赞分享教程文档AI Agent人工智能大模型【免费下载链接】awesome-agentic-ai-zhA trilingual (繁中 / English / 简中) learning roadmap for agentic AI: from LLM basics to multi-agent systems, with 240 curated resources and hands-on examples. 中文 AI agent 學習地圖。项目地址https://gitcode.com/gh_mirrors/aw/awesome-agentic-ai-zh点击查看免费下载相关推荐awesome-agentic-ai-zh 进阶阅读页渐进式重构实战Stage 07.5 的问题导向阅读地图改造方案awesome agentic ai zh 进阶阅读页渐进式重构实战Stage 07.5 的问题导向阅读地图改造方案 导读 本文讲解开源学习路线图仓库 a教程文档AI Agent人工智能大模型awesome-agentic-ai-zh Stage 04 阅读体验重构与 Agent 框架范例现代化实战指南awesome agentic ai zh Stage 04 阅读体验重构与 Agent 框架范例现代化实战指南 本文以仓库内实施计划 docs/plans/2教程文档AI Agent人工智能大模型awesome-agentic-ai-zh 的 Stage 7.5 概念图重产规格从失败证据到最小必要做法的三语可视化契约awesome agentic ai zh 的 Stage 7.5 概念图重产规格从失败证据到最小必要做法的三语可视化契约 本篇技术指南以 resources教程文档AI Agent人工智能大模型上一篇猫步简历终极指南如何5分钟打造专业简历的完整教程下一篇freecodecamp.cn挑战系统原理解析如何实现实时代码评测创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进