
AI 技能/插件提示工程AI 评测人工智能【免费下载链接】context-engineering-kitHand-crafted Claude Code Skills focused on improving agent results quality. Compatible with OpenCode, Cursor, Antigravity, Gemini CLI, and others. Includes CodeRabbit open-source alternative.项目地址https://gitcode.com/gh_mirrors/co/context-engineering-kit点击查看免费下载Context Engineering Kit是一个手工打磨的 Claude Code 技能Skills开源仓库兼容 OpenCode、Cursor、Gemini CLI 等主流 AI 编程工具。其 SADD 插件Subagent-Driven Development子代理驱动开发提供的/do-and-judge命令正是目前落地LLM-as-Judge大模型当评委最完整的质量门Quality Gate实践之一先让子代理干活再让独立的评委代理按评分标准打分不达标就带着反馈自动重试直到通过为止。本文将带你从零看懂这套执行 评审 重试闭环的设计原理与使用方法。为什么 Agent 需要一道LLM-as-Judge质量门用 AI 编程代理写代码时最常见的问题是代理自己说做完了但结果质量参差。长会话中上下文会不断污染——假设过期、实现漂移、注意力涣散代理往往对自己的疏漏毫无察觉。LLM-as-Judge 的思路很直白用一个独立的模型或代理来评审另一个模型的工作成果按结构化评分标准Rubric打分、列证据、下结论。这比让代理自查可靠得多因为评委与执行者上下文隔离能发现自查的盲区。Context Engineering Kit 的 SADD 插件把这一思路工程化为一条完整的流水线新鲜上下文每个子代理干净启动不受之前任务污染⚖️外部验证独立的 judge 代理机械地套用评分标准捕获自查遗漏的盲点反馈循环不达标时把评委指出的问题原样喂回执行代理最多重试 3 次质量门分数不达标的产出不会发货。/do-and-judge 的三角色分工谁来干活、谁来定标准、谁来打分/do-and-judge的核心设计是三个角色分离分别对应生产者—标准制定者—评估者角色代理职责执行者Producer实现子代理如sdd:developer干净上下文中完成具体任务标准制定者Criteria-settermeta-judge 代理在实现开始前生成本任务专属的评分规范 YAMLRubric 维度 Checklist 权重评估者Evaluatorjudge 代理拿着评分规范对成果逐项打分、列证据绝不自由发挥三个角色各司其职的关键好处评分标准是先于实现制定的评委无法事后迎合实现评委只认规范、不认人情连及格线是多少都不告诉它从机制上避免打分偏松。第一步meta-judge 生成本任务专属评分标准普通评审最大的坑是标准模糊——代码质量良好这种话没法机械执行。meta-judge 代理的职责就是把抽象的质量分解成可测量的具体维度输出一份 YAML 评估规范包含Rubric 维度每个维度带权重、评分说明以及一对锚点样例一段明显不合格的score_2片段、一段明显达标的score_4片段强制评委把成果定位在这两极之间的具体轴线上而不是凭印象打分Checklist 布尔清单原子化的是/否问题按essential / important / optional / pitfall分级——关键项答否会触发总分封顶反模式项答是会扣分评分元数据权重求和、门限与罚则。这样评委拿到的不再是一句请评审而是一份可以直接照章执行的检查表。第二步并行派发——评审标准与实现同时进行编排器Orchestrator在同一条消息里并行派发两个子代理meta-judge 先生成评分规范先派发是为了让它在实现改动文件之前观察代码基线实现子代理开始干活其提示词自带零样本思维链前缀 强制自我批判校验表要求它提交前逐项回答是否覆盖全部需求、是否遗漏边界情况等问题并附证据。并行执行让定标准不占用额外时间——这是该技能宣称的关键提速点。第三步judge 严格打分且不知道及格线实现完成后编排器把 meta-judge 的评分规范 YAML原封不动不得增删、缩写、改写连同实现摘要一起交给 judge 代理。judge 的工作流是收集上下文必要时运行 build/test/lint 做实证验证先独立起草我认为正确答案应该长什么样的参照基线防止被实现输出带偏对照基线做差异分析匹配/缺口/偏差/错误逐项过 Checklist逐维度做锚点定位式评分——先写推理和证据后出数字杜绝先给分再圆理由加权汇总、应用门限罚则最后还做一轮自我校验5 个自问问题再提交报告。值得注意的是编排器永远不会告诉评委4 分及格。评委只知道证据和规范分数是否达标由编排器判断——这是防止评委放水凑及格的刻意设计。评分与重试循环4 分及格、3 次重试上限拿到VERDICT / SCORE / ISSUES结构化结论后决策逻辑非常清晰score ≥ 4.0→ ✅ PASS输出最终报告含可选改进建议3.0 ≤ score 4.0→ 处于自由裁量区间若未决问题只有低/中优先级的小瑕疵可接受为 PASS 并列出遗留问题只要有 High/Critical 问题则必须重试score 3.0→ 无条件 FAIL带着评委的具体问题清单进入重试。重试时有一个容易被忽略的精细设计——模型分级升级Escalation如果首轮分数过低、或问题暴露出模型没理解任务而非漏了细节下一次重试把执行代理和评委一起升一档haiku → sonnet → opus如果只是明确的、可定位的具体缺陷则保持原档位用精确反馈重跑更快meta-judge不重跑评分标准在整个重试周期内保持不变保证跨轮次可比3 次重试后仍不通过立即停下来升级给人给出全部评分历史、顽固问题和四个选项补充上下文 / 升档重跑 / 修改需求 / 中止绝不在opus档反复空转。一行命令启用质量门/do-and-judge 使用说明先获取项目安装 SADD 插件即可启用/do-and-judge命令git clone https://gitcode.com/gh_mirrors/co/context-engineering-kit基本用法就是把任务描述直接交给命令/do-and-judge 重构 UserService 类使用依赖注入两个常用参数参数作用--model haiku\|sonnet\|opus显式指定所有子代理实现、meta-judge、judge的模型档位覆盖自动选择策略--strict开启严格模式取消自由裁量区间只有 score ≥ 4.0 才算通过否则重试到上限为止例如/do-and-judge 重写 API 认证文档覆盖 OAuth2 流程 --strict模型档位怎么选haiku / sonnet / opus 决策表技能文档强调选模型是杠杆最大的决策比任何提示词技巧都重要。默认档位是sonnet/haikuopus必须挣到才启用任务形态档位例子单文档/单行级修正、无代码推理haiku修错别字、更新链接单文件小幅机械改动≤10 行haiku改常量、加守卫语句常规代码编写新函数、组件、测试单模块sonnet加一个 endpoint、写服务方法测试多文件重构≥3 文件/ 关键路径认证、支付、数据完整性、不可逆迁移/ 复杂逻辑并发、架构决策opus跨切面重构、Schema 迁移两条铁律多条规则同时命中时取最高档4 行安全关键代码也是 opus 的活纯机械的广范围改动如跨 40 个文件改名不因此升档。什么时候该用 /do-and-judge✅ 单任务、边界清晰的实现工作写功能、修 Bug、改文档——最典型的场景✅ 质量要求高、不能靠看起来不错交付的任务用--strict✅ 希望自动化闭环、少盯过程的日常开发⚠️ 任务依赖你的整体架构愿景、需要与 Spec 严格对齐时可考虑仓库中的 Spec-Driven DevelopmentSDD插件⚠️ 多方案对比择优请用/do-competitively多轮多评委辩论请用/judge-with-debate见 SADD 命令总览。关键文件与延伸阅读资源说明plugins/sadd/skills/do-and-judge/SKILL.md/do-and-judge完整实现五阶段流程、模型选择策略、重试与升级规则plugins/sadd/agents/meta-judge.mdmeta-judge 代理如何生成锚点式评分规范 YAMLplugins/sadd/agents/judge.mdjudge 代理CheckEval 清单法 锚点定位打分的完整评审流程plugins/sadd/README.mdSADD 插件总览并行/顺序/竞争性执行与理论基础LLM-as-a-Judge 等论文docs/plugins/sadd/usage-examples.md真实场景用例批量执行、并行排查测试失败等skills/do-and-judge/SKILL.md可直接安装的独立技能版本小结质量门的价值不止于打分/do-and-judge把 LLM-as-Judge 从论文概念变成了可运行、可重试、可升级的工程质量流程标准前置meta-judge、执行与评审上下文隔离、评分有证据可审计、重试带精确反馈、失败有明确的升级给人出口。对新手来说只需记住一句话——把它当成一条带自动返工的流水线你说清任务它负责做到4 分才交卷。赞分享AI 技能/插件提示工程AI 评测人工智能【免费下载链接】context-engineering-kitHand-crafted Claude Code Skills focused on improving agent results quality. Compatible with OpenCode, Cursor, Antigravity, Gemini CLI, and others. Includes CodeRabbit open-source alternative.项目地址https://gitcode.com/gh_mirrors/co/context-engineering-kit点击查看免费下载相关推荐Mirth Connect终极指南掌握医疗集成的瑞士军刀 Mirth Connect终极指南掌握医疗集成的瑞士军刀 Mirth Connect被誉为医疗集成领域的瑞士军刀能够轻松连接各种医疗系统和数据格式。这后端医疗健康数据集成消息路由Agent-Skills-for-Context-Engineering 技能索引指南LLM-as-a-Judge 评估技能体系全解析Agent Skills for Context Engineering 技能索引指南LLM as a Judge 评估技能体系全解析 本文以 example人工智能AI 技能提示工程AI 评测Agno Accuracy Eval 实战指南用 LLM-as-Judge 量化 Agent 回答准确率Agno Accuracy Eval 实战指南用 LLM as Judge 量化 Agent 回答准确率 本文围绕 agno 的 accuracy 评估能力展人工智能大模型AI AgentAgent 框架多智能体工具调用RAGAgent 工作流Agent 记忆创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考