为 Agent 建立或改进评估体系时使用——设计评估指标(Pass@k/Pass^k/成本)、搭建可重复运行的评估环境、选择确定性验证器或 LLM-as-a-Judge 及各自适用边界、编写 Rubric、做失败归因与回归任务、评估驱动的模型选型、判断统计显著性、建设可观测性与内部评估基础设施(消融、AB 测试、特性开关、提示词回归)、从 Benchmark 报告走到系统改进。
日本語の概要は準備中です。原文の説明を表示しています。
构建或修复 Agent 迭代循环时使用——解决 Agent 过早宣称完成、活干到一半就停、假成功、循环停不下来等问题,设计验证器与终止条件,实现提议者-审核者(Proposer-Reviewer)双 Agent 循环。覆盖过早终止三种形态、验证器是循环瓶颈的原则、LoopX 持久控制面、LongHorizon-Harness 的 MEA 循环、提议者-审核者最小不变量(审核者读独立证据、退回给可定位修复条件)。
インストール方法を見るインストールする前に、エージェントに与えられる指示の中身を確認できます。
| 形态 | 表现 | 根因 |
|---|---|---|
| 偷懒式假完成 | 只做一部分就宣称全部做完:代码写完测试没跑、部署没试就报"任务完成";交代两件事只办一件就汇报"都办好了" | 缺少覆盖全部验收项的验证清单 |
| 过早放弃 | 一条路走不通就宣布整件事办不成:打了一个电话被拒就告诉用户"办不了",其实还有表单、邮件等渠道 | 未枚举替代路径,无重规划机制 |
| 假成功 | 以为办成了,实际闭环没走完:对方口头同意退款,但用户还需在 App 确认一步,Agent 却报"已办妥" | 把中间确认当最终状态,缺端到端闭环校验 |
三种形态指向同一根源:完成的标准由模型自述,而非由验证器判定。
candidate = proposer(task, constraints)
evidence = execute_or_render(candidate) # tests, state, screenshot, facts
review = independent_reviewer(candidate, evidence)
while review.veto and budget_remaining:
candidate = proposer.repair(candidate, review.findings)
evidence = execute_or_render(candidate)
review = independent_reviewer(candidate, evidence)
if review.pass:
publish(candidate, evidence, review) # 连证据一起发布
else:
escalate_or_reject(review) # 预算耗尽则升级,不放水
三条最小不变量:
LoopX 决策 → Agent 执行 → 独立验证器证明 → LoopX 提交
把长程执行重新表述为任务状态管理,循环实现为 Manage–Execute–Audit:
价值在于把任务连续性从不断增长的执行历史中分离出来:上下文可以刷新、界面操作可能失败,下一轮仍从最近一次已核实的状态继续。论文在模型与执行后端相同、只改外层 loop 的对照中,WeaveBench PassRate 从 51.8% 提升到 80.7%,OSWorld 2.0 二元完成率从 2.8% 到 8.3%,Terminal-Bench 2.1 从 69.7% 到 77.2%;代价不固定——前两个基准分别多耗 2.3 倍总 token 与 3.6 倍输出 token,第三个反而少 24%。部署时还需处理旧状态失效,并用轮数、时间、费用预算防止恢复循环无限运行。
同一范式适用于:安全审查(提议者生成操作方案,审核者查合规与风险)、内容审核(起草回复,审核者查业务规则与用语规范)、代码审核(写代码,审核者查安全与最佳实践)。变体还包括规划者–生成者–评估者三 Agent:先约定每轮完成标准,评估者操作真实应用并提交缺陷报告。
chapter5/paper-to-ppt/ — Proposer 写 Slidev 代码,Reviewer 逐页真渲染 PNG 并用 Vision LLM 给结构化意见(page/issue_type/severity/suggestion + 总分与 pass),双 Agent 峰值上下文 24,186 vs 单 Agent 自审 92,601 tokenchapter5/video-edit/ — 两步 Vision 定位(10s 粗扫 → 1s 精扫)封装为子 Agent,Proposer 生成 Blender bpy / ffmpeg 剪辑脚本,Reviewer 采样关键帧复审迭代book/chapter10.md「对等协作模式」→「Loop 工程」book/chapter10.md「对等协作模式」→「提议者-审核者范式」まだレビューはありません。使ってみた感想をお寄せください。
概要と使いどころ
为 Agent 建立或改进评估体系时使用——设计评估指标(Pass@k/Pass^k/成本)、搭建可重复运行的评估环境、选择确定性验证器或 LLM-as-a-Judge 及各自适用边界、编写 Rubric、做失败归因与回归任务、评估驱动的模型选型、判断统计显著性、建设可观测性与内部评估基础设施(消融、AB 测试、特性开关、提示词回归)、从 Benchmark 报告走到系统改进。
日本語の概要は準備中です。原文の説明を表示しています。
让 Agent 从运行经验中持续学习、构建自进化闭环时使用——涵盖从运行轨迹提取学习信号(三层轨迹验证)、四种进化方式(经验知识库、Prompt/Skill、程序/Harness、模型参数)的适用边界与选择依据、Prompt 自动优化、轨迹编译为程序、Agent 自我修改与安全门禁、睡眠学习与长期分层评估。触发词:持续进化、自进化、经验学习、轨迹验证器、自我修改、进化闭环。
日本語の概要は準備中です。原文の説明を表示しています。
Agent 陷入无限循环、数不清工具调用次数、遗忘 TODO 或目标偏离、长任务中思考 token 持续膨胀时使用——Agent 状态栏机制、作为 user 消息注入末尾的 KV Cache 理由、每轮替换与持久追加两种实现及成本模型、五种状态栏技术(时间戳、工具计数器、TODO、详细错误、系统状态)与维护铁律。
日本語の概要は準備中です。原文の説明を表示しています。
中文文案去「AI 味」检查清单,由用户纠正反馈持续提炼而来
日本語の概要は準備中です。原文の説明を表示しています。
构建异步/事件驱动 Agent,或让 Agent 响应外部事件(新邮件、webhook 回调、IM 消息、定时器、系统告警)、 处理工具执行期间的用户打断与多任务并发时使用。覆盖事件循环与安全点、三类事件触发工具、用户沟通与多渠道召回、 虚拟身份与隔离执行环境、队列式/取消式/并行式三种事件处理策略及紧急度判定,以及模型原生异步与同步接口兼容两条路线。 触发词:异步 Agent、事件驱动、event-driven、webhook、定时器、心跳、任务句柄、打断、steering、并行工具执行。
日本語の概要は準備中です。原文の説明を表示しています。
把生产 bad case / 失败轨迹转成训练数据时使用——从失败归因、轨迹前缀截取、DPO 偏好对构造、LoRA 训练到边界集与保留集双集验证的完整链路;也用于判断某类问题该走 SFT、DPO、RL 还是先修 Harness/工具/tokenizer,以及如何从运行轨迹中提取带证据的结构化学习信号。触发词:bad case、失败归因、DPO、偏好对、轨迹前缀、拒绝采样、过度矫正、边界集、保留集、过早结束、reward hacking、LoRA 微调、训练评估隔离。
日本語の概要は準備中です。原文の説明を表示しています。