本文へ移動
cccskills
無料GitHub で公開

goal-verification

设计 Loop 的 Goal 和 Verification 环节: 将模糊目标转化为可验证的停止条件。 当用户发现 loop 产出质量不稳定、循环无法停止、或"不知道什么时候算做完"时使用。 不适用于: 目标已经非常清晰可量的任务、或非循环场景。 关键 trigger: "loop 停不下来"、"产出质量不稳定"、"怎么定义完成"、"goal 怎么写"。

インストール方法を見る

含まれるファイル(3)

  • SKILL.md5.3 KB
  • test-prompts.json2.7 KB
  • test-results.md2.0 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

Source Metadata

Original cangjie-skill frontmatter from the distillation run:

name: goal-verification
description: |
  设计 Loop 的 Goal 和 Verification 环节: 将模糊目标转化为可验证的停止条件。
  当用户发现 loop 产出质量不稳定、循环无法停止、或"不知道什么时候算做完"时使用。
  不适用于: 目标已经非常清晰可量的任务、或非循环场景。
  关键 trigger: "loop 停不下来"、"产出质量不稳定"、"怎么定义完成"、"goal 怎么写"。
source_book: "Loop Engineering 视频合集"
source_chapter: 视频1 (Adam Gillock) / 视频4 (Idoos Money)
tags: [goal-design, verification, stop-condition, quality]
related_skills: [loop-three-elements, maker-checker, loop-build-path]

Goal 可验证化 — 循环设计的质量杠杆点

R — Reading (原文)

"There's really two most important pillars: the goal (objective, not subjective) and then verification. How does the agent know what that stop condition is?" — Adam Gillock (视频1)

"A loop is only going to be as good as its done check, as the done criteria." — Adam Gillock (视频1)

I — Interpretation (自述)

循环的质量上限 = 其验证环节的质量上限。设计 Loop 时,必须回答两个问题:

  1. Goal (目标): 循环要达成什么? 必须是客观可验证的 — 不是"做好",而是"达到 X 指标"。
  2. Verification (验证): 如何判断目标已达成? 必须有可执行的检查步骤。

好 Goal vs 坏 Goal:

  • ❌ "直到你满意" — 主观,不可验证
  • ❌ "做好这个功能" — 模糊,无法判断
  • ✅ "凑够 5 条数据" — 客观,可数
  • ✅ "平均分 ≥ 9 或最多 8 轮" — 客观 + 硬停

验证方式光谱 (从客观到主观):

  • 纯客观: 跑测试套件、数值指标
  • 半客观: 另一个 LLM 评判
  • 主观: 人类在环判断
  • 模糊: 无法明确判断好坏

A1 — Past Application (书中案例)

案例1: 坏 Goal — 缩略图生成 (视频1)

  • Goal: "迭代直到满意" → 主观,导致 27 分钟不可控
  • 教训: 应改为"评分 ≥ 8/10 或最多 5 轮"

案例2: 好 Goal — Abbey Road 复刻 (视频1)

  • Goal: "平均分 ≥ 9 或最多 8 轮" → 客观 + 硬停
  • 虽然结果不完美,但循环在预期内停止

案例3: 验证光谱应用 (视频4)

  • 测试套件 → 最客观,优先用
  • LLM 评判 → 次选,需独立 checker
  • 人类判断 → 最后手段,成本高

A2 — Future Trigger (未来触发)

  1. Loop 无法停止时: "跑了 3 天还没完" → 检查 stop condition 是否过主观
  2. 产出质量不稳定时: "有时好有时坏" → 验证环节可能不可靠
  3. 设计新 Loop 时: 先写 goal 和 verification,再写 action
  4. 调试 Loop 时: 诊断"为什么产出差" → 先看 goal 是否可验证

语言信号: "loop 停不下来"、"怎么定义完成"、"goal 怎么写"、"产出质量不稳定"

与相邻 skill 的区别:

  • loop-three-elements: 三要素的整体框架 (本 skill 专注 stop condition 的设计)
  • maker-checker: 验证环节的具体实现 (本 skill 是验证的设计原则)
  • loop-worthiness-test: 判断要不要做 loop (本 skill 是决定后如何设计)

E — Execution (可执行步骤)

Step 1: 将模糊目标转化为可验证目标

面对"做好 X"类目标,问:

  • "做好"的具体表现是什么?
  • 能否用一个数字/布尔值判断?
  • 如果不能,能否拆成多个可验证的子目标?

Step 2: 选择验证方式

按客观性从高到低尝试:

  1. 纯客观检查: 测试通过? 数值达标? 文件存在?
  2. LLM 评判: 用独立 agent 按 rubric 打分
  3. 人类判断: 以上都不可行时的最后手段

Step 3: 设置 Hard Stop

即使验证是主观的,也必须设置硬性上限:

  • 最大迭代次数 (如 8 轮)
  • 最大运行时间 (如 30 分钟)
  • 最大 token 消耗

Step 4: 验证环节的独立检查

  • 不要让同一个 agent 自产自检 (参见 maker-checker)
  • 验证 agent 应该是 read-only 的,有明确的 spec

B — Boundary (边界)

不要使用这个 skill 的场景:

  1. 目标已经可验证: "凑够 5 条"不需要再设计
  2. 纯创意任务: 诗歌、艺术等无法客观验证,本 skill 不适用
  3. 非循环场景: 单次任务的 goal 设计不需要考虑 stop condition

作者的盲点与局限:

  • "Goal 必须客观"在创意类任务中很难实现,但作者没有给出创意任务的替代方案
  • 验证光谱假设"越客观越好",但有时主观判断 (人类审美) 恰恰是目标
  • 视频案例全部是技术任务,对内容创作、研究等场景的验证设计覆盖不足

与之相邻但容易混淆的方法论:

  • SMART 目标: 通用目标设定框架; 本 skill 专注循环场景的"可验证停止条件"
  • 测试驱动开发 (TDD): "先写测试再写代码"; 本 skill 的"先设计验证再设计 action"思路类似

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

识别和管理 Loop 系统的认知风险: 自动化程度越高,你真正理解的部分越少。 当用户发现"仓库里有很多代码但我看不懂"、"loop 产出很多但不确定对不对"、或需要向团队警示 AI 使用风险时使用。 不适用于: 纯技术调试、或产出完全可客观验证的场景。 关键 trigger: "AI 生成的代码我看不懂"、"产出太多理解不过来"、"AI 使用风险"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

设计或审计完整 Loop 系统的组件架构: 5 大组件 + 1 根脊柱。 当用户需要搭建一个完整的 (而非最小可用的) loop 系统、或审计现有系统的组件完整性时使用。 不适用于: 最小可用 loop 的设计、或单次任务的自动化。 关键 trigger: "设计一个完整的 loop 系统"、"我的 loop 缺什么"、"loop 系统怎么组织"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

从"手动做事"到"系统自动做事"的四步渐进构建路径。 当用户已经决定要做 loop、但不知道从何入手时;或团队正在将手工流程自动化时使用。 不适用于: 尚未决定要不要做 loop 的任务、或已经稳定运行的 loop 优化。 关键 trigger: "怎么开始做 loop"、"自动化第一步"、"从手动到自动"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

设计或审计任何循环系统的起点: 将循环拆解为 Trigger(触发器)、Action(动作)、Stop Condition(停止条件) 三要素。 当用户需要设计一个新循环、诊断一个失效循环、或向他人解释"什么是 Loop"时使用。 不适用于: 单次任务执行、非循环的自动化脚本、或已经稳定运行无需重新设计的系统。 关键 trigger: "设计一个 loop"、"这个循环为什么不停止"、"什么是 loop 的最小结构"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

判断一个任务是否值得做成 Loop 的四条决策标准。 当用户在纠结"这件事要不要自动化"、"该不该用 loop"、或"为什么我的 loop 得不偿失"时使用。 不适用于: 已经决定要做 loop 后的设计阶段、或一次性任务。 关键 trigger: "这件事值得做 loop 吗"、"该不该自动化"、"loop 成本太高怎么办"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

设计 Loop 中的 Maker-Checker 模式: 用独立 agent 审查产出,避免自产自检。 当用户发现 loop 产出质量不稳定、agent 自我评估过于宽容、或需要提升产出可信度时使用。 不适用于: 产出可以客观验证 (测试通过/失败) 的任务、或成本极其敏感的场景。 关键 trigger: "agent 自评不准确"、"产出质量不稳定"、"怎么让 agent 审查 agent"。

日本語の概要は準備中です。原文の説明を表示しています。

kangarooking/loop-engineering-skill272026年7月3日 更新

kangarooking のスキルをすべて見る

このスキルの問題を報告する