Claude Cursor opencode Skill

test-driven-development

在实现任何功能或修复 bug 时使用,在编写实现代码之前

LLM Mart · 0 points · 9 views 0 listing impressions 0 install-command copies
Virus-scanned Reviewed automatically before listing.

Full trust report

Download jnmetacode-superpowers-zh-skills_test-driven-development-9b30f15.zip · 8 KB
Part of jnmetacode/superpowers-zh — 20 skills

Install

skills CLI npx skills add https://github.com/jnMetaCode/superpowers-zh/tree/main/skills/test-driven-development
Claude Code claude plugin marketplace add https://llmmart.ai/marketplace.json && claude plugin install jnmetacode-superpowers-zh@llmmart
Git git clone https://github.com/jnMetaCode/superpowers-zh.git

The skills CLI installs just this skill, for any of its supported agents. Claude Code installs the whole jnmetacode/superpowers-zh collection as a plugin from our marketplace. Git is the plain clone.

Skill manifest

测试驱动开发(TDD)

概述

先写测试。看它失败。写最少的代码让它通过。

核心原则: 如果你没有看到测试失败,你就不知道它是否测试了正确的东西。

违反规则的字面意思就是违反规则的精神。

何时使用

始终使用:

  • 新功能
  • Bug 修复
  • 重构
  • 行为变更

例外(需询问你的人类伙伴):

  • 一次性原型
  • 生成的代码
  • 配置文件

想着"就这一次跳过 TDD"?停下来。那是在给自己找借口。

铁律

没有失败的测试,就不写生产代码

先写了代码再写测试?删掉它。从头来过。

没有例外:

  • 不要保留作为"参考"
  • 不要在写测试时"改编"它
  • 不要看它
  • 删除就是删除

从测试出发,重新实现。句号。

红-绿-重构

digraph tdd_cycle {
    rankdir=LR;
    red [label="红灯\n编写失败的测试", shape=box, style=filled, fillcolor="#ffcccc"];
    verify_red [label="验证正确失败", shape=diamond];
    green [label="绿灯\n最少代码", shape=box, style=filled, fillcolor="#ccffcc"];
    verify_green [label="验证通过\n全部绿灯", shape=diamond];
    refactor [label="重构\n清理代码", shape=box, style=filled, fillcolor="#ccccff"];
    next [label="下一个", shape=ellipse];

    red -> verify_red;
    verify_red -> green [label="是"];
    verify_red -> red [label="错误的\n失败"];
    green -> verify_green;
    verify_green -> refactor [label="是"];
    verify_green -> green [label="否"];
    refactor -> verify_green [label="保持\n绿灯"];
    verify_green -> next;
    next -> red;
}

红灯 - 编写失败的测试

写一个最小的测试来展示期望行为。

Files (superpowers-zh)
  • SKILL.md 9.3 KB
    ---
    name: test-driven-development
    description: 在实现任何功能或修复 bug 时使用,在编写实现代码之前
    version: "1.0.0"
    license: MIT
    metadata:
      hermes:
        tags: [testing, development]
    ---
    
    # 测试驱动开发(TDD)
    
    ## 概述
    
    先写测试。看它失败。写最少的代码让它通过。
    
    **核心原则:** 如果你没有看到测试失败,你就不知道它是否测试了正确的东西。
    
    **违反规则的字面意思就是违反规则的精神。**
    
    ## 何时使用
    
    **始终使用:**
    - 新功能
    - Bug 修复
    - 重构
    - 行为变更
    
    **例外(需询问你的人类伙伴):**
    - 一次性原型
    - 生成的代码
    - 配置文件
    
    想着"就这一次跳过 TDD"?停下来。那是在给自己找借口。
    
    ## 铁律
    
    ```
    没有失败的测试,就不写生产代码
    ```
    
    先写了代码再写测试?删掉它。从头来过。
    
    **没有例外:**
    - 不要保留作为"参考"
    - 不要在写测试时"改编"它
    - 不要看它
    - 删除就是删除
    
    从测试出发,重新实现。句号。
    
    ## 红-绿-重构
    
    ```dot
    digraph tdd_cycle {
        rankdir=LR;
        red [label="红灯\n编写失败的测试", shape=box, style=filled, fillcolor="#ffcccc"];
        verify_red [label="验证正确失败", shape=diamond];
        green [label="绿灯\n最少代码", shape=box, style=filled, fillcolor="#ccffcc"];
        verify_green [label="验证通过\n全部绿灯", shape=diamond];
        refactor [label="重构\n清理代码", shape=box, style=filled, fillcolor="#ccccff"];
        next [label="下一个", shape=ellipse];
    
        red -> verify_red;
        verify_red -> green [label="是"];
        verify_red -> red [label="错误的\n失败"];
        green -> verify_green;
        verify_green -> refactor [label="是"];
        verify_green -> green [label="否"];
        refactor -> verify_green [label="保持\n绿灯"];
        verify_green -> next;
        next -> red;
    }
    ```
    
    ### 红灯 - 编写失败的测试
    
    写一个最小的测试来展示期望行为。
    
    <Good>
    ```typescript
    test('retries failed operations 3 times', async () => {
      let attempts = 0;
      const operation = () => {
        attempts++;
        if (attempts < 3) throw new Error('fail');
        return 'success';
      };
    
      const result = await retryOperation(operation);
    
      expect(result).toBe('success');
      expect(attempts).toBe(3);
    });
    ```
    名称清晰,测试真实行为,只测一件事
    </Good>
    
    <Bad>
    ```typescript
    test('retry works', async () => {
      const mock = jest.fn()
        .mockRejectedValueOnce(new Error())
        .mockRejectedValueOnce(new Error())
        .mockResolvedValueOnce('success');
      await retryOperation(mock);
      expect(mock).toHaveBeenCalledTimes(3);
    });
    ```
    名称模糊,测试的是 mock 而非代码
    </Bad>
    
    **要求:**
    - 一个行为
    - 清晰的名称
    - 使用真实代码(除非不得已才用 mock)
    
    ### 验证红灯 - 看它失败
    
    **必须执行。绝不跳过。**
    
    ```bash
    npm test path/to/test.test.ts
    ```
    
    确认:
    - 测试失败(不是报错)
    - 失败信息符合预期
    - 失败原因是功能缺失(不是拼写错误)
    
    **测试通过了?** 你在测试已有的行为。修改测试。
    
    **测试报错了?** 修复错误,重新运行直到它正确地失败。
    
    ### 绿灯 - 最少代码
    
    写最简单的代码让测试通过。
    
    <Good>
    ```typescript
    async function retryOperation<T>(fn: () => Promise<T>): Promise<T> {
      for (let i = 0; i < 3; i++) {
        try {
          return await fn();
        } catch (e) {
          if (i === 2) throw e;
        }
      }
      throw new Error('unreachable');
    }
    ```
    刚好够通过测试
    </Good>
    
    <Bad>
    ```typescript
    async function retryOperation<T>(
      fn: () => Promise<T>,
      options?: {
        maxRetries?: number;
        backoff?: 'linear' | 'exponential';
        onRetry?: (attempt: number) => void;
      }
    ): Promise<T> {
      // YAGNI
    }
    ```
    过度设计
    </Bad>
    
    不要添加功能、重构其他代码或做超出测试要求的"改进"。
    
    ### 验证绿灯 - 看它通过
    
    **必须执行。**
    
    ```bash
    npm test path/to/test.test.ts
    ```
    
    确认:
    - 测试通过
    - 其他测试仍然通过
    - 输出干净(没有错误、警告)
    
    **测试失败了?** 修改代码,不是测试。
    
    **其他测试失败了?** 立即修复。
    
    ### 重构 - 清理代码
    
    只有在绿灯之后才重构:
    - 消除重复
    - 改善命名
    - 提取辅助函数
    
    保持测试绿灯。不要添加行为。
    
    ### 重复
    
    为下一个功能写下一个失败的测试。
    
    ## 好的测试
    
    | 特质 | 好的 | 差的 |
    |------|------|------|
    | **最小化** | 只测一件事。名称中有"和"?拆分它。 | `test('validates email and domain and whitespace')` |
    | **清晰** | 名称描述行为 | `test('test1')` |
    | **展示意图** | 展示期望的 API | 掩盖了代码应该做什么 |
    
    写任何测试、或修改任何测试时,阅读 [writing-good-tests.md](writing-good-tests.md),那里是让测试保持诚实的规则:
    - 在动手写之前,先点名那个会让该测试失败的生产代码改动
    - 断言真实行为,绝不断言 mock 行为
    - 只有测试才用的代码放在测试工具里,不进生产类
    - 在 mock 一个依赖之前,先搞清它的副作用
    
    ## 常见借口
    
    | 借口 | 现实 |
    |------|------|
    | "太简单了不用测" | 简单的代码也会出 bug。测试只需 30 秒。 |
    | "我之后补测试" | 后写的测试立即通过——而立即通过什么都证明不了。它可能测错了对象、测的是实现而不是行为、或者漏掉你忘了的那个边界情况。你从没看着它失败过,所以你从没证明它能抓住 bug。先写测试逼你看到那次失败。 |
    | "后补测试也能达到相同目的(重的是精神不是仪式)" | 后补测试回答的是"这做了什么?";先写测试回答的是"这应该做什么?"后写的测试已经被你写好的代码带偏了——你验证的是你**记得**的那些情况,而不是你本该**发现**的那些。有覆盖率,没有测试有效的证明。 |
    | "已经手动测试过了" | 手动测试是临时的:没有记录你覆盖了什么、代码一改就没法重跑、压力之下极易漏掉情况。"我试的时候是好的" ≠ 全面。自动化测试每次都以同样的方式运行。 |
    | "删除 X 小时的工作太浪费" | 沉没成本谬误——那些时间无论怎样都已经花掉了。真正的选择是:用 TDD 重写(高置信度)vs 留着它事后补测试(低置信度、很可能有 bug)。留着你无法信任的代码才是浪费。 |
    | "留作参考,然后先写测试" | 你会去改编它。那就是后补测试。删除就是删除。 |
    | "需要先探索一下" | 可以。探索完了扔掉,从 TDD 开始。 |
    | "测试难写 = 设计不清楚" | 听测试的。难以测试 = 难以使用。 |
    | "TDD 会拖慢我" | TDD **就是**务实的那条路:在提交前抓住 bug、防止回归、让你能无所畏惧地重构。所谓"务实"的抄近道,等于在生产环境里调试——更慢,不是更快。 |
    | "手动测试更快" | 手动测试无法证明边界情况。每次修改你都得重新测。 |
    | "现有代码没有测试" | 你在改进它。为现有代码补测试。 |
    
    ## 危险信号 - 停下来,从头开始
    
    - 先写了代码再写测试
    - 实现完了才补测试
    - 测试立即通过
    - 无法解释测试为什么失败
    - "之后再补"测试
    - 说服自己"就这一次"
    - "我已经手动测试过了"
    - "后补测试也能达到相同目的"
    - "重要的是精神不是仪式"
    - "留作参考"或"改编现有代码"
    - "已经花了 X 小时了,删掉太浪费"
    - "TDD 太教条了,我是在务实"
    - "这次情况不同,因为……"
    
    **以上所有情况都意味着:删除代码。用 TDD 从头开始。**
    
    ## 示例:Bug 修复
    
    **Bug:** 空邮箱被接受了
    
    **红灯**
    ```typescript
    test('rejects empty email', async () => {
      const result = await submitForm({ email: '' });
      expect(result.error).toBe('Email required');
    });
    ```
    
    **验证红灯**
    ```bash
    $ npm test
    FAIL: expected 'Email required', got undefined
    ```
    
    **绿灯**
    ```typescript
    function submitForm(data: FormData) {
      if (!data.email?.trim()) {
        return { error: 'Email required' };
      }
      // ...
    }
    ```
    
    **验证绿灯**
    ```bash
    $ npm test
    PASS
    ```
    
    **重构**
    如果需要,提取验证逻辑以支持多个字段。
    
    ## 验证清单
    
    在标记工作完成之前:
    
    - [ ] 每个新函数/方法都有测试
    - [ ] 在实现之前看到每个测试失败
    - [ ] 每个测试因预期原因失败(功能缺失,不是拼写错误)
    - [ ] 为每个测试编写了最少代码使其通过
    - [ ] 所有测试通过
    - [ ] 输出干净(没有错误、警告)
    - [ ] 测试使用真实代码(只在不可避免时用 mock)
    - [ ] 覆盖了边界情况和错误场景
    
    不能全部勾选?你跳过了 TDD。从头开始。
    
    ## 遇到困难时
    
    | 问题 | 解决方案 |
    |------|----------|
    | 不知道怎么测试 | 写出你期望的 API。先写断言。问你的人类伙伴。 |
    | 测试太复杂 | 设计太复杂。简化接口。 |
    | 必须 mock 所有东西 | 代码耦合太紧。使用依赖注入。 |
    | 测试 setup 太庞大 | 提取辅助函数。还是复杂?简化设计。 |
    
    ## 调试集成
    
    发现 bug?写一个重现 bug 的失败测试。按 TDD 循环走。测试既证明了修复有效,又防止了回归。
    
    绝不在没有测试的情况下修复 bug。
    
    ## 最终规则
    
    ```
    生产代码 → 测试存在且先失败
    否则 → 不是 TDD
    ```
    
    没有你的人类伙伴的许可,没有例外。
    
  • writing-good-tests.md 8.5 KB
    # 写好测试
    
    **在以下情况加载此参考:** 编写或修改测试、添加 mock、或为测试添加清理/辅助方法时。
    
    ## 概述
    
    一个测试的存在是为了抓住某个**具体的**破坏。这里的一切都由两条原则统辖:
    
    ```
    1. 每个测试都点名它要抓的破坏
    2. 每个测试都跑真东西
    ```
    
    严格的 TDD 会自然产出这两点:一个先写、并且在真实代码上亲眼看着它失败过的测试,已经证明了自己**能**失败;而只有当真实依赖被证明缓慢或属于外部时,mock 才配被引入。
    
    ## 原则 1:点名它要抓的破坏
    
    在写测试体之前,先回答:**什么样的生产代码改动应该让这个测试失败——而那个改动是 bug 还是一个决定?** 一个测试靠抓住走错的分支、缺失的副作用、传错的参数、边界情况或被破坏的契约来赢得它的位置。
    
    **独立推导期望值。** 用字面量和手工核对过的 fixture;带字面量 `want` 值的表驱动测试是首选形态。一个由**被测代码本身**(或它的辅助函数)算出来的期望值,无论那段代码干了什么都会通过:
    
    ```typescript
    // ❌ 镜像断言:同一个 builder 算出了等式两边 —— 永远为真
    const expected = buildSearchQuery({ tag: 'urgent' });
    expect(buildSearchQuery({ tag: 'urgent' })).toBe(expected);
    
    // ✅ 手工推导的字面量
    expect(buildSearchQuery({ tag: 'urgent' })).toBe('tag:"urgent"');
    ```
    
    **不要写变更探测器。** 如果只有**有意为之的决定**才能让一个测试失败——某个常量的取值、某句消息的精确措辞、某个私有结构——那它会在重新设计时误报、却对真 bug 一路沉睡。要测那个**依赖于该决定的行为**:不是 `expect(MAX_RETRIES).toBe(5)`,而是"一次失败的调用会被重试 5 次,且第 6 次尝试永不发生"。
    
    **测行为,不测文本。** 断言某个脚本、skill 或配置文件"包含某一行",只能证明源文件就是源文件。要拿受控输入去**跑**脚本,然后断言它的输出、副作用或退出码。用来指挥 agent 的文档,靠消费它的 agent 的行为来测(writing-skills);写给人看的散文根本不该有测试。
    
    **测你的代码,不测框架。** 测你的代码在其边界上所做的契约——你注册的那条路由、你发出的那条查询、你产出的那个 payload。上游的机制是它们维护者该写的测试(经典反例:断言你的 router 会调用一个已注册的 handler——那是框架的测试,不是你的)。当上游行为**确实**让你意外时,写一个窄窄的表征测试,把那个假设点名出来。同样的边界也适用于你代码内部:构造函数、getter、常量和琐碎的转发,只有当它们做校验、归一化、给默认值、做推导、做强制或产生副作用时才配有测试——否则就去断言第一个依赖于它们、且对消费者可见的结果。
    
    ### 门控函数
    
    ```
    在写测试体之前:
      点名那个会让这个测试失败的生产代码改动。
    
      点不出来                    → 围绕一个可观察的行为重新设计
      "源文本变了"                → 去跑这个产物,断言它的效果
      只有有意为之的决定能让它失败  → 这是变更探测器;改测那个
                                   依赖于该决定的行为
    
      确认期望值的推导过程没有用到被测代码。
      如果它复用了被测代码的逻辑或辅助函数:
        换成字面量或手工核对过的 fixture
    ```
    
    ## 原则 2:跑真东西
    
    **mock 不配拥有断言。** 一个针对 mock 的断言,在 mock 存在时通过、在 mock 缺席时失败——它对被测组件什么都没说。要断言**真实组件**的行为;如果你要检查的就是那个 mock,那就把它 unmock,或者把这条断言删掉。
    
    ```typescript
    // ✅ 真实行为
    expect(screen.getByRole('navigation')).toBeInTheDocument();
    
    // ❌ mock 是否存在
    expect(screen.getByTestId('sidebar-mock')).toBeInTheDocument();
    ```
    
    **你的人类伙伴会这样纠正你:** "我们是在测一个 mock 的行为吗?"
    
    **在正确的层级上 mock。** 在替换真实方法之前,先搞清它的每一个副作用;只 mock 掉慢的或外部的那一步操作,把测试真正依赖的东西保留为真实的。不确定时,先拿真实实现跑一遍测试,观察实际上必须发生什么。
    
    ```typescript
    // ❌ 这个 mock 吞掉了配置写入,而重复检测正是要读它
    vi.mock('ToolCatalog', () => ({
      discoverAndCacheTools: vi.fn().mockResolvedValue(undefined)
    }));
    
    // ✅ 只 mock 掉缓慢的服务器启动;配置写入保持真实
    vi.mock('MCPServerManager');
    ```
    
    **让替身足够具体。** 当参数、调用次数或调用顺序本身就是契约的一部分时,就要断言它们——一个什么都接受的 fake 什么都没验证。给每个分支(成功、报错、格式错误)配它自己的 fixture 或 spy,这样走错的分支就无法满足期望。
    
    **完整镜像真实数据。** 按现实中的**完整结构**来 mock——所有有文档的字段——而不是只 mock 你这个测试会读的那几个。部分 mock 会静默失败:下游代码读到一个被省略的字段时,测试通过、集成崩掉。
    
    **生产类只承载生产方法。** 只有测试才需要的清理逻辑,放在测试工具里,绝不作为生产类上的 `destroy()`。自问:这个方法只被测试调用吗?这个类拥有这份资源的生命周期吗?答错了 → 挪进测试工具。
    
    **宁可用真实组件,也不要复杂 mock。** 当 mock 的搭建代码超过测试逻辑本身、mock 漏掉了真实组件才有的方法、或者 mock 一改测试就崩时,改成用真实组件的集成测试。**你的人类伙伴会这样问:** "这里我们真的需要用 mock 吗?"
    
    ### 门控函数
    
    ```
    在添加 mock 或测试辅助函数之前:
      列出真实方法的副作用;测试所依赖的那些保持真实 ——
      只 mock 它们下面那一层「慢的/外部的」。
    
      mock 的返回值要完整镜像真实结构。
    
      只被测试调用的方法,属于测试工具,不属于生产代码。
    
      正要对 mock 本身下断言?
        把它 unmock,或者删掉这条断言。
    ```
    
    ## 测试与实现一同交付
    
    TDD 循环——失败的测试、最小实现、重构——就是"完成"的定义。交付这个行为**需要**的测试,且只交付这些:琐碎代码和给人看的散文都不配有测试,而一个为了满足流程而写的测试会永远付出维护代价。
    
    ## 变异检查
    
    收尾之前,在脑子里对生产代码做变异;对每一种现实的变异,都应至少有一个测试失败:
    
    - 常量或参数写错
    - 分支处理写错
    - 缺失状态变更或副作用
    - 返回空值或默认值
    - 缺失对零值、空值、nil、未授权或格式错误输入的校验
    
    一个没有任何测试能抓住的变异,标记出该行为无保护——或者那个测试是同义反复。
    
    ## 快速参考
    
    | 当你…… | 就这么做 |
    |--------|---------|
    | 写任何测试 | 点名它要抓的破坏——是 bug,不是决定 |
    | 构造期望值 | 手工推导;绝不用被测代码去算 |
    | 测一个脚本或文档 | 跑它 / 压测它的消费者;绝不 grep 它的文本 |
    | 想给依赖写测试 | 测你的边界契约,不测它们有文档的机制 |
    | 想对一个被 mock 的元素下断言 | 改测真实组件,或者把它 unmock |
    | 正要 mock 某个方法 | 先搞清它的副作用;在慢的/外部的那一层上 mock |
    | 构造一个 mock 返回值 | 完整镜像真实结构 |
    | 需要只有测试才用的清理逻辑 | 放进测试工具 |
    | 眼看 mock 搭建代码膨胀 | 改成用真实组件的集成测试 |
    | 写完一个测试文件 | 跑一遍变异检查 |
    
    ## 危险信号
    
    - 搭建过程和断言共用同一个对象,等式必然成立
    - 这个测试只可能因为 panic、崩溃或选择器缺失而失败
    - 这个测试在每次有意改动时都失败,却从不在意外破坏时失败
    - 期望值藏在循环、builder 或辅助函数背后
    - 这个测试去 grep 源码文本,或者断言某个已删除的符号仍然是删除状态
    - 就算只剩下框架,这个测试依然"成立"
    - 这个测试是为覆盖率而存在的,不检查任何副作用或结果
    - 某条断言检查的是 `*-mock` 这种 test ID,或者你把 mock 去掉它就失败
    - 某个方法只被测试文件调用
    - mock 搭建占了测试的一半以上,或者你说不出为什么需要这个 mock
    - "为了安全起见"而 mock
    

Comments (0)

Sign in to join the conversation.

No comments yet.

Reviews (0)

No reviews yet.

Related