从单兵作战到四人AI团队:一次需求交付的协作体系重构实录

2026年8月24日,一个看似寻常的新功能让我再次陷入崩溃边缘。

任务本身并不复杂:为某SaaS管理后台增加CSV批量导入能力,附带重复数据识别和导入结果汇总。我沿用了惯常做法——启动Claude Code,将需求说明、设计原型和历史代码全部塞进去,简单交代一句"把功能完成"。然而三个小时后,功能虽能运行,验收阶段却暴露了4个缺陷:空文件场景未覆盖、重复判断逻辑颠倒、接口命名前后矛盾、大文件导入直接内存溢出。当晚查看账单:18.5美元,120万token消耗,外加我28分钟的人工修复。那一刻我意识到,自己不是在调试程序,而是在为AI的疏漏善后。

由此我产生了一个念头:既然人无法单枪匹马扛下全栈,那么单一AI Agent是否也同样力不从心?如果将需求解析、系统设计、编码实施、代码审计拆解为四个独立认知单元,分别交由不同模型承担,效果会如何?过去一个月,我以Kimi、Claude Code、Codex、DeepSeek为班底,搭建了一条精简但可运行的多Agent工作流。本文不谈概念,只讲实战——包含具体数据、配置细节和最终结论。

01 症结所在:全栈任务令单一Agent的上下文不堪重负

此前的操作模式与众多独立开发者无异:选择最强模型,一次性注入全部语境,期望其端到端独立完成。对于简单CRUD确实高效,但一旦任务横跨需求分析→系统设计→编码实现→质量验证,单一Agent便陷入"角色混乱"。它既是产品经理,又是系统架构师,还是程序员和测试员,上下文内充斥着彼此冲突的目标导向。

以CSV导入功能为例,Claude Code在前10分钟还在认真探讨"重复检测应基于邮箱还是手机号",而后10分钟已转向纠结React表格的列宽细节;当我要求补充测试时,它又回头修改接口命名。最终交付的代码中存在三处接口定义不一致、一处类型错误、一处空文件处理缺失。我粗略统计:有效协作时间约110分钟,其中近40分钟消耗在纠正它的"记忆偏差"上。

我也曾尝试让GPT-4.1统一指挥,结果长上下文环境下的代码一致性更不理想,成本优势也不明显。单Agent方案的核心痛点并非模型智能不足,而是一个上下文中承载了过多相互矛盾的决策维度。需求分析需要发散思维,系统设计需要收敛整合,编码实现需要精准执行,代码审计需要严苛挑剔——四种思维模式天然冲突,强行压缩在同一会话中,出问题只是时间问题。

更隐蔽的问题在于成本。Claude Code的Agent模式在每次推理时都会反复扫描整个工作区,120万token中近半属于冗余读取。18.5美元对个人项目不是小数,但真正沉重的不是金钱,而是心智负担——你必须时刻紧盯这个"全能助手",防止它偏离轨道。

这一阶段的教训可以凝练为一句话:个人可以全栈开发,但别妄想单一Agent也能全栈包揽。 我需要的不是更强的模型,而是将任务切分为多个环节,每个环节交给最擅长的执行者。

02 初步探索:四模型分工理念美好,交接环节却问题频出

我按照认知角色将任务拆解如下:

理想方案看似完美,但第一周实践就让我遭遇了四大困境。

困境一:交接不是简单传递文档。 最初我让Kimi生成一份3000字的PRD Markdown,直接转交Codex。结果Codex只浏览了标题和代码片段,忽略了"支持10万行CSV"这一非功能性需求,生成的实现采用了一次性全量读入内存的方式。问题根源不在模型能力,而在交接格式。后来我改为输出带字段约束的prd.json,每条需求包含ID、优先级、验收标准和性能约束,下游环节必须逐项确认。

困境二:每个模型都想动接口。 Claude定义的函数签名是parse_csv(file_stream, options),Codex在实现中擅自改为parse_csv_buffer(buffer),DeepSeek又建议调整为parse_csv(file_stream)但参数语义已变。三天下来,接口文件如同被反复争夺的战场。最终我引入了接口锁定机制:Claude输出interface.lock,固定函数签名、错误码和数据库字段;下游若要修改,必须在handoff.yaml中说明变更理由并触发人工审批。

困境三:审查者变成"拉拉队长"。 首次让DeepSeek执行审查时,提示词过于温和,输出全是"整体不错,建议进一步优化"这类空话。这比不审查更糟糕。于是我重写了审查提示词,强制其按Severe/Major/Minor三级分类问题,Severe级别直接打回重做。同时给Codex增加约束:"只修复被明确指出的问题,禁止额外重构",否则它会顺手产生一批新bug。

困境四:编排框架纯属浪费。 起初被某开源Multi-Agent框架吸引,学习DAG、定义工具、配置状态机,折腾两天后意识到收益不过是API调用封装。对个人开发者和小团队而言,一条线性流水线加两个条件回环就完全够用。我目前的编排器是100行Python代码,读取JSON状态、调用SDK、执行测试、输出日志。不要为了用框架而用框架。

03 实践落地:百行Python串联起完整流水线

当前流程如下:Kimi产出PRD → Claude定义架构与测试 → Codex编写实现 → DeepSeek审查diff → 自动执行测试 → 人工最终合并。每个阶段之间通过handoff.yaml传递状态,记录上游产物哈希、文件变更清单、待决事项和测试结果。

四阶段多Agent流水线与交接产物

以下是核心配置,可直接参考使用。

Kimi需求提炼配置:

kimi_client = OpenAI(
    api_key=os.getenv("KIMI_API_KEY"),
    base_url="https://api.moonshot.cn/v1"
)
system = """
你是一名需求分析师。只输出结构化PRD,严禁编写代码。
必须包含:背景、用户故事、可测试的验收标准、非功能约束、风险点。
输出格式为JSON,字段名固定。
"""
prd = kimi_client.chat.completions.create(
    model="kimi-latest",
    messages=[
        {"role": "system", "content": system},
        {"role": "user", "content": raw_requirements}
    ],
    temperature=0.2
)

Claude Code架构与测试配置: 我为其添加了项目级提示文件.claude/CLAUDE.md

1. 先编写测试,再实现功能。
2. 所有函数必须包含类型注解。
3. 禁止修改 interface.lock 中的签名。
4. 输出 ARCHITECTURE.md 说明模块关系。
5. 测试必须覆盖空文件、超大文件、重复数据三类场景。

Claude Code使用Sonnet模型运行Agent模式,每次仅处理一个任务包,避免思维发散。

Codex实现配置: .codex/config.yaml

model: codex-latest
instructions: |
  - 仅根据已有测试补充实现,不得新增函数。
  - 禁止重构与当前任务无关的代码。
  - 读取 interface.lock 和 handoff.yaml 后再开始工作。
  - 将变更摘要输出至 IMPLEMENTATION.md。

DeepSeek审查配置:

review_prompt = """
你是一名资深代码审查员。审查以下git diff,按Severe/Major/Minor分级。
Severe包括:安全漏洞、逻辑错误、接口破坏、未处理异常。
只评论与本次变更直接相关的问题,避免泛泛而谈。
输出JSON:{"summary": "...", "blockers": [...], "suggestions": [...]}
"""

模型选用deepseek-coder-v2,温度设为0.0,性价比高且输出稳定。

三阶段质量检查机制: - 第一阶段:Codex自行运行pytest,失败则自动重试一次。 - 第二阶段:DeepSeek审查diff,发现Severe问题则退回Codex,最多循环3次。 - 第三阶段:我人工核对handoff.yaml和最终diff,耗时控制在5-10分钟。

三阶质检与回环机制

这个回环设计看似增加了流程步骤,实则将"完成后返工"转变为"过程中拦截"。回到CSV导入需求,完整跑通流水线的数据如下:

单Agent vs 多Agent端到端耗时与返工时间对比

综合计算,端到端效率提升2.6倍,成本降至原来的约38%,返工时间缩减至此前的不到三分之一。更关键的是我的精神负担——我不再需要同时扮演需求方、架构师和测试员,与同一个模型反复拉扯。

04 可复制经验:多Agent协作的七条核心原则

如果你想尝试这一模式,无需照搬我的四模型组合,只需先落实以下七条原则:

  1. 按认知角色划分,而非文件模块。 需求、架构、实现、审查是四种思维模式,不同于前端后端的文件切割逻辑。
  2. 每个Agent只专注单一职责,且必须明确禁止越界。 例如Kimi禁止写代码,Codex禁止改接口,DeepSeek只能给审查结论不得提实现建议。
  3. 交接采用结构化产物,避免长篇文字。 PRD用JSON/YAML,diff用git,状态用handoff.yaml,让下游无需猜测。
  4. 冻结接口与契约。 通过interface.lockARCHITECTURE.md锁定函数签名、错误码和数据库字段,谁要改动谁承担责任。
  5. 审查必须能阻断流程。 敷衍式审查毫无价值。Severe问题直接打回,并限制Codex只修被点名的问题。
  6. 先线性编排,再考虑DAG。 个人和小团队用百行脚本即可跑通,不必一上来就搭建复杂状态机。
  7. 昂贵模型用在关键环节。 需求分析和架构设计用强模型,纯审查和简单生成交给DeepSeek这类低成本模型。省下的token就是利润。

最后说句直接的话:市面上众多"AI员工团队"SaaS产品,本质是套着多Agent外壳的API调用器,按月收取数百元席位费,对独立开发者而言大概率是智商税。 自己花一下午搭建一条流水线,完全可控、可定制、账单透明。当然,如果你的团队已有10人规模且流程标准化,采购成熟工具能节省管理成本,那是另一回事。

说明:数据来源为公开行业报告综合整理、部分数值为估算仅供参考