Anthropic 近日更新的研究文章《When AI builds itself》给出了一组引人注目的内部数据:在 2025 年 8 月至 2026 年 9 月期间,Claude Code 在多种研发任务上的成功率逐渐集中到约九成。对于 AI 编程工具而言,这是一个相当高的完成度信号,也说明大模型正在从“辅助补全”走向更深度地参与软件工程流程。
不过,成功率的提升并不自动意味着 AI 已经具备“自动改进自己”的能力。当前更准确的描述是:AI 正在成为高强度的人机研发循环中的重要成员,但距离真正的递归自我改进,仍有一段需要更多证据支撑的距离。
九成成功率说明什么
根据 Anthropic 公布的图表,Claude Code 的会话任务被划分为琐碎、常规、重大与开放式问题四类。到 2026 年 9 月,这四类任务的成功率大约落在 88% 至 92% 区间。其中,开放式任务的提升尤为明显,从约 26% 上升至 91%。
这组数字的价值在于,它并不是单一测试集上的静态成绩,而是来自内部生产环境的连续曲线。也就是说,Claude Code 并不是只在演示场景中“能写代码”,而是在持续参与实际开发任务。
- 开放式任务成功率从约 26% 提升到 91%,说明模型处理复杂问题的能力在增强。
- 常规与重大任务成功率维持在较高区间,显示 AI 编码能力正在趋于稳定。
- Anthropic 还披露,超过 80% 合并到生产环境的代码行可归因于 Claude。
但素材也明确指出,这一“成功”的判定标准是由 Claude 裁判判断任务明显完成,且无需用户纠正。它并非外部独立评测,也没有公开完整任务集、逐条判定结果和可复现流程。因此,这些数据能够说明 Anthropic 内部已经形成大规模 AI 编码实践,但不能直接推广到所有团队、所有代码库和所有模型。
高成功率不等于递归自我改进
讨论 AI 编程能力时,容易混淆三个层级。
- 第一层是代码生产率提升:AI 帮助工程师更快生成、修改和检查代码。
- 第二层是 AI 辅助模型研发:AI 参与数据处理、实验基础设施、评测或训练代码。
- 第三层才是递归自我改进:系统通过改进研发流程,产出更强后继系统,而后继系统又进一步加速同一循环。
目前公开证据更能支持前两层。Claude Code 可以写代码、修问题、参与实验基础设施,甚至帮助缩短排障时间,但这与“AI 自主决定研究方向、设计实验、训练下一代模型并完成安全验证”仍有本质区别。
素材中给出的流程很关键:人类设定研究目标,AI 生成代码与实验方案,系统运行训练或评测,随后需要独立验证结果。只有当能力和安全都确认改善,后继系统才能发布并参与下一轮研发。真正的核心不在于 AI 是否能提交代码,而在于验证、回滚、安全判断和上线权限是否仍然处于可控的人类流程中。
内部数据背后的四个限制
Claude Code 的内部成绩值得重视,但解读时需要保留边界。素材至少提出了四个需要警惕的问题。
- 裁判同源偏差:如果由 Claude 判断 Claude 是否成功,模型可能偏好相似表达,或遗漏某些隐性错误。
- 任务构成漂移:成功率上升可能来自模型增强,也可能来自工具改善或任务分配变化。
- 成功率不等于业务价值:修复一个排版问题与避免一次训练事故,权重显然不同。
- 代码归因不等于生产效率:AI 生成更多代码行,并不必然意味着交付周期、缺陷率和维护成本同步改善。
这一点在工程管理上尤其重要。当写代码速度变快,瓶颈往往会从“写出来”转向“验证出来”。工程师可以更快发起更多修改,但代码评审、测试、部署、回滚和事故响应能力并不会自动同步扩张。如果团队继续用提交行数衡量效率,可能会把更高吞吐误认为更高价值,最终积累更大的验证队列和更多隐藏回归。
团队应如何接住这波能力增长
对于工程团队来说,AI 编程工具的价值不再只是“能不能写代码”,而是如何把 AI 改动纳入可靠的研发流程。素材给出的建议比较务实:将 AI 改动按风险分级,高风险变更要求独立测试与非同源评审,并用交付周期、事故率、返工率和维护成本替代代码行数作为核心指标。
对个人开发者而言,更稳妥的路径也不是立刻把 Agent 权限开到最大,而是逐步扩大“可验证任务”的范围。例如,先让 AI 处理测试明确的小问题,再进入带回滚方案的模块变更,最后才接触生产诊断。能力增长越快,权限升级越应该依赖证据,而不是新鲜感。
Claude Code 接近九成的成功率,说明 AI 编程已经进入一个新的阶段:代码生成不再是稀缺能力,验证和责任分配成为新的中心问题。当前公开证据更支持一种强力的人机研发循环,而不是完全自主的递归自我改进。对于行业来说,真正需要持续观察的,不只是成功率曲线本身,还有谁定义成功、谁独立验证、谁承担后果。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/claude-code-cheng-gong-lyu-bi-jin-jiu-cheng-dan-ai-zi-wo