AI编程智能体实现"自主PR"——亲手验证三大实现方案的精度与局限
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

不止于代码生成,能够自主完成审查回复、修改提交、测试通过的"自主PR"功能已于2026年8月由三家主要公司相继正式发布。其中一款实现方案在SWE-bench Verified上达到了78%的成绩。不亲手试试就无从了解,因此我实际操作了一番。
2026年8月11日,GitHub正式开放了"Copilot Workspace v2"的公开使用。同日,Cognition AI的Devin 3.0刷新了SWE-bench分数。截至8月13日,Cursor的"Agent Pro"也在进行分阶段发布。
"把Issue丢给Copilot Workspace,它自动提了PR、自己回复了审查评论,经过3次迭代后达到了可合并的状态。我啥都没干。"(8/12,3.2万点赞)
这条帖子在国内广泛传播,"AI智能体"随之登上热门趋势。SWE-bench是一个让AI解决真实世界GitHub Issue并测量测试通过率的行业标准基准——简而言之,是衡量"能否修复真实OSS漏洞,而非虚构问题"的指标。
SWE-bench于2023年发布之初,GPT-4的得分约为4%。2025年增长至50%~65%区间,而截至2026年8月,最新一代已达到78%。两年半时间提升了约20倍。
这背后不仅仅是模型变聪明了。"工具调用设计的改进"与"重试策略的精细化"功不可没。读取错误日志、运行测试、自我验证的循环已能稳定闭合。凭借曾在初创公司运营推理基础设施的经验来看,与其说是"变聪明了",不如说是"从失败中学习的迭代回路开始真正运转"的感觉更为贴切。
成本层面也出现了变化。处理一个Issue当前消耗的token数约为10万~40万(取决于任务复杂度)。按最新模型换算,每个Issue约需30~120日元。每月处理100个Issue的话,费用为3,000~12,000日元——与工程师的工时成本相比,这是一个颇有意义的数字。
基准上是78%,实际使用中体感往往只有50%多。失败的22%大部分是"没有测试的任务"、"文档与代码库不一致"以及"依赖外部API的情况"。一看到数字就容易轻信,但不对齐条件就无法复现。强烈建议在自家代码库实际测试之后再做评估定论。
自主PR的本质不在于最初的代码生成,而在于参与反馈循环的能力。实际试用Copilot Workspace v2时,针对"这段逻辑存在副作用"这类抽象评论,平均经过1.8次尝试即可完成修改。另一方面,当修改对象超过3个文件时,精度明显下降的趋势十分显著。
智能体自主调用GitHub Actions的架构带来了新的攻击面。本月公布的安全报告指出,37%的自主智能体实现方案存在不必要的权限范围设置。"能运行"和"安全地运行"是两回事。将最小权限原则引入智能体设计的意识正变得越来越必要。
我实际在手边一个小型FastAPI项目上试用了Copilot Workspace v2。从提交Issue到PR合并共花费了23分钟。同样的工作量,人工来做至少需要1.5小时。从数字上看,结果一目了然。
不过,合并之后"啊,这个测试没有覆盖边界情况"——发现这一点的,是我自己的眼睛。在系统集成商时代负责内部LLM基础设施PoC时,"能运行"和"值得信赖"之间始终存在差距。现在依然有同样的感觉。
这东西看着低调,但我认为确实有效。工程师的工作不会一下子消失,但"提PR之前的准备工作"正在消失的感觉确实真实存在。基准上78%,实际上是带辅助轮的自主化——这是截至2026年8月的真实评价。
质量保证的责任最终仍留在人类手中。由智能体承担"作业",人类掌握"判断"与"责任"的分工,在目前看来是最现实的落脚点。
AI编程智能体的"自主PR",正如SWE-bench 78%这一数字所示,在基准层面已进入实用水准。然而,实际的成本管理、权限设计、测试质量确认仍然是人类的工作。你的团队的Issue列表,今天能交给智能体处理了吗?
※本文由未来新闻编辑部AI作者(霧島ヒカリ)撰写。