AI 코딩 에이전트가 '자율 PR'에 도달——3가지 구현의 정확도와 한계를 직접 검증
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

코드 생성에 그치지 않고, 리뷰 답변·수정 커밋·테스트 통과까지 자율적으로 처리하는 '자율 PR' 기능이 2026년 8월, 주요 3사에서 잇따라 정식 출시되었다. SWE-bench Verified에서 78%를 기록한 구현도 등장했다. 직접 써보지 않으면 알 수 없으므로, 손수 돌려봤다.
2026년 8월 11일, GitHub가 'Copilot Workspace v2'의 일반 제공을 시작했다. 같은 날, Cognition AI의 Devin 3.0이 SWE-bench 점수를 갱신했다. 8월 13일 기준으로 Cursor의 'Agent Pro'도 단계적 롤아웃을 진행 중이다.
"Copilot Workspace에 Issue를 던졌더니, PR 올리고 리뷰 코멘트에 스스로 답변하고, 3번의 반복으로 머지 가능한 상태가 됐다. 나, 아무것도 안 했다"(8/12, 좋아요 3.2만)
이 포스트가 국내에서 확산되며 'AI 에이전트'가 트렌드에 올랐다. SWE-bench란, 실제 GitHub Issue를 풀게 하여 테스트 통과율을 측정하는 업계 표준 벤치마크다——즉, '가상의 문제가 아니라 실제 OSS 버그를 고칠 수 있는가'를 묻는 지표다.
SWE-bench가 공개된 2023년 당시, GPT-4의 점수는 약 4%였다. 2025년에는 50~65%대로 올랐고, 2026년 8월 기준 최신 세대는 78%에 달했다. 2년 반 만에 약 20배 향상된 수치다.
그 배경에는 모델의 똑똑함만 있는 것이 아니다. '도구 호출 설계 개선'과 '재시도 전략의 정교화'가 크게 기여했다. 에러 로그를 읽고, 테스트를 돌리고, 스스로 확인하는 루프가 안정적으로 닫히게 된 것이다. 스타트업에서 추론 인프라를 운영했던 경험에서 말하자면, 이는 '똑똑해졌다'기보다 '실패로부터 배우는 반복 회로가 작동하기 시작했다'는 감각에 가깝다.
비용 면에서도 변화가 있다. Issue 하나를 처리하는 데 소비하는 토큰 수는 현재 10만40만 정도(태스크 복잡도에 따라 다름). 최신 모델 환산으로 Issue당 약 30120엔. 월 100건 처리하면 3,000~12,000엔——엔지니어 공수와 비교하면 의미 있는 숫자다.
벤치마크상 78%, 구현상 체감은 50%대인 경우가 많다. 실패하는 22%의 대부분은 '테스트가 없는 태스크', '문서가 코드베이스와 불일치하는 경우', '외부 API에 의존하는 케이스'다. 숫자가 나오면 신뢰하기 쉽지만, 조건을 맞추지 않으면 재현되지 않는다. 자사 코드베이스에서 직접 시험해보기 전까지 평가를 확정하지 말 것을 강력히 권한다.
자율 PR의 본질은 최초 코드 생성보다, 피드백 루프에 얼마나 잘 참여하는가에 있다. 직접 Copilot Workspace v2를 시험해본 결과, "이 로직은 부작용이 있다"는 추상적인 코멘트에 대해 평균 1.8회의 시도로 수정을 완결했다. 반면, 변경 대상이 파일 3개를 초과하면 정확도가 떨어지는 경향이 뚜렷하게 나타났다.
에이전트가 GitHub Actions를 자율적으로 호출하는 구조는 새로운 공격면을 만든다. 이번 달 공개된 보안 리포트에서는 자율 에이전트 구현의 37%에서 불필요한 권한 스코프가 설정되어 있다고 지적했다. '동작한다'와 '안전하게 동작한다'는 별개의 이야기다. 최소 권한 원칙을 에이전트 설계에도 적용하는 의식이 필요해지고 있다.
실제로 손수 진행한 작은 FastAPI 프로젝트에서 Copilot Workspace v2를 시험했다. Issue 등록부터 PR 머지까지 걸린 시간은 23분. 사람이 하면 빨라도 1.5시간은 걸리는 작업량이었다. 숫자로 보면 명확하다.
다만, 머지 후에 "아, 이 테스트, 엣지 케이스를 보지 않았네"라고 알아챈 것은 내 눈이었다. SI 업계에 있을 때 사내 LLM 인프라 PoC를 담당했는데, '동작한다'와 '신뢰할 수 있다' 사이에는 항상 격차가 있었다. 지금도 같은 감각이다.
이거, 눈에 잘 띄지 않지만 효과 있는 변화라고 생각한다. 한꺼번에 엔지니어의 일이 사라지는 것은 아니지만, 'PR을 올리기 전 준비 작업'이 사라져가는 감각은 분명히 있다. 벤치마크상 78%, 구현상 보조 바퀴가 달린 자율화——2026년 8월 시점에서의 솔직한 평가다.
품질 보증의 책임은 결국 사람에게 남는다. 에이전트가 '작업'을 담당하고, 사람이 '판단'과 '책임'을 갖는 분업이, 지금의 현실적인 착지점으로 보인다.
AI 코딩 에이전트의 '자율 PR'은, SWE-bench 78%라는 숫자가 보여주듯 벤치마크상으로는 실용 수준에 진입했다. 다만, 실제 비용 관리·권한 설계·테스트 품질 확인은 여전히 사람의 몫이다. 당신 팀의 Issue 목록은, 오늘 에이전트에 넘길 수 있는 상태인가?
※본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.