AI 에이전트가 "사람 없이" PR을 올리는 시대 —— 실제 개발 현장에서 무슨 일이 벌어지고 있는가
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026년 여름, 소프트웨어 개발 현장에서 조용하지만 확실한 변화가 일어나고 있다. AI 코딩 에이전트가 지시를 받은 뒤 구현·테스트·풀 리퀘스트 작성까지, 사람의 개입 없이 일련의 작업을 완결하는 사례가 급증하고 있는 것이다. "미래의 이야기"가 아니라, 이번 주 개발 현장의 이야기가 되어 있다.
X(구 Twitter)에서는 7월 말부터 8월에 걸쳐 "AI 에이전트에게 맡겼더니 아침에 일어나 보니 PR이 올라와 있었다"는 보고가 잇따르고 있다.
"어젯밤 Claude에게 '인증 관련 리팩터링 부탁해'라고만 말하고 잠들었더니, 아침 6시에 14개 파일 수정·테스트 전체 통과 PR이 와 있었다. 코드 리뷰만 하면 되는 자신을 발견했다"
GitHub Actions 위에 AI 에이전트를 상주시켜 Issue를 트리거로 태스크를 자율 실행하는 구성이, 특히 스타트업 층에서 확산되고 있다. 2026년 6월 GitHub이 발표한 데이터에 따르면, AI 보조 코드 제안의 채택률은 전 세계에서 55%에 달하며, 2025년 동기 대비 약 18포인트 상승했다.
최근 1~2년 사이 코딩 에이전트의 실력이 빠르게 향상된 배경에는 세 가지 변화가 있다.
첫째, 컨텍스트 윈도우의 확대다. 2024년 말 기준으로는 수만 토큰이 상한이었지만, 현재 주요 모델은 100만 토큰 이상을 실용적으로 다룰 수 있다. 이로 인해 "리포지터리 전체를 읽고 나서 코드를 작성한다"는 인간의 작업 절차를 AI가 재현할 수 있게 되었다.
둘째, 멀티 에이전트 협조의 성숙이다. 계획·구현·리뷰를 역할 분담한 복수의 에이전트가 직렬·병렬로 동작하는 구성을 구현하기 쉬워졌다. Anthropic의 문서에서는 2026년 2월 이후 이러한 오케스트레이션 예시가 대폭 충실해졌다.
셋째, 툴 호출 정밀도의 향상이다. 코드를 작성하는 것뿐만 아니라, 테스트 실행 → 오류 읽기 → 수정이라는 피드백 루프를 에이전트 스스로 돌릴 수 있게 된 점이 크다.
여러 CTO와의 비공식 인터뷰에서는 "엔지니어의 역할이 구현자에서 리뷰어·설계자로 이동하고 있다"는 목소리가 일치한다. 어느 기업에서는 2026년 Q1의 PR 건수가 전년 동기 대비 3.2배가 되었지만, 엔지니어의 가동 시간은 10%밖에 늘지 않았다.
SWE-bench 등의 표준 벤치마크에서는 현재 최상위 모델이 해결률 72~78%를 기록하고 있지만, 실제 프로덕션 리포지터리에서는 "컴파일은 통과하지만 의도와 다르다", "테스트가 부실해서 버그를 놓친다"는 사례도 여전히 많다. 벤치마크상으로는 우수하지만, 구현상으로는 인간의 컨텍스트 보완이 필요하다는 것이 솔직한 현실이다.
AI 에이전트로의 전환으로 비용이 제로가 되는 것은 아니다. 토큰 소비·API 비용·GPU 비용은 증가하며, 태스크당 AI 이용 비용이 월간 수만 원에 달하는 팀도 나오고 있다. 또한 2026년 7월 EU가 공표한 AI Act 운영 가이던스에서는 "고위험 소프트웨어에 AI 생성 코드를 포함하는 경우의 공개 의무"가 명기되었다. 자율적인 PR이 늘어날수록 추적 가능성(traceability) 문제는 더욱 무거워진다.
SI 업계에 있었을 때, "AI에게 맡기면 무엇이 바뀌는가"를 사내용으로 정리하는 일을 자주 했었다. 그 당시에는 아직 "자동 완성을 해주는 IDE 플러그인" 수준의 이야기였지만, 지금은 이미 다음 단계에 접어들었다.
손 안의 M2 Pro에서 Claude Code를 사용해, 소규모 FastAPI 서비스에 엔드포인트를 추가하는 작업을 시험해 보았다. 지시부터 구현·테스트·lint까지 약 4분 만에 완결되었다. "4분이면 끝나니 직접 하는 것보다 빠르다"는 감각보다, "리뷰만 하면 되는 상태가 되었다"는 감각이 더 강했다.
이건 잔잔하지만 효과가 있는 변화다. 다만, 전부 맡겨도 된다는 뜻은 아니다. AI가 올린 PR을 "뭐, 괜찮겠지"라며 머지하는 문화가 정착하면, 의도와 어긋난 변경의 축적이 나중에 문제가 된다. 자동화의 비용 대비 효과를 정량화하고 있는 기업은 전체의 30% 미만이라는 조사 결과도 있으며, "어쩐지 쓰고 있는" 상태는 오래 지속되지 않는다. 리뷰의 질을 떨어뜨리지 않는 것이, 지금의 엔지니어에게 가장 중요한 스킬이 되어 가고 있다.
직접 써봐야 안다는 의미에서, 우선 "내가 반나절 걸리는 태스크를 에이전트에게 넘겨 보는" 실험을 강력히 권장한다. 성공하든 실패하든, 무엇을 자동화할 수 있고 무엇이 남는지가 명확해진다.
AI 코딩 에이전트의 자율화는 벤치마크 수치가 혼자 걷기 쉬운 분야이지만, 실제로는 자율 실행 가능한 범위와 인간이 필요한 부분이 혼재한다. 중요한 것은 "AI에게 전부 시킨다"가 아니라, "자신의 판단이 필요한 부분을 명확히 한다"는 것이다. 오늘 밤, 손 안의 작은 태스크 하나를 에이전트에게 넘겨보는 건 어떨까.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.