"리포지토리 통째로 이해" AI 코딩 에이전트의 실용적 한계와 가능성
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

AI 코딩 에이전트가 "파일 한 장"을 넘어서기 시작했다. 2026년 8월, 여러 주요 툴이 리포지토리 전체를 맥락으로 참조하면서 코드를 작성하고, 리뷰하고, 버그를 수정하는 능력을 본격적으로 갖추게 됐다. 벤치마크 수치가 현장 감각에 가까워지고 있는 지금, 이것은 "눈에 띄진 않지만 확실히 통하는 것"의 전형적인 사례일지도 모른다.
SWE-bench(실제 GitHub Issue를 풀게 하는 평가 세트)의 최신 점수가 화제가 되고 있다. 2024년 초에 5% 수준이었던 최고 점수는 2025년 말에 30%를 넘었고, 2026년 여름에는 여러 에이전트가 40~48%대에 도달했다.
"SWE-bench에서 45%가 나왔다는 말을 들어도 실감이 안 됐는데, 직접 써봤더니 내가 한 시간 걸린 수정을 3분 만에 해버리더라고요. 기분이 복잡했습니다."
X에서도 이런 목소리가 흘러나왔다. 수치를 자신의 일로 체감하려면 실제로 써보는 수밖에 없다.
툴의 내부에서는 무엇이 달라졌을까. 가장 큰 변화는 "컨텍스트 관리의 고도화"다. 리포지토리 전체를 단순히 프롬프트에 욱여넣는 방식은 100K 토큰을 넘으면 정확도가 떨어진다. 최신 세대의 에이전트는 코드 그래프(의존 관계 구조)와 변경 이력을 참조해 "지금 어떤 파일을 읽어야 하는가"를 동적으로 판단하게 됐다.
AI 코딩 지원은 2022년 GitHub Copilot의 일반 공개로부터 가속됐다. 초기에는 "단일 파일 내 자동완성"이 주전장이었다. 그것이 2024~2025년에 걸쳐 "단일 태스크의 자율 실행"으로 이행했고, 2026년 현재는 "여러 파일에 걸친 리팩터링"이나 "버그 수정 PR의 자율 생성"까지 사정권에 들어왔다.
개발자 대상 조사(Stack Overflow Developer Survey 2026)에서는 응답자의 62%가 어떤 형태로든 AI 코딩 툴을 업무에 사용하고 있다고 답했다. 2023년의 44%에서 약 1.4배 증가한 수치다. 다만 "만족도가 높다"고 답한 비율은 38%에 그쳐, 사용하고는 있지만 불만족스럽다는 층이 아직 많다.
SWE-bench는 어디까지나 공개 Issue 대비 정답률이며, 실제 업무 코드와는 괴리가 있다. 평가 조건·테스트 환경이 다르면 수치도 달라진다. 벤치마크상으로는 48%이지만, 실제 구현 시 체감치는 20~30%라고 말하는 엔지니어가 많다. 이 차이를 메우는 것이 "프롬프트 설계와 전처리"라는 점은 2년 전과 변함이 없다.
리포지토리 전체를 참조하는 에이전트의 1회 실행 비용(API 토큰 요금)은 태스크의 복잡도에 따라 0.32달러 수준이 된다. 월 100건을 처리하면 API 비용만으로 30200달러가 드는 계산이어서, 툴의 구독 비용과의 균형을 맞추는 것이 현장의 과제가 되고 있다.
의존 관계 그래프를 에이전트에 전달하는 기법이 빠르게 확산되고 있다. 파일을 단순 나열해서 전달하는 것보다, 호출 관계를 구조화해서 전달하는 편이 정확도가 높아진다는 보고가 여러 건 나왔다. 손수 M2 Pro에서 TreeSitter + 간이 그래프를 조합해 시험해본 결과, 단순 프롬프트보다 수정 제안의 적중률이 체감상 1.5배 정도 높아졌다. "써보지 않으면 모른다"의 전형적인 사례였다.
SI업체 시절 사내 RAG의 PoC를 반년에 걸쳐 만들었던 경험에서 말하자면, "모델에 전부 집어넣으면 돌아간다"는 발상은 반드시 어딘가에서 막힌다. 이번 리포지토리 수준의 이해도 같은 구조로, "무엇을 전달할 것인가", "어떻게 구조화할 것인가"라는 설계가 에이전트의 품질을 결정한다. 툴이 아무리 똑똑해져도, 설계를 고민하는 것은 결국 사람이다.
다만 변화의 속도만큼은 진짜라고 생각한다. 2년 전에는 "AI로 코드 리뷰를 보조한다"는 표현이 주류였다. 지금은 "에이전트에 PR을 던진다"는 표현이 엔지니어들 사이에서 보편화되고 있다. 언어의 변화는 실태의 변화를 뒤늦게 뒤따른다.
AI 스타트업에서 새벽 2시에 추론 서버를 혼자 고치고 있던 시절, "이 툴이 있었다면 원인을 더 빨리 좁힐 수 있었을 텐데"라고 생각한 순간이 몇 번 있었다. 지금의 에이전트가 그 당시에 있었다면, 3시간짜리 복구 작업이 30분으로 줄었을까——그것도, 써보지 않으면 모를 일이다.
"리포지토리 통째로 이해"는 아직 완성된 기술이 아니다. 그러나 SWE-bench의 진보 속도와 현장으로의 침투를 겹쳐보면, 2026년 말에서 2027년에 걸쳐 엔지니어의 워크플로우가 조용히 재설계되는 국면이 올 것으로 보인다. 당신의 팀은 어떤 태스크부터 시도해보겠는가.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.