OpenAI "o4" 공식 공개——코드 추론 71% 초과로 에이전트 설계의 판도가 바뀐다
機械翻訳 / Machine-translated
OpenAI는 2026년 8월 16일(미국 기준), 추론 특화 모델 "o4"를 API·ChatGPT Pro에서 동시 공개했다. 코드 벤치마크 "SWE-bench Verified"에서 71.3%를 달성——전 세대 o3의 53.1%에서 18포인트 이상 도약한 수치다. 수학 올림피아드 수준 문제(AIME 2026) 정답률은 92.0%에 달하며, "AI 에이전트에게 맡길 수 있는 상한선"에 대한 체감적 기준이 오늘을 기점으로 크게 바뀌었다.
OpenAI 공식 발표의 o4 주요 벤치마크:
API는 "o4"와 "o4-mini" 2가지 모델 체제. o4-mini는 입력 1M 토큰당 $2.00, o4는 $15.00. o3-mini 대비 o4-mini는 약 41%의 비용 절감이 이루어졌다.
공개 직후, 엔지니어 층의 반응이 X에 집중됐다.
"o4로 SWE-bench 71.3%는 예상보다 2~3분기 빠르다. 올해 안에 자율 PR 머지가 현실화된다는 계산이 나왔다"
— AI 엔지니어 계정(팔로워 수만 명 규모)
o3 공개(2025년 12월) 이후, 자율 에이전트 구현 현장에서는 "추론의 벽"이 과제로 계속해서 부상하고 있었다. SWE-benchmark 53%대는 "약 80%의 태스크에서 인간 리뷰 필수"를 사실상 의미했으며, 완전 자율 코드 PR 생성에는 명확한 격차가 존재했다.
그 사이 업계는 컨텍스트 길이·멀티모달·출력 속도 경쟁에 집중했지만, o4는 굳이 "추론 깊이"에만 집중해 최적화했다는 점에서 방향성이 다르다. 내부적으로는 강화학습 기반의 자기 수정 루프(Self-Correction)가 대폭 강화된 것으로 보인다. o3에서 o4까지 약 8개월——경쟁 사이클의 단축이 다시금 수치로 가시화됐다.
SWE-bench 71.3%는, 테스트가 포함된 소~중규모 버그 수정 태스크의 상당수가 "감독 없는 실행" 범위에 들어오기 시작하는 수준이다. 에이전트 워크플로우 설계에 있어 "인간이 확인하는 트리거 조건"의 재정의가 요구되는 단계에 진입했다.
$2.00/1M 토큰은, 스타트업·SMB 영역에서의 추론 헤비 태스크 상시 실행을 현실적인 비용 수준으로 끌어내린다. o3-mini에서의 전환 인센티브가 크고, API 이용량 구성 비율이 단기간에 바뀔 것으로 보인다.
같은 날 기준 SWE-bench 비교: Gemini 2.5 Ultra 67.8%, Claude Opus 4.7(2026년 7월 공개) 69.2%에 대해, o4가 71.3%로 수치상 1위에 올랐다. 단, 추론 레이턴시·컨텍스트 길이·비용 구조의 균형에 따라 선택지는 갈린다. "o4가 모든 용도에서 최적해"라는 해석은 섣부르다.
국내 SI 업체·수탁 개발 분야에서는 이미 o3를 코드 리뷰 보조에 도입하는 움직임이 진행되고 있었다. o4로의 전환으로 리뷰 공정 절감률이 더욱 높아질 것으로 보이지만, 보안 심사·라이선스 확인 프로세스는 인간이 담당하는 방침을 유지하는 기업이 대부분이다.
71.3%라는 수치를 어떻게 읽느냐가 분기점이다. 나머지 28.7%는 "AI가 못하는 태스크"가 아니라 "아직 확률적으로 풀 수 없는 문제"이며, 그 확률은 세션마다 흔들린다. 현시점에서 적절한 설계는 "성공 확률이 높은 태스크를 대량 처리시키는" 구조이지, "완전 방임으로 돌리는" 구조가 아니다.
그보다 중요한 것은 사이클의 이야기다. o3에서 o4까지 약 8개월 만에 18포인트 이상 개선. 이 속도가 유지된다면, 2027년 전반기에 SWE-bench 80%대라는 시산이 성립한다.
기업에 있어 의사결정 비용의 비대칭성이 지금 바로 바뀌고 있다. "관망"의 비용이 "도입"의 비용을 상회하기 시작하는 타이밍은 모델 성능의 곡선이 그려낸다. 오늘의 발표는 그 곡선 위의 명확한 변곡점으로 기록될 것이다.
o4 공개는, 자율 에이전트를 "PoC"에서 "실제 워크플로우"로 옮기는 판단 근거로 기능할 수 있는 수치를 내놓았다. 단, 평가 축은 정확도만이 아니라 비용·레이턴시·보안 요건의 세 축으로 살펴볼 필요가 있다. 다음 주목 포인트는, OpenAI가 o4를 Operator 등의 에이전트 프레임워크에 어떤 순서로 통합하느냐——그것이 실무 파급 속도를 실질적으로 결정한다.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.