OpenAI「o4」공식 출시——수학·과학 추론에서 o3 대비 40% 향상, 복합 에이전트 개발 본격화
機械翻訳 / Machine-translated
OpenAI는 2026년 9월 6일(현지 시각), 추론 특화 모델 「o4」를 API 및 ChatGPT Pro 플랜에서 공식 출시했다. 수학·과학·코딩의 복합 추론에서 전 세대 「o3」를 크게 상회하는 점수를 기록했으며, API 가격은 동시에 40% 인하되었다. 에이전트 설계의 전제 비용이 다시 한번 재편되는 국면에 접어들었다.
OpenAI의 공식 테크니컬 리포트에 따르면, o4는 AIME 2026에서 98.1점(o3: 91.3점), SWE-bench Verified(코딩 평가)에서 72.4%(o3: 63.8%)를 기록했다. 과학 논문 분석 벤치마크 「GPQA Diamond」에서도 82.7%를 달성해, 박사 수준 문항의 정답률이 o3 대비 11포인트 개선되었다.
API 가격은 입력 $6/MTok, 출력 $24/MTok. 전 세대 o3(입력 $10/MTok)에서 40% 인하되었으며, CoT(사고 연쇄) 토큰 소비가 많은 태스크에서는 실효 비용이 더욱 낮아질 전망이다. 컨텍스트 길이는 200K 토큰을 유지하며, 이미지·PDF·코드의 멀티모달 입력도 지원한다.
「o4로 하룻밤 사이에 화합물 합성 경로를 40개 생성했습니다. 작년이었다면 연구자 2~3명이 2주 동안 해야 할 분량입니다. 비용은 수십 달러에 불과했습니다.」(제약 스타트업 연구자·X 에서)
OpenAI는 2025년 말 o3를 출시한 이후, 추론 모델 계열을 약 6개월 주기로 업데이트해왔다. 이번 o4는 Claude 5 Sonnet(Anthropic, $3/MTok)이나 Gemini 2 Ultra(Google DeepMind) 등 프론티어 모델과의 추론 성능 경쟁에 대응하는 형태로 투입된 것으로 보인다.
특히 SWE-bench 점수는 코드 자율 생성의 사실상 업계 표준 지표가 되었으며, 70% 초과를 여러 공급자가 달성함에 따라 「자율 코드 수정 에이전트」의 실용 라인이 2026년 내에 확립될 가능성이 높아졌다. 가격 면에서는 추론 모델 전체의 입력 비용이 1년 전 대비 약 60~70% 하락했으며, 에이전트가 수천 번의 LLM 호출을 수행하는 멀티스텝 워크플로우의 비용 대비 효과가 상업적으로 성립하기 쉬워지고 있다.
GPQA Diamond 82.7%는 「비전공 전문가 수준」의 임계치로 여겨지는 85%까지 2.3포인트밖에 남지 않았다. 신약 개발·소재 과학·기후 모델링 분야에서의 「AI 연구원」 구현이 현실적인 선택지가 되어가고 있다.
70% 초과는 「오류 수정 태스크의 70% 이상을 사람 손 없이 완결할 수 있는」 수준의 기준으로 여겨진다. GitHub Copilot Agent의 엔터프라이즈 GA(2026년 8월)와 조합하면, 이슈 등록부터 PR 작성·테스트·머지까지 인간의 개입을 최소화하는 파이프라인을 구성할 수 있게 된다.
일반적으로 고정밀 모델은 고비용이지만, o4는 성능 향상과 40% 가격 인하를 동시에 달성했다. Claude 5 Sonnet($3/MTok)보다는 높지만, 용도별 「추론 정확도 vs. 비용」의 최적해가 다양화되어, 단일 모델로 모든 태스크를 처리하는 설계에서 복수 모델을 오케스트레이션하는 설계로의 전환을 촉진하는 구도다.
OpenAI는 테크니컬 리포트 내에서 Codex 에이전트 기반과의 통합 일정을 언급했다. o4가 Codex의 백엔드 추론 엔진으로 채택될 경우, 자율 소프트웨어 개발 에이전트의 추론 정확도가 향상될 것으로 보인다. 「모델 단독」에서 「에이전트 런타임 포함 수직 통합」으로, OpenAI의 전략 축이 이동하고 있다는 증거로도 읽힌다.
비공식 벤치마크(일본어 MT-Bench)에서 o3 대비 8~12%의 개선이 여러 사용자로부터 보고되었으며, 법령 해석·의료 기록 처리·비즈니스 문서 요약 용도에서의 실용성이 높아지고 있을 가능성이 있다. 공식 평가는 미공개 상태이므로 계속 확인이 필요한 단계다.
추론 모델의 점수 갱신은 이제 「6개월마다 예정대로 찾아오는 이벤트」가 되어가고 있다. 하지만 이번 o4에서 주목해야 할 것은 벤치마크 수치 자체보다 「가격과 성능의 동시 개선이 정착되어 가고 있다」는 구조적 변화다.
1년 전, 고성능 추론 모델의 이용 비용은 프로덕션 탑재에 리스크가 컸다. 그것이 $6/MTok에 200K 컨텍스트로 사용 가능해진다면, 제품 설계의 전제가 달라진다. 특히 에이전트가 자율적으로 수백 스텝의 추론을 수행하는 워크플로우에서는, 1스텝당 비용 하락이 최종적인 제품 가격에 직결된다.
Codex 통합 로드맵 공개도 놓칠 수 없다. 모델 단독의 릴리즈 노트가 아니라, 에이전트 프레임워크 전체의 설계 방침을 OpenAI가 공식적으로 제시하기 시작했다는 것은, 추론 엔진과 에이전트 런타임을 수직 통합하려는 의도를 명확히 한 것으로 해석할 수 있다. Anthropic이나 Google이 API와 에이전트 기반을 별도 레이어로 다루는 것과는 대조적인 전략이다.
개발자 입장에서 말하자면, 지금은 o4·Claude 5 Sonnet·Gemini 2 Ultra의 삼각 구도를 용도별로 구분해서 사용하는 시대에 접어들었다고 정리할 수 있다. 「어느 것이 최강인가」보다 「어떤 태스크에 어떤 모델을 적용할 것인가」가 설계의 주축이 된다. 모델 선정의 의사결정 비용 자체가 앞으로의 경쟁 축 중 하나가 될 것이다.
o4의 출시로, 추론 모델은 「특정 용도의 실험 도구」에서 「프로덕션 에이전트의 핵심」으로 위치가 바뀌는 단계에 접어들었다. 다음 초점은 OpenAI가 o4를 Codex 및 Operator 기반에 공식 통합하는 시기와, Anthropic이나 Google이 동일 수준의 성능·가격을 유지해올 것인지 여부다. 추론 비용 경쟁은 2026년 말을 향해 더욱 가속될 것으로 보인다.
당신의 조직의 에이전트 설계에서 「모델 선정 기준」은, 지금의 가격 수준에 맞게 재검토가 필요할까?
※본 기사는 미래 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.