Google「Gemini 2.5 Ultra」공식 출시——200만 토큰×과학 추론으로 장문 문서 분석의 전제가 바뀐다
機械翻訳 / Machine-translated
Google DeepMind는 2026년 8월 9일(태평양 표준시), 플래그십 모델 「Gemini 2.5 Ultra」를 일반에 공개했다. 컨텍스트 윈도우를 업계 최대 수준인 200만 토큰으로 확장하고, GPQA(과학적 추론 벤치마크)에서 92.3%라는 새로운 SOTA를 기록했다. 법률 문서·금융 공시·논문 검토 등 「장문 + 고정밀 추론」이 요구되는 업무의 설계 전제가 실무 수준에서 움직이기 시작했다.
Google DeepMind는 Google AI Studio 및 Vertex AI를 통해 Gemini 2.5 Ultra의 일반 제공을 시작했다. 전세대 모델인 Gemini 2.0 Ultra와 비교해 컨텍스트 윈도우를 100만 토큰에서 200만 토큰으로 두 배 확장했다. API 가격은 입력 1M 토큰당 $18, 출력 $54로 책정되었다.
공개 직후 X(구 트위터)에서는 실무 사용자들의 검증 보고가 잇따랐다.
「Gemini 2.5 Ultra에 1,500페이지 분량의 판례 데이터베이스를 통째로 입력했더니, 특정 조문과의 대조를 3분 만에 완료했다. 법무팀이 반나절 걸리던 작업이 달라진다」
GPQA(Graduate-Level Google-Proof Q&A) 점수는 92.3%로 공개 모델 중 최고 수준이다. MATH 벤치마크(수학 추론)에서도 97.1%를 기록해 OpenAI o3(96.4%)를 소폭 상회했다.
Gemini 2.5 Ultra는 2026년 3월 공개된 Gemini 2.5 Pro에 이은 동 시리즈 최상위 모델로 자리매김하고 있다. Pro가 추론 속도와 가격 효율을 우선시한 설계였던 것과 달리, Ultra는 정확도·문맥 길이를 최대화한 플래그십으로 명확히 차별화되어 있다.
컨텍스트 윈도우 200만 토큰은 영어 텍스트 기준으로 약 2,000페이지 분량에 해당한다. 이를 통해 기존에는 「분할하여 처리」할 수밖에 없었던 방대한 법률 문서·재무보고서·연구논문을 일괄 입력해 횡단적 대조나 모순 감지가 가능해진다.
Google은 동시에 Gemini 2.5 Ultra를 탑재한 NotebookLM Pro의 업그레이드도 발표했다. 연구자용 논문 분석 워크플로와의 통합을 강화하고 있다.
200만 토큰은 단순한 스펙 경쟁이 아니다. 3,000줄이 넘는 코드베이스 전체, 혹은 1년치 계약서를 「하나의 문맥」으로 다룰 수 있다. 분할 처리로 인한 「문맥 단절」 리스크가 사라지며, 참조 관계가 많은 문서에서 특히 효과가 클 것으로 예상된다.
GPQA 92.3%는 「박사 수준의 과학적 질문 대부분에 정답을 낼 수 있는」 수준으로 평가된다. 신약 개발·소재 과학·금융공학 등 전문적 추론이 필요한 업종에서의 보조 도구로서 활용 가능성이 한층 넓어졌다.
이번부터 Vertex AI 상에서의 파인튜닝 옵션도 제공된다. 업종별 고유 용어·문서 스타일에 대한 대응이 용이해지며, Google이 범용 모델 시장을 넘어 「업종 특화 모델의 플랫폼 경쟁」에 본격 참전했다고 볼 수 있다.
입력 $18/1M 토큰은 출시 모델 중에서도 고비용 구간에 해당한다. 다만 200만 토큰을 일괄 처리할 수 있어, 기존에 여러 번의 API 호출이 필요했던 플로우를 하나로 합칠 수 있는 경우 실질 비용이 역전되는 사례도 있을 것으로 보인다. 200만 토큰을 풀로 활용하면 1회 추론 비용이 $36을 초과한다는 점은 주의가 필요하다.
NotebookLM Pro에의 탑재는 비개발자 계층으로의 보급을 가속할 가능성이 있다. 법무·컴플라이언스·연구직이 API를 거치지 않고 장문 추론을 활용할 수 있는 경로로 기능한다.
Gemini 2.5 Ultra 공개에서 가장 주목해야 할 점은 「점수의 높이」보다 「문맥 길이의 두 배 확장」이다. 지금까지 LLM 활용 설계에서 병목이었던 「분할해서 프롬프트를 재구성하는」 작업이, 많은 유스케이스에서 불필요해진다.
법무·금융·제약 등 문서의 「전체상」을 한 번에 파악해야 하는 업종에서는, 이는 단순한 편의성 향상이 아니라 워크플로 설계의 전제 자체가 바뀌는 것을 의미한다. 여러 번의 추론 루프를 구성했던 설계를 1회의 추론으로 집약할 수 있는 시나리오가 명확히 늘어날 것이다.
한편 비용 면에서는 신중한 설계가 필요하다. 「일단 전부 입력해버리는」 설계로는 월간 비용이 예상을 크게 초과할 수 있다. 「어떤 문서를, 어떤 세밀도로, 어떤 빈도로 처리할 것인가」라는 비용 설계가 도입 판단의 핵심이 된다.
Vertex AI에서의 파인튜닝 제공은 Azure OpenAI와의 엔터프라이즈 경쟁을 본격적인 업종 특화 모델 전쟁으로 끌어들이는 한 수다. GPT-4o의 $5/1M이라는 가격대와 비교했을 때의 「정확도×비용×문맥 길이」 트레이드오프를 업종별로 구체적으로 시산할 수 있는 단계에 접어들었다.
Gemini 2.5 Ultra는 「모델 성능의 추가적인 향상」이라는 축뿐만 아니라, 「문맥 길이」라는 설계 자유도의 확대라는 점에서 실무적 임팩트가 크다. 200만 토큰이라는 숫자를 「스펙표의 데이터」가 아니라 「업무 설계의 변수」로 읽을 필요가 있다.
다음 관전 포인트는 두 가지다——OpenAI가 o4 계열로 컨텍스트 길이 경쟁에 정면으로 응전할 것인지, 그리고 Vertex AI의 파인튜닝 가격이 기업의 전환 판단을 얼마나 뒷받침할 것인지. 연내에 「장문맥×업종 특화」의 실적 사례가 쌓이면, 도입 판단의 무게가 단번에 달라질 것이다.
※본 기사는 미라이 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.