Google 「Gemini 2.5 Ultra」 공식 출시——200만 토큰 × 영상 이해로 엔터프라이즈 분석 구조가 바뀐다
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Google DeepMind는 2026년 8월 15일, 플래그십 LLM 「Gemini 2.5 Ultra」를 공식 출시했다. 업계 최장 수준의 200만 토큰 컨텍스트 윈도우와 최대 4시간 분량의 영상을 그대로 처리할 수 있는 네이티브 멀티모달 추론이 핵심이다. GPT-4.5, Claude Opus 4와 1~2포인트 이내의 동일 성능대에 진입하며, 최상위 모델 경쟁이 '벤치마크 격차'에서 '에코시스템 통합도'로 축을 옮긴 국면을 보여주고 있다.
Google AI Studio 및 Vertex AI를 통해 당일부터 API를 이용할 수 있다. Google Cloud 파트너 대상 엔터프라이즈 티어도 선행 공개되었다. 주요 스펙은 다음과 같다.
X(구 Twitter)에서는 국내 엔터프라이즈 엔지니어들의 다음과 같은 반응이 나오고 있다.
「Gemini 2.5 Ultra, 200만 토큰으로 법률 문서 전체를 통째로 투입해 QA를 할 수 있다. 법무팀의 워크플로우가 근본적으로 바뀔 가능성이 있다」
Gemini 시리즈는 2024년 12월의 Gemini 1.5 Pro부터 컨텍스트 길이 확장과 멀티모달 성능 향상을 주축으로 개발을 진행해왔으며, 2025년 전반기에는 Gemini 2.0 Flash로 비용 효율을 어필해 법인 도입의 저변을 넓혀온 경위가 있다.
2026년에 들어서면서 OpenAI의 GPT-4.5, Anthropic의 Claude Opus 4가 잇따라 등장해 최상위 모델 경쟁이 치열해졌다. Google은 여기서 '컨텍스트 길이'와 '영상 이해'라는 두 축을 통한 차별화를 선택했다.
기업 측의 니즈로 가시화되고 있는 것이 '장편 콘텐츠의 일괄 처리'다. 계약서·판례·영상 로그 등 이제까지 분할 처리나 RAG로 대응해왔던 유스케이스가 단일 프롬프트로 완결될 수 있게 된다. 이 변화는 파이프라인 설계 비용 절감으로 직접적인 수익에 영향을 미친다.
200만 토큰은 영어 기준으로 약 150만 단어, A4 기준으로 약 6,000장 분량이다. 계약서·판례·규제 문서를 1세트 통째로 문맥으로 유지한 채 Q&A를 완결할 수 있다. 법무·컴플라이언스 영역에서 '사람이 읽기 전에 AI가 1차 정사(精査)하는' 설계를 현실적인 비용으로 구현할 수 있게 된다.
제조·소매·의료 현장의 카메라 영상을 그대로 API에 투입할 수 있다. 기존에는 영상→텍스트 변환(Whisper 등)→RAG라는 파이프라인이 필요했지만, 이 단계가 단일 API 호출로 통합된다. 정보 손실 없는 파이프라인 설계라는 의미에서 현장 DX의 전제가 한 단계 달라진다.
MMLU·HumanEval·MathBench 3가지 지표에서 Gemini 2.5 Ultra는 91~93%대에 위치하며, 상위 3개 모델이 2포인트 이내에 밀집했다. 향후 선정 기준은 벤치마크 격차보다 '자사 데이터 파이프라인과의 통합도'와 'API 비용 구조'가 실질적인 축이 될 것으로 보인다.
디바이스 측은 Gemini Nano(Android/Pixel용), 클라우드 측은 Gemini 2.5 Ultra라는 역할 분담이 명확해졌다. 엣지×클라우드 하이브리드 추론 아키텍처의 설계 지침이 이번 발표로 한층 더 확고해진 형태다.
$1.50/Mtok(입력)은 저렴하지 않다. 200만 토큰을 풀로 활용하면 1요청당 비용이 커진다. 실제 운용에서는 '어디까지 컨텍스트에 담을 것인가'에 대한 비용 설계가 피할 수 없는 논점이 된다.
먼저 확인해두고 싶은 것은 '컨텍스트 길이 경쟁이 사실상 천장 영역에 도달했다'는 구조적 변화다. 200만 토큰이면 대부분의 기업 유스케이스를 커버할 수 있다. 다음 경쟁 축은 레이턴시, 비용, 그리고 '툴 통합과 파인튜닝의 유연성'으로 이동해 갈 것으로 보인다.
영상 이해의 네이티브 통합은 제조·소매·의료 현장 DX에 있어 본질적으로 큰 의미를 지닌다. 영상 데이터를 텍스트로 변환하지 않고 직접 추론할 수 있다는 것은 변환 과정의 정보 손실을 제로로 만든다는 것을 의미한다. 이 설계 변경의 혜택은 1~2년 후, 현장의 품질 검사나 재고 관리 등의 정밀도 지표로 수치에 반영될 것이다.
한편, 3개 모델이 동일 성능대에 진입함으로써 '어느 것을 선택할 것인가'에 대한 의사결정 프로세스가 정교해진다. 단순한 성능 비교를 벗어나, 보안 정책·계약 조건·기존 인프라와의 접합 비용을 포함한 TCO 평가가 선정의 중심이 될 것이다.
도쿄·오사카 리전 대응은 일본 기업에게 실질적인 허들을 낮춰준다. 개인정보보호법 대응을 국내 리전에서 완결할 수 있다는 점은 금융·의료·공공 분야에서의 도입 검토를 진전시키는 조건 중 하나다.
Gemini 2.5 Ultra의 공식 출시로, 200만 토큰이라는 '컨텍스트 포화점'이 일본 기업의 업무 설계 선택지에 들어왔다. 장문·영상·멀티모달을 다루는 파이프라인 설계자에게는 기존 플로우를 재설계할 것을 검토해볼 좋은 기회라 할 수 있다. 다음 초점은 OpenAI가 이 성능대에 어떻게 대응할 것인가——GPT-4.5 후속 모델의 발표 타이밍과 가격 전략이 연내 최상위 LLM 경쟁 구도를 결정하는 분기점이 될 것으로 보인다.
※본 기사는 미래 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성하였습니다.