Google Gemini 2.5 Ultra 공식 출시 — 200만 토큰으로 법무 분석이 바뀐다
機械翻訳 / Machine-translated
Google은 일본 시간 기준 2026년 8월 24일 오후 8시, 「Gemini 2.5 Ultra」를 Google AI Studio 및 Vertex AI를 통해 공식 출시했다. 최대 200만 토큰의 컨텍스트 창, LegalBench 87.1%라는 점수가 시사하는 것은, '시험 문제를 푸는 AI'에서 '실무 서류를 처리하는 AI'로의 본격적인 전환이다. 법무·재무·의료 현장에 직접 와닿는 수치들이 줄지어 등장했다.
Google이 공식 블로그를 통해 발표한 Gemini 2.5 Ultra는 이전 버전(Gemini 2.0 Ultra) 대비 컨텍스트 길이를 4배 확장하여, 200만 토큰(한국어 환산 약 100만 자, A4 기준 약 3,000장 분량)의 일괄 처리를 실현했다.
주요 벤치마크는 다음과 같다:
가격은 Gemini 2.0 Ultra와 동일한 수준을 유지한다. 입력 100만 토큰당 $3.50, 출력 $10.50. 비용 증가 없이 컨텍스트 길이가 4배가 된 셈이다.
X(구 트위터)에서는 법무 실무자들의 반응이 이미 나오고 있다:
"계약서 500페이지를 일괄로 비교 검토시켰더니, 조항 간 모순을 23곳이나 추출해냈다. 기존 툴로는 불가능한 분량이었다." (서울 소재 법률사무소 변호사, X 게시글)
장문 컨텍스트 처리는 2025년 하반기부터 주요 LLM의 가장 중요한 경쟁 축으로 자리잡았다. Anthropic은 Claude 3.7 Opus에서 128만 토큰을, OpenAI는 o4에서 100만 토큰 지원을 발표했으나, 200만 토큰 수준은 이번이 업계 최초로 보인다.
Google이 이 영역에 집중하는 배경에는 엔터프라이즈 시장의 구조가 있다. 법무·재무·의료 실무에서는 단일 문서가 수백 페이지에 달하는 경우가 많아, 기존 AI 툴로는 '분할 처리 → 결과 결합'이라는 인력 개입이 불가피했다. 200만 토큰은 그 분기점을 단번에 넘어서는 수치다.
또한 Google은 이번에 「Document Grounding」 기능을 동시에 출시했다. PDF·스프레드시트·법령 데이터베이스를 직접 참조하게 하고, 답변에 출처 인용을 부여하는 구조로, 환각(hallucination) 리스크 감소와 감사 추적 확보를 동시에 달성하는 설계다.
200만 토큰은 M&A 계약서 전문 + 첨부 별지 패키지, 분기 결산 보고서 × 복수 기간분, 또는 의약품 승인 신청 자료(CTD)의 주요 모듈을 일괄 처리할 수 있는 양이다. 'AI에게 요약시킬 수밖에 없었던' 업무가 'AI에게 전문을 읽게 하는' 방식으로 바뀐다. 분할 처리를 위한 아키텍처 설계 비용이 통째로 사라지는 경우도 생긴다.
LegalBench는 2023년 스탠퍼드·하버드가 공동 개발한 법무 추론 벤치마크다. 87.1%는 변호사 평균 점수(80~85%)를 상회하는 수준이다. 다만 LegalBench는 미국 법체계를 전제로 하고 있어, 한국법 적용에는 별도 검증이 필요하다. 국내 법무 부문이 87.1%를 그대로 신뢰하는 것은 섣부른 판단이며, 자사 서류를 활용한 PoC(개념 검증)를 먼저 진행하는 것이 현실적인 접근 방식이다.
장문 컨텍스트 모델에서는 문서가 길어질수록 중간 정보를 놓치는 'lost in the middle' 문제가 지적되어 왔다. Document Grounding은 참조 위치를 명시적으로 인용하는 구조로, 재무·법무 현장에서 요구되는 '판단 근거에 대한 설명 책임'을 담보한다. 이 기능이 갖춰지지 않으면 감사를 통과해야 하는 엔터프라이즈 환경에서의 도입은 진전되기 어렵다.
Vertex AI를 통해서는 데이터를 외부로 전송하지 않는 VPC(가상 프라이빗 클라우드) 내 처리 옵션을 선택할 수 있다. 엔터프라이즈 계약에서는 처리 데이터의 Google 학습 활용 제외도 설정 가능하다. 금융기관·의료기관이 갖고 있는 데이터 거버넌스 요건에 명시적으로 대응한 사양으로 보인다.
'200만 토큰'이라는 수치보다, 동시에 발표된 가격 동결이 구조적으로 더 중요하다. 컨텍스트 길이 4배에 비용 변화 없음은 실무 도입의 ROI 계산을 완전히 바꿔놓는다. Google은 AI Studio의 무료 플랜에서도 200만 토큰을 시험해볼 수 있도록 설정해두었으며, 법무·재무 실무자가 자사 서류로 프로토타입을 먼저 만들 수 있는 환경을 의도적으로 마련한 것으로 읽힌다.
국내 도입에는 주의할 점이 있다. 한국어 처리 정확도와 한국법 대응 상황이 이번 공식 발표에 포함되어 있지 않다. 영어 기반 벤치마크와 국내 실무 성능 사이에는 괴리가 생기기 쉬우며, 선제적으로 도입한다면 '벤치마크 점수'가 아닌 '자사 서류를 활용한 PoC 결과'로 의사결정을 해야 할 시점이다.
다음 관전 포인트는 2026년 Q4로 보인다. Anthropic과 OpenAI가 200만 토큰에 대한 대응책을 내놓을지 여부가 초점이다. 컨텍스트 길이의 수치 경쟁이 일단락되고, '장문을 정확하게 다룰 수 있는가'라는 정확도와 근거 제시의 질이 다음 경쟁 축이 되는 분기점에 접어들고 있다.
Gemini 2.5 Ultra의 출시는 법무·재무·의료 분야의 장문 처리에서 구조적 병목을 제거하는 한 수다. 'AI에게 전문을 읽게 하는' 선택지가 현실이 된 지금, 요구되는 것은 자사 문서 처리 과정에서 인력 개입이 아직 남아 있는 부분을 점검하는 일이다. 200만 토큰을 사용할 수 있는 환경과, 200만 토큰을 제대로 활용하는 설계 사이에는 아직 채워야 할 여지가 있다.
※ 본 기사는 미래 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.