Google Gemini 2.5 Ultra正式发布——200万Token重塑法律文书解析
機械翻訳 / Machine-translated
北京时间2026年8月24日20时,Google正式通过Google AI Studio及Vertex AI发布「Gemini 2.5 Ultra」。最大200万Token的上下文窗口,以及LegalBench 87.1%的得分,标志着AI从「解答考题」向「处理实务文件」的全面转型。这些数字直接切中法务、财务、医疗一线的核心需求。
Google在官方博客宣布,Gemini 2.5 Ultra相较前一版本(Gemini 2.0 Ultra)将上下文长度扩展至4倍,实现了200万Token(换算为中文约100万字,相当于约3,000页A4文档)的一次性处理。
主要基准测试结果如下:
定价与Gemini 2.0 Ultra保持同一水平:输入每100万Token $3.50,输出$10.50。在成本不变的前提下,上下文长度实现了4倍增长。
X平台上,法务从业者的反应已迅速涌现:
「让AI一次性比对500页合同,识别出23处条款矛盾。这是传统工具根本无法处理的体量。」(东京某律师事务所律师,X平台发帖)
自2025年下半年起,长上下文处理已成为主流大语言模型最核心的竞争维度。Anthropic此前宣布Claude 3.7 Opus支持128万Token,OpenAI的o4支持100万Token,而200万Token的水准被认为是业界首次突破。
Google将重心押注于此,背后是企业市场的结构性需求。法务、财务、医疗领域的实务工作中,单份文件动辄数百页,以往的AI工具不可避免地需要「分段处理→结果合并」的人工介入。200万Token一举跨越了这一门槛。
此外,Google此次同步发布了「Document Grounding」功能。该功能支持直接引用PDF、电子表格及法规数据库,并在回答中附上来源引用,在降低幻觉风险的同时确保审计留痕,实现了两者的兼顾。
200万Token足以一次性处理并购合同全文及附件包、多期季度财务报告,或药品上市申请资料(CTD)的核心模块。过去只能「让AI生成摘要」的工作,如今可以升级为「让AI通读全文」。分段处理的架构设计成本,在某些场景下将彻底消失。
LegalBench是2023年由斯坦福大学与哈佛大学联合开发的法务推理基准测试。87.1%已超过律师平均得分(80~85%)。但需注意,LegalBench以美国法律体系为前提,应用于中国法律环境需另行验证。国内法务部门若直接以87.1%作为信任依据,则为时过早——以自有文件先行开展概念验证(PoC)才是务实的推进方式。
对于长上下文模型而言,文件越长越容易遗漏中段信息,即所谓「lost in the middle」问题。Document Grounding通过明确标注引用来源的方式,保障了财务和法务场景中对「判断依据可解释性」的要求。若缺乏这一机制,难以通过审计的企业级环境将无从推进落地。
通过Vertex AI,用户可选择在VPC(虚拟私有云)内处理数据,避免数据外传。企业合同还支持设置处理数据不用于Google模型训练。这一规格被认为是针对金融机构和医疗机构在数据治理合规要求方面所作的明确回应。
比起「200万Token」这个数字,此次同步公布的价格不变更具结构性意义。上下文长度翻4倍而成本不变,将彻底改变实务采用的ROI测算逻辑。Google还将AI Studio免费额度同步开放至200万Token,此举显然是有意为法务、财务从业者创造条件,让他们能先用自有文件搭建原型。
国内部署仍需关注若干注意事项。此次官方发布并未涵盖中文处理精度及对中国法律的适配情况。英文基准测试与国内实务表现之间容易出现偏差,若要率先引入,决策依据应是「自有文件的PoC结果」,而非「基准测试分数」。
下一个关键节点预计在2026年Q4:Anthropic和OpenAI是否会推出对标200万Token的应对方案?上下文长度的数字竞赛或将告一段落,「能否精准处理长文」——即准确性与依据呈现质量——将成为下一阶段竞争的核心轴线,行业正处于这一转折点。
Gemini 2.5 Ultra的发布,是消除法务、财务、医疗领域长文处理结构性瓶颈的关键一步。「让AI通读全文」的选项已成为现实,摆在眼前的问题是:盘点自身文件处理流程中还有哪些环节仍依赖人工介入。能用200万Token的环境,与真正驾驭200万Token的设计之间,仍有待填补的空间。
※本文由 未来新闻编辑部 AI 撰稿人(AI资讯)撰写。