Google「Gemini 2.5 Ultra」正式发布——200万Token×科学推理,长文档分析的基础前提迎来变革
機械翻訳 / Machine-translated
Google DeepMind于2026年8月9日(太平洋时间)正式向公众开放旗舰模型「Gemini 2.5 Ultra」。该模型将上下文窗口扩展至业界最大级别的200万Token,并在GPQA(科学推理基准)上以92.3%的成绩刷新了新SOTA记录。法律文书、金融披露、论文审查等需要「长文本+高精度推理」的业务,其设计前提已在实务层面开始真正改变。
Google DeepMind已通过Google AI Studio及Vertex AI开始正式提供Gemini 2.5 Ultra。与上一代Gemini 2.0 Ultra相比,上下文窗口从100万Token翻倍至200万Token。API定价为输入每100万Token $18、输出每100万Token $54。
发布后,X平台上来自实际用户的验证报告接连出现。
「把1500页的判例数据库整个输入Gemini 2.5 Ultra,与特定条文的比对在3分钟内完成。法务团队原本要花半天的工作就此改变。」
GPQA(Graduate-Level Google-Proof Q&A)得分达到92.3%,为公开模型中的最高水准。在MATH基准(数学推理)上也录得97.1%,略微超越OpenAI o3的96.4%。
Gemini 2.5 Ultra被定位为继2026年3月发布的Gemini 2.5 Pro之后,同系列的最高端模型。Pro侧重于推理速度与价格效益,而Ultra则明确差异化为优先最大化精度与上下文长度的旗舰产品。
200万Token的上下文窗口,换算为英语文本约相当于2000页。这使得过去只能「分段处理」的大体量法律文书、财务报告、研究论文群,得以整体一次性输入,从而实现跨文档的交叉比对与矛盾检测。
Google同时宣布升级搭载Gemini 2.5 Ultra的NotebookLM Pro,进一步强化与面向研究人员的论文分析工作流的集成。
200万Token并非单纯的规格竞争。超过3000行的完整代码库,或一整年的合同文书群,都可以作为「一个上下文」来处理。分段处理带来的「上下文断裂」风险消失,对于参照关系复杂的文档效果尤为显著。
GPQA 92.3%被认为是「能够正确回答绝大多数博士级科学问题」的水准。在新药研发、材料科学、金融工程等需要专业推理的行业中,作为辅助工具的应用可能性得到了进一步拓展。
本次同步提供了在Vertex AI上进行微调的选项。这使得针对特定行业术语和文档风格的适配更加便捷,可以视为Google正式进军「行业专属模型平台竞争」的信号,超越了通用模型市场的范畴。
输入$18/100万Token在现有发布中属于高成本区间。不过,由于可以一次性处理200万Token,对于过去需要多次API调用的工作流,有时实际成本反而会出现逆转。需要注意的是,满额使用200万Token时,单次推理成本将超过$36。
将Gemini 2.5 Ultra整合进NotebookLM Pro,有可能加速其在非工程师群体中的普及。这为法务、合规、研究岗位的人员提供了无需通过API即可使用长文本推理的路径。
Gemini 2.5 Ultra发布中最值得关注的,与其说是「评分之高」,不如说是「上下文长度的翻倍」。过去在LLM应用设计中长期作为瓶颈的「分段重组提示词」工作,在众多使用场景中将成为历史。
在法务、金融、制药等需要一次性把握文档「全貌」的行业,这不仅仅是便利性的提升,而是工作流设计前提本身的根本性变革。原本需要构建多轮推理循环的设计,能够整合为单次推理的场景将明显增多。
另一方面,成本层面需要审慎设计。「先把所有内容都输入进去」的设计思路,可能导致月度成本大幅超出预期。「哪些文档、以何种粒度、以何种频率处理」的成本设计,将成为导入决策的核心。
Vertex AI上的微调选项,是将与Azure OpenAI之间的企业级竞争正式引入「行业专属模型之战」的一步棋。与GPT-4o的$5/100万Token价格带相比,「精度×成本×上下文长度」的权衡取舍,已经到了可以按行业进行具体测算的阶段。
Gemini 2.5 Ultra的实务影响,不仅体现在「模型性能的进一步提升」这一维度,更在于「上下文长度」所带来的设计自由度的扩展。需要将200万Token这一数字,不再视为「规格表上的数据」,而是作为「业务设计的变量」来解读。
下一个焦点有两点——OpenAI是否会以o4系列正面迎战上下文长度竞争,以及Vertex AI的微调定价能在多大程度上推动企业做出切换决定。如果年内「长上下文×行业专属」的实际案例持续积累,采用决策的天平将迅速发生倾斜。
※本文由 ミライ・ニュース 编辑部的AI写作者(AIニュース)撰写。