Google「Gemini 2.5 Ultra」正式发布——200万Token×视频理解重构企业级分析格局
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Google DeepMind于2026年8月15日正式发布旗舰大语言模型「Gemini 2.5 Ultra」。其核心亮点在于业界领先的200万Token上下文窗口,以及可直接处理最长4小时视频的原生多模态推理能力。该模型与GPT-4.5、Claude Opus 4的性能差距已缩小至1至2个百分点以内,标志着顶级模型的竞争重心已从「基准分数差距」转向「生态系统整合度」。
Google AI Studio及Vertex AI已于同日开放API访问。面向Google Cloud合作伙伴的企业级套餐亦同步抢先发布。主要规格如下:
X(原Twitter)上,国内企业级工程师纷纷发表看法:
「Gemini 2.5 Ultra凭借200万Token,可以将整套法律文件一次性输入并进行问答。法务团队的工作流程有望从根本上改变。」
Gemini系列自2024年12月的Gemini 1.5 Pro以来,始终以扩展上下文长度和提升多模态性能为核心研发方向。2025年上半年,凭借Gemini 2.0 Flash在成本效率上的优势,进一步拓宽了企业级应用的落地规模。
进入2026年,OpenAI的GPT-4.5与Anthropic的Claude Opus 4相继问世,顶级模型的竞争愈发激烈。Google在此选择以「上下文长度」和「视频理解」两个维度作为差异化策略。
企业端已显现出的核心需求,正是「长内容的批量处理」。合同文书、判例、视频日志等此前需要分段处理或借助RAG方案应对的场景,如今可在单个提示词内一次性完成。这一变化将直接降低流程设计成本,从而产生实质性的效益。
200万Token约合英文150万词,相当于约6,000页A4纸。将合同文书、判例、监管文件整套作为上下文保留,同时进行问答已成为现实。「AI在人工审阅前完成初步筛查」的设计,在法务与合规领域可以以可控成本真正落地实施。
制造、零售、医疗领域的现场摄像视频可直接输入API。过去需要经历「视频→文本转换(Whisper等)→RAG」的流程,如今可整合为单次API调用。从零信息损耗的流程设计角度而言,现场数字化转型的基本前提已上升至新的台阶。
在MMLU、HumanEval、MathBench三项指标上,Gemini 2.5 Ultra处于91%至93%区间,顶级三款模型之间的差距已压缩至2个百分点以内。今后的选型依据预计将不再侧重于基准分数差异,而是以「与自有数据流程的整合程度」及「API成本结构」作为实质性判断标准。
端侧由Gemini Nano(面向Android/Pixel)负责,云端由Gemini 2.5 Ultra承担,两者的角色分工进一步明确。边缘×云端混合推理架构的设计方向,随着本次发布变得更加确定。
$1.50/Mtok(输入)并非低廉价格。若充分利用200万Token,单次请求的费用将相当可观。在实际部署中,「上下文应填入多少内容」的成本控制设计,将成为无法绕开的核心议题。
首先需要确认的一个结构性变化是:「上下文长度的竞争实际上已接近天花板」。200万Token足以覆盖大多数企业应用场景。下一个竞争维度预计将转向延迟、成本,以及「工具集成与微调的灵活性」。
视频理解的原生集成,对于制造、零售、医疗领域的现场数字化转型而言具有根本性意义。无需将影像数据转换为文本即可直接进行推理,意味着转换环节的信息损耗降至零。这一架构变革的红利,预计将在一到两年后以现场质检、库存管理等场景的精度指标形式得到数据印证。
另一方面,三款模型进入同一性能区间后,「选择哪款」的决策过程将趋于精细化。选型重心将从简单的性能对比脱离,转向涵盖安全策略、合同条款及与现有基础设施对接成本在内的总拥有成本(TCO)综合评估。
东京、大阪区域的支持,实质性地降低了日本企业的合规门槛。个人信息保护法的合规要求可在国内区域内闭环完成,这是推动金融、医疗、公共领域加快引入评估的重要条件之一。
随着Gemini 2.5 Ultra正式发布,200万Token这一「上下文饱和点」已正式进入日本企业业务设计的可选项。对于负责处理长文本、视频及多模态内容的流程设计者而言,这是重新审视现有流程的好时机。下一个焦点在于OpenAI将如何回应这一性能区间——GPT-4.5后继模型的发布时间节点与定价策略,将成为决定年内顶级LLM竞争格局走向的关键分叉点。
※本文由ミライ・ニュース编辑部AI写手(AI新闻)撰写。