Google DeepMind正式发布「Gemini 2 Ultra」——200万Token上下文与视频实时解析重塑多模态竞争格局
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Google DeepMind于2026年9月5日(当地时间)通过Google AI Studio及Vertex AI正式向公众开放「Gemini 2 Ultra」。200万Token上下文长度、实时视频解析、输入定价$15/MTok——三项组合将多模态API的设计基准提升至新高度。虽在成本竞争上处于劣势,但「超长上下文×视频理解」的组合,是目前其他模型尚不具备的独特定位。
根据与官方博客同步发布的API文档,Gemini 2 Ultra的主要规格如下:
发布消息甫出,X平台上技术人员的反应随即集中涌现:
「2M上下文+实时视频解析能以$15/MTok使用,这在结构上是完全不同的。将3小时会议视频直接传入API,这已经成为现实。」
Gemini 1.5系列于2024年携100万Token上下文亮相,但成本与速度成为瓶颈,大规模企业级采用因此受限。2025年后推理成本的大幅下降提供了有利条件,Google将Project Astra的视频理解技术整合至Gemini基础架构中。此次Ultra版本正是这一成果的集中体现。
在竞品比较方面,Claude 5 Sonnet以200K Token/$3/MTok运行,OpenAI o3-pro以128K Token/$60/MTok运行,Gemini 2 Ultra则凭借「超长上下文×视频×全球即日可用」占据独特位置。AI竞争的重心,已从精度之争明显转向「上下文长度×模态×单价组合」的综合比拼。
相当于150万词的上下文可一次性处理,使过去必不可少的「分割→摘要→重新整合」流水线在部分场景下得以省去。数百份法律文件、完整代码库、长期项目的全量对话线程均可一次性处理,法务、审计、代码审查等工作流程的设计逻辑因此面临重新审视。
2025年Google I/O上演示的视频识别能力,首次以API形式向外部开放。对最长3小时的视频流进行逐帧解析,并实时返回问答、摘要与异常检测的设计,直接对应制造产线质量检验、医疗影像审阅、监控视频自动化等应用场景。视频AI正从「专用模型」向「通用大模型的附加功能」迁移。
输入$15/MTok是Claude 5 Sonnet($3/MTok)的5倍。超长上下文与视频解析的优势能否覆盖成本增量,取决于具体使用场景。短文本、高频次任务仍是Sonnet/Haiku系的优势区间,开发者需要在「文本量、调用频率、精度、模态」四个变量之间进行最优模型选型——这一阶段已然到来。
Gemini 2 Ultra的发布,标志着多模态API的竞争轴已从「精度」全面转向「上下文长度×单价×模态组合」。Claude 5系以「成本×Agent效率」、o3-pro以「高推理×API开放」、Grok 4以「实时信息×X平台整合」各据一方的格局下,Google以「超大规模上下文×视频理解」实现差异化。
不过有几点需要注意:Vertex AI标准区域定价为$15/MTok,但在医疗健康、金融等领域,数据处理条件可能有所不同,导入前需仔细审查合同条款。
从日本企业视角来看,「直接解析3小时日语会议视频」的功能,对会议纪要生成与合规审查的人工成本具有直接冲击力。然而,日语性能的官方评测数据目前尚未公开——这将成为采购决策中实质性的分水岭。
Gemini 2 Ultra通过同时推出「超长上下文」「视频理解」「全球即日部署」,拓展了企业级AI采购的比较维度。下一个值得关注的焦点,是Anthropic在上下文长度上能追赶Google到何种程度——以及OpenAI将视频实时解析整合进GPT系列的时间节点。竞争对手的跟进速度,将决定这一差异化定位的有效期。
※本文由 未来新闻编辑部 AI写手(AI资讯)撰写。