xAI"Grok 3.5"正式发布——实时推理×Web集成重塑研究业务的工作流程设计
機械翻訳 / Machine-translated
xAI于2026年8月23日正式发布新模型"Grok 3.5"。最核心的变化是采用了"Live Grounding"架构——能够在推理(Chain-of-Thought)步骤进行过程中实时调用Web搜索。这一设计并非传统的"先搜索再推理"流程,而是在推理过程中按需插入搜索,对同时要求信息时效性与推理精度的研究调查类业务具有直接影响。
xAI官方公布了Grok 3.5的以下基准测试结果:
Live Grounding的工作机制是在生成思考token的过程中动态插入"搜索节点"——当模型判断"自身知识已过时或存在不确定性"时,便主动触发Web搜索。根据xAI发布资料,在事实核查任务中,幻觉率相较上一代Grok 3降低了约41%。
发布后,X平台上验证推文接连涌现。
"Grok 3.5,让它做竞品分析报告,中途居然自动抓取了各家IR资料。不用手动指定搜索就能做到这些,底层结构确实不一样。"
(企业研究员,约1.2万粉丝)
API从今日起开放。定价为每百万输入tokens $8.00,输出 $24.00,与GPT-4.5 Turbo处于同一水平。
Grok 3.5的推出时机,是近几周推理模型竞争的延续。OpenAI发布了o4,Google发布了Gemini 2.5 Ultra,各家基准测试成绩几乎并驾齐驱。差异化的焦点已从"精度"转向"信息时效性"与"能否集成到智能体",xAI正是携Live Grounding切入这一赛道。
xAI在Grok 3时代将访问X(原Twitter)实时数据作为核心优势大力宣传,而Grok 3.5则将其内化至模型底层架构,将搜索范围从X专属扩展至通用Web。
传统的RAG(检索增强生成)或工具调用型智能体采用"搜索→获取→输入→推理"的顺序结构。Live Grounding在推理过程中插入搜索,其工作方式更接近人类"边提出假设边验证"的研究过程。具体而言,竞品调查、文献调查、包含事实核查的分析报告生成等任务的工作步骤有望大幅减少。
512,000 tokens的上下文容量,相当于可一次性处理约400页文档。多期财报资料对比分析、合同审阅、大型代码库的跨文件解析等"把所有内容一次性输入进行查询"的场景,已进入实用范围。不过,长文本上下文中的推理精度是否能够保持,仍需独立验证,仅凭官方公布数据下判断为时尚早。
$8/$24(输入/输出,每百万tokens)与Claude Opus 4.6的$15/$75、GPT-4.5 Turbo的$10/$30相比,输入成本具有明显优势。这一价格水平预计将进入优先考虑成本优化的企业采购选项。
目前API规格提供OpenAI兼容端点,预计可无缝接入LangChain、LlamaIndex、Claude Agent SDK等主流框架。Live Grounding功能本身可通过API调用时的参数(live_grounding: true)进行控制,智能体管道设计者可方便地将其集成至现有工作流中。
xAI在发布Grok 3.5的同时,还宣布扩展面向企业的"Grok for Teams"计划。每席位月费$40,附带优先API访问权限与审计日志。这一举措明显着眼于企业使用的合规治理需求,也可视为此前"优先面向个人用户"路线的转型信号。
本次发布最值得关注的,不是Live Grounding这一功能本身,而是"消除推理与搜索之间边界"的设计理念。模型能够自主判断"此刻应该搜索"的机制,对于智能体设计者而言意味着省去一个循环环节,具有切实的实用价值。
然而,搜索时机的控制机制仍是黑箱,这一点构成潜在风险。若无法保障"何时搜索了什么"的可追溯性,在需要审计的业务(法务、合规、财务报告)中推广应用时就必须保持审慎。xAI是否会进一步提供"搜索日志API",将成为企业级采用的关键分水岭。
在各家竞争模型的推理精度数字趋于一致的当下,差异化竞争的战场已转移至"信息时效性"与"智能体集成成本"。从这一视角来看,Grok 3.5的定位相当清晰。但Live Grounding在实际任务中能否实现如其所声称的精度提升,仍有待未来2至4周内陆续出现的独立复现实验加以验证。
xAI"Grok 3.5"的核心价值在于将实时搜索集成至推理循环这一结构性变革。跳出基准测试数字的竞争,其将"信息时效性"内嵌于设计层面的做法,对研究调查类业务将产生直接影响。下一个关注焦点,将是Live Grounding功能可追溯性规格的公开披露,以及独立机构的复现评估结果。企业采购决策者不妨等待本周内即将发布的第三方基准测试报告后再做判断,这应是更为稳妥的做法。
※本文由ミライ・ニュース编辑部的AI撰稿人(AI新闻)撰写。