xAI「Grok 3.5」正式发布——强化思维链与X平台整合,实时推理业务结构迎来变革
機械翻訳 / Machine-translated
xAI于2026年8月8日(太平洋时间)正式发布新一代模型「Grok 3.5」。其上下文窗口较上一代扩展至3倍,达100万个token,并结合对X平台实时数据的原生访问能力,有望从根本上重塑社交媒体监控、竞争对手监测以及市场情报领域中「检索→分析→报告」的工作流程。
xAI于太平洋时间8月8日下午2时,通过官方账号宣布Grok 3.5正式上线。API当日起在152个国家/地区开放使用,定价为输入$8/百万token、输出$24/百万token。上下文窗口从Grok 3的32万token扩展至约三倍。
基准测试方面,MMLU达94.2%,GPQA(研究生级别科学问答)达89.1%。虽略低于OpenAI GPT-5的MMLU 95.1%,但在xAI自定义的「实时推理」评估项目中以92.7%反超。推理速度较上一代提升2.4倍。
发布后,X平台上的验证帖子迅速涌现,多个速报账号发布了如下实验报告:
「让Grok 3.5调用X的实时搜索功能询问'今天半导体股票走势',它在3分钟内汇总了各只股票的价格变动及相关新闻。我自己搭的RAG流水线可能用不上了。」
Grok 3于2026年2月发布,但实时数据访问仅限于X的搜索功能,结构化数据处理精度一直是其短板。在此期间,GPT-5与Gemini 2.5 Ultra相继推出,xAI在基准测试上的优势在半年内明显收窄。
Grok 3.5将思维链(Chain-of-Thought)的处理步骤从「最多64步」扩展至「最多256步」。xAI声称,在需要多步推理的金融分析、法律文件审查及代码生成场景中,正确率较此前平均提升17个百分点。
此前Grok的X整合仅停留于「关键词搜索」层面。Grok 3.5新增了对特定话题标签与账号群体趋势的时间序列汇总功能,并可一体化完成摘要与情感分析。这与Brandwatch等专业社交媒体聆听工具之间的竞争关系已然明朗。
100万token相当于中文约80万字,或A4纸约1,600页。合同、财务报告及完整源代码仓库的分析,正进入以现实成本即可完成的可行区间。这将对专注长文本处理的细分工具市场形成明显压力。
输入$8/百万token的定价,相比Claude Sonnet 4.6($3/M)和GPT-4o($5/M)略显偏高。然而若将X实时数据一并纳入考量,无需另行承担数据采集与检索成本,在专注于社交媒体分析的场景下,综合成本存在逆转的可能性。
MCP(模型上下文协议)支持目前处于「准备中」阶段,与LangChain、CrewAI的官方集成尚未确认。融入自主智能体框架方面,相比竞争对手预计落后1至2个月,这将成为企业级全面采用的瓶颈所在。
Grok 3.5之所以有别于普通的大模型发布,在于它能将X平台10亿用户每秒产生的数据直接用作「推理输入」。其他模型以整个互联网为检索对象,而Grok的设计则是对特定平台进行深度挖掘——这种不对称性在社交媒体聆听、选举分析及金融新闻情感解析领域将形成结构性优势。
但隐忧也同样明确。X的数据质量易受平台运营政策影响,虚假信息与垃圾内容混入模型推理的风险无法完全排除。「时效性」与「可靠性」之间的权衡,是使用方在设计阶段就应清醒应对的问题。
暂不支持MCP这一现状,对急于推进企业部署的组织而言构成实质性障碍。未来60天内是否推出官方支持,将成为智能体市场中采用率走向的分水岭。
Grok 3.5以「高速、广上下文、X平台整合」三大特性,对以社交媒体为起点的商业情报业务形成最直接的冲击。虽未能登顶基准测试榜首,但与X数据的无缝整合作为差异化核心,是其他模型难以复制的优势。下一个关注焦点在于MCP支持与智能体框架集成的正式发布——一旦尘埃落定,企业的采用决策有望迅速跟进。
※本文由 ミライ・ニュース 编辑部 AI 撰稿人(AI新闻)撰写。