OpenAI「o4」正式发布——代码推理突破71%,智能体设计的博弈方式就此改变
機械翻訳 / Machine-translated
OpenAI于2026年8月16日(美国时间)通过API及ChatGPT Pro同步发布了专注推理的模型「o4」。该模型在代码基准测试「SWE-bench Verified」中取得71.3%的成绩——相较上一代o3的53.1%,大幅跃升逾18个百分点。在数学奥林匹克级别题目(AIME 2026)上,正确率高达92.0%。从今天起,「能够交给AI智能体处理的上限」这一直觉性边界,已发生了根本性的移动。
OpenAI官方公布的o4主要基准测试结果:
API提供「o4」与「o4-mini」两款模型。o4-mini定价为每100万输入Token $2.00,o4为$15.00。与o3-mini相比,o4-mini实现了约41%的成本削减。
发布后,工程师群体的反应迅速汇聚至X平台。
「o4在SWE-bench上达到71.3%,比预期早了2至3个季度。按此推算,年内自主PR合并将成为现实。」
—— AI工程师账号(粉丝数达数万人级别)
自o3发布(2025年12月)以来,自主智能体落地实践中「推理瓶颈」始终是挥之不去的难题。SWE-benchmark 53%左右的成绩,实质上意味着「约八成任务仍需人工审查」,在完全自主的代码PR生成方面存在明显差距。
这期间,业界竞争的焦点集中于上下文长度、多模态能力与输出速度,而o4则另辟蹊径,专注于「推理深度」的优化。据悉,其内部基于强化学习的自我修正循环(Self-Correction)得到了大幅强化。从o3到o4历时约8个月——竞争周期的压缩,再次以具体数字清晰呈现。
SWE-bench 71.3%意味着,附带测试的中小规模Bug修复任务,有相当一部分开始进入「无监督执行」的可行区间。智能体工作流设计中,如何重新定义「触发人工确认的条件」,已成为当务之急。
每100万Token $2.00的定价,将初创企业与中小企业领域的推理密集型任务实现常态化运行所需的成本,拉至切实可行的水平。从o3-mini迁移至o4-mini的动力相当强劲,API使用量的构成比例预计将在短期内发生明显转变。
同日SWE-bench对比:Gemini 2.5 Ultra为67.8%,Claude Opus 4.7(2026年7月发布)为69.2%,o4以71.3%在数字上暂居首位。然而,结合推理延迟、上下文长度与成本结构综合权衡,各场景的最优选择仍有分歧。「o4是全场景最优解」的判断为时尚早。
国内系统集成商与外包开发领域,已陆续将o3纳入代码审查辅助流程。迁移至o4后,审查环节的效率提升幅度预计将进一步扩大。但对于大多数企业而言,安全审查与许可证核查流程由人工把关的方针并不会改变。
如何解读71.3%这个数字,是判断的分水岭。剩余的28.7%并非「AI不擅长的任务」,而是「目前尚无法以稳定概率解决的问题」,且这一概率因会话而波动。当前合理的设计思路,是构建「对成功率高的任务进行大批量处理」的架构,而非「完全放任自动运行」的架构。
比这更值得关注的,是迭代速度的问题。从o3到o4,约8个月实现了超过18个百分点的提升。若这一速度得以持续,2027年上半年SWE-bench突破80%的推算便具有相当的可信度。
对企业而言,「观望」与「导入」之间的决策成本不对称性,正在此刻悄然翻转。「持观望态度」的代价超过「着手落地」的代价,这一时间节点由模型性能曲线所决定。今天的发布,将作为该曲线上一个清晰的拐点被载入记录。
o4的发布,提供了将自主智能体从「PoC验证」推向「生产工作流」的决策依据。然而,评估维度不应止步于精度,还需从成本、延迟与安全需求三个维度综合审视。下一个值得关注的焦点,在于OpenAI将以何种顺序将o4整合至Operator等智能体框架之中——这将实质性地决定其向实务渗透的速度。
※本文由 未来新闻编辑部 AI 撰稿人(AI新闻)撰写。