OpenAI「o4-mini」正式发布——推理成本削减65%,API经济迎来分水岭
機械翻訳 / Machine-translated
OpenAI于2026年8月10日正式发布了推理专用模型「o4-mini」。与上一代o3-mini相比,每百万输入token的成本降低约65%,同时在AMC/AIME 2025数学竞赛中达到89.4%的正确率。「价格低则精度下降」的取舍关系正在瓦解,这对通过API开展业务的初创企业的架构决策产生了即时影响。
OpenAI于日本时间2026年8月10日22时,在官方博客宣布「o4-mini」正式开放使用。定价方面,o3-mini的输入$3.00/百万token、输出$12.00/百万token,降至o4-mini的输入$1.10/百万token、输出$4.40/百万token,成本削减幅度约为63~65%。
发布资料中列出的主要基准测试数据:
发布消息一出,X平台上工程师群体中迅速引发热议:
「o4-mini以这个价格SWE-bench能超过60%,完全出乎意料。本来觉得用o3就够了,但现在想重新设计API架构了。」(国内初创企业CTO,粉丝约2.3万)
o系列推理模型自2024年9月o1首次发布以来,逐步改善着成本与精度之间的平衡。o1-mini指明了降低成本的方向,o3-mini则被认为已进入API实际应用的成熟阶段。
此次尤为值得关注的是,「mini」级别的模型在基准测试中达到了与完整尺寸模型相当甚至更优的成绩。「推理模型体积大、成本高」这一2025年时的普遍认知,随着本次发布被明确颠覆。
对实际运营的影响也极为即时。已有多位工程师公开测算:若每日处理100万次请求的API服务从o3-mini迁移至o4-mini,每月推理成本可削减约180~220万日元。
在o3-mini时代,由于月度API成本较高,推理模型的采用偏向于资源充裕的大型企业。o4-mini的价位被认为已进入许多B2B SaaS初创企业设定的「可接受成本」区间,采用门槛进一步降低。
此前的设计前提是「追求精度就要牺牲成本和速度」。o4-mini在保持响应速度的同时降低了成本、提升了精度,三角形本身的取舍关系正在改变,这为架构设计带来了更大的自由度。
OpenAI本次发布资料中未包含日语基准测试结果。JGLUE等日语评估中的性能目前尚不明确,对于以日语为核心的服务来说,即时切换需要进行额外验证。英语基准测试上的优势是否能在日语环境中同样复现,尚无保证。
推理模型成本的下降,意味着问题的焦点正从「选择哪个模型」转向「如何重新设计整体API调用架构」。
此前是在GPT-4o系列的性价比优先与o3系列的精度优先之间二选一。随着o4-mini的出现,「无论是需要高精度的处理还是批处理,统一使用o4-mini」的架构设计变得切实可行,这将有效降低整体开发与运营成本。
另一方面,也存在值得担忧的地方。OpenAI同时维护o3和o4两条产品线,模型选择的复杂度在增加。工程师持续筛选最优模型所付出的成本,可能成为新的摩擦点。
未来4~6周值得关注的是:Anthropic将如何在与Claude Haiku相当的成本区间内跟进,以及Google的Gemini Flash系列将如何制定对抗性定价。竞争的局面正从单个模型的比拼,转向整体价格带的重新洗牌。
o4-mini的发布明确颠覆了「推理模型价格高昂」这一前提。若成本削减65%、精度提升、速度加快三者兼得,重新审视API架构设计便不再是技术选择,而是业务层面的必然要求。
针对你的服务推理瓶颈的答案,从今天起已经改变。
※本文由 ミライ・ニュース 编辑部AI写手(AI新闻)撰写。