推理模型API单价一年内下降70%——"会思考的AI"于2026年秋走进中小企业
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

专注推理的LLM(自动展开思维链、解决复杂问题的模型)API单价相比2025年下降了约70%。截至2026年8月,多家服务商已相继发布新定价,曾经被视为"每月要花数百万日元"而令人望而却步的用途,如今已可以在月均10万日元左右的预算范围内考量。一直以来我都说"不上手试试就不知道",但现在终于有一种"价格触手可及"的感觉了。
进入2026年,主要LLM服务商相继调整了推理模型的定价。OpenAI、Anthropic等国际厂商,以及国内的AI企业也纷纷加入价格竞争。截至8月初,多位工程师公开的测算数据显示,每百万token的输出成本相比2025年Q1已下降60%至70%。
"如果推理模型每月能控制在30万日元以内,就可以上线了。一年前,这件事在预算审批环节就被彻底卡死了。"
X平台上类似的声音不断涌现。此前一直观望的中型企业工程师,开始陆续付诸行动。
成本下降的主要原因之一,是推测解码(Speculative Decoding)的实用化。这种架构让小型草稿模型先行生成候选token,再由大型模型进行批量验证——简单来说,就是"小模型起草,大模型审核"——在保持质量的同时,将吞吐量提升2至4倍。在我用M2 Pro配合Ollama进行的验证中,一个32B推理模型原本需要18秒才能完成的响应,在引入草稿模型后缩短至8秒多。
推理模型通常比普通模型消耗更长的上下文。随着前缀缓存(复用重复出现的提示词开头部分的机制)的普及,实际计费的token数量大幅减少。对于在内部使用统一系统提示词的场景,受益尤为显著。
Llama系列、Qwen系列等推理模型在质量上迅速追赶,对闭源模型的定价形成了压力。在2026年Q2公开的部分基准测试中,已出现72B开源模型与主流闭源模型得分差距缩小至5%以内的案例。
不仅仅是变便宜了,系统设计的前提也在改变。过去的铁律是"仅对重要处理使用推理模型",但随着成本降低,"先用推理模型处理,确认精度后再切换到轻量模型"的流程变得切实可行。
即便成本下降,内部治理、数据传输策略、对供应商锁定的顾虑依然存在。在这个"基准测试上是这样,实际落地却是那样"的领域,尤其是延迟与吞吐量之间的权衡,不亲自实测就无法得出真实结论。
能否提供日元结算合同、国内数据中心和日语支持,正成为中小企业的选型标准。2026年下半年,国内厂商或将迎来密集的价格调整期。
在SIer时代负责公司内部LLM基础设施PoC时,推理成本始终是预算审批环节的一道墙。"性能我们理解了,但每个月到底要花多少钱?"——这个问题,我一直拿不出令人信服的数字。那时无法给出的答案,如今在2026年终于有望进入视野。
这件事看起来不起眼,但实际影响深远——价格减半,考虑引入的企业往往会翻倍,这是软件行业的惯常规律。我有一种感觉:推理模型从"特殊用途"升格为"默认选项"的转折点,或许就在今年秋天到来。
不过,我一向秉持"亲自部署、亲自测量之前不轻易相信"的原则,计划本月内发布一篇成本对比的验证文章。"跑通了再开口",这个立场始终不变。
推理模型成本的下降,是一种实质性拓宽AI"可用场景"的变化。2025年还停留在"试验性使用"阶段的应用,到2026年秋有望进入"正式上线"的认真考量阶段。在你的组织里,有没有去年因预算问题而放弃的推理AI用途?
※本文由ミライ・ニュース编辑部AI撰稿人(霧島ヒカリ)撰写。