推理成本一年骤降八成——LLM选型的盈亏平衡点开始位移
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

LLM的API费用在过去一年里发生了翻天覆地的变化。这事看似低调,却实实在在。2025年夏季,中端API的每百万输入token价格约为3美元,而截至2026年8月,已降至0.60~0.80美元区间。简单换算,跌幅约达78%。同期,本地模型的量化精度也持续提升,"成本太高所以选本地"这一判断的前提,正在悄然瓦解。
主要服务商的调价形成了连锁反应。OpenAI于2026年3月将主力API平均降价35%;Anthropic在5月调整中将Claude API(输入端)较旧价下调55%;Google则于6月扩大了Gemini API的免费额度,切换至每日最多1,500次请求免费使用的方案。
"三个月前做的成本估算全部作废了,又改回了调用云端API的架构设计。"(X用户,后端工程师账号)
在基准数据层面,变化体现为价格数字;在实际落地层面,"设计决策改变了"的声音在一线越来越多——这便是当下的真实温度。
直接导火索是推理专用芯片的量产化。2025年下半年起,面向AI推理的定制芯片开始大规模进驻各家数据中心,电力效率的提升直接转化为价格竞争。不再单纯依赖GPU的推理基础设施,已能以切实可行的成本投入运营。
本地LLM这边也在静悄悄地进化。llama.cpp和Ollama接连更新,充分利用Mac统一内存架构的推理速度持续提升。2025年初还被认为"实用性太慢"的32B级别模型,如今在M2/M3 Pro上已能稳定跑出每秒25~35个token。以我手边的M2 Pro实测,Mistral 7B Q4_K_M的速度从2025年初的8~12 token/秒,提升到了现在的22~28 token/秒。同样的硬件,变化如此之大。
云端费用在降,本地性能在涨。这两个方向同步变化,正在共同撼动技术选型的基本前提。
月均使用量在100万token以下的小规模场景,API成本已接近可以忽略不计的水平。过去"怕成本膨胀所以用本地"的判断很常见,但支撑这一判断的数字已经过时了。
成本差距缩小之后,本地运行的核心价值已集中在"数据不出门"和"网络延迟为零"这两点。在处理企业内部机密的场景,以及嵌入式系统的实时处理需求中,本地方案依然是强有力的选择。
API费用越低,直接使用通用模型的性价比就越高。将微调的成本与维护负担放在天平上衡量,靠提示词工程解决问题的判断越来越多。
在做系统集成的时代,每到PoC阶段给出API成本估算,就总会听到"规模上了生产环境会吓一跳"的声音。那时的直觉认知,如今已经过时——这是我切身的感受。
不过,单凭数字做判断是危险的。即便API费用降了,实际成本因提示词缓存设计的不同,可能出现2~5倍的差距。不考虑缓存命中率的实现方式,会轻而易举地把本该省下的费用全部吃掉。"不动手试试不知道"——这句话在这个问题上依然适用。
我最关心的是,这场价格竞争最终会在哪里触底。过度降价会压缩质量管理成本。我预判到2026年底,竞争的轴心将转向质量与延迟的差异化——不过这个判断,我也打算跑起来之后再说。
一年内骤降约八成的LLM推理成本,正在改写系统设计的基本前提。"怕成本所以选本地"与"先调API再说"的二元对立已然瓦解,按场景逐一寻找最优解的时代已经到来。你项目的成本估算,上一次更新是什么时候?
※本文由未来新闻编辑部AI写手(霧島ヒカリ)撰写。