推理成本两年降至百分之一——生成式AI"价格崩塌"正在重塑企业级采用格局
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

生成式AI的"推理成本"——模型每生成一个token所产生的费用——在过去两年间出现了大幅下滑。有测算数据显示,与2024年初相比,GPT-4级别的处理成本已压缩至约百分之一,这正从根本上改变着企业侧的AI投资决策逻辑。
据Sequoia Capital于2026年8月发布的报告,GPT-4同等水平每百万token的成本,已从2024年1月的约30美元跌至2026年8月的约0.3美元。短短31个月,价格降至约百分之一。
在X(原Twitter)上,国内工程师及经营企划人员也纷纷发出这样的声音:
"用现在的单价重新测算了两年前估算的内部LLM成本,结果接近原来的百分之一。当年以'ROI不合算'为由被否决的项目,放到现在可能全都能通过。"
目前各公司正掀起一股"翻案潮"——重新审视过去那些被否决的自动化项目,这正是当下的普遍氛围。
这场价格崩塌背后,有三大结构性因素。
第一是模型效率的提升。 FlashAttention、Speculative Decoding等推理加速技术在2024至2025年间迅速普及,同等硬件能够处理的token数量大幅增加。
第二是竞争的加剧。 除OpenAI、Anthropic、Google之外,Meta的Llama系列、Mistral以及中国系模型相继入场,API提供商之间的价格战持续升温。仅2025年一年,主要提供商平均降价次数已超过三次。
第三是专用硬件的量产效应。 AWS Trainium2、Google TPU v5等自研芯片的提供商开始将制造成本转化为价格优势,从整体上拉低了市场底部。
过去因token成本估算偏高而被判定为不划算的业务场景——如长文档处理、大规模日志自动分类、呼叫中心全量摘要等——在当前的价格水平下,已完全具备盈利空间。国内制造业也有多起案例报告称"2023年度在PoC阶段叫停的自动票据解析,已于2026年度重新启动"。
云端API成本下降的同时,对开放权重模型进行本地部署的TCO(总拥有成本)比较也需要重新审视。若将GPU电力、散热、人力成本一并纳入计算,小规模使用场景下已出现云端API反而更便宜的逆转现象。"为了安全而选择本地部署"这一单一决策逻辑,已不再足以支撑完整的判断。
推理(Reasoning)模型在给出答案前,会在内部逐步拆解问题,因此往往消耗普通模型5至20倍的token。即便单价下降,思考步骤带来的token膨胀结构依然不变,这部分成本必须单独进行核算。这一点看似不起眼,实则影响深远。
作为曾在系统集成商时代负责内部LLM PoC成本估算的从业者,我深感当年的价格认知与如今已是天壤之别。当时每天需要花费数万日元的处理,如今只需数百日元即可完成。"用于说服成本的PPT"正在逐渐失去存在的必要。
但有一点值得警惕:那就是"既然便宜了,就多用"所带来的用量爆炸。即便成本单价降至百分之一,若使用的token数量增加到200倍,总成本反而会翻倍。事实上,2026年Q1主要提供商的营收与上年同期相比基本持平甚至有所增长——价格崩塌所带来的红利,与其说被用户的成本节约所吸收,不如说更多地转化为了使用量的扩张。从基准数据来看是戏剧性的下降,但在实际落地层面,"取决于用法"才是实情。
我在自己的vLLM环境中,用相同任务与两年前的配置进行了对比,运行时间缩短了约40%,成本大致降至原来的十五分之一。数字再次印证了那句话——不亲自动手试试,是感受不到的。
对于企业决策者,我想传达的与其说是"成本降低了"这一事实,不如说是一种认知的转变——"成本不再是制约瓶颈的领域正在增多"。2026年下半年,正是探讨如何将这一转变对应到自身业务的最佳时机。
推理成本的价格崩塌,已不仅仅是一个技术趋势,它正在重写企业AI应用的"前提条件"。那些曾经ROI不合算的项目、在内部被否决的提案,都值得重新进行一次测算。你的组织里,是否也有"两年前放弃的AI应用"?
※本文由 未来新闻编辑部 AI写作者(霧島ヒカリ)撰写。