NVIDIA「GB300 Blackwell Ultra」量产出货开始——推理吞吐量提升2.5倍,LLM成本结构将迎来变革
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
NVIDIA于2026年8月14日正式宣布,次世代AI加速器「GB300 Blackwell Ultra」开始量产出货。与上一代「H100」相比,AI推理吞吐量最高提升2.5倍,搭载288GB HBM4内存,当日起已开始向AWS、Azure、GCP交付。预计未来3至6个月内,LLM托管的单价成本结构将被重新书写。
NVIDIA于8月14日在官方博客宣布「GB300 Blackwell Ultra GPU」量产出货正式开始。主要规格如下:
AWS、Azure、Google Cloud三家公司当日即发表新闻稿,声明将于2026年第四季度提供「搭载GB300的实例」。据悉,Meta、Microsoft、xAI亦已签署数据中心优先采购合同。
发布消息一出,X(原Twitter)上随即引发连锁反应。
「GB300开始出货,今晚要把所有基于H100的成本估算全部重新推算。按同等推理量计算,GPU数量可减少约四成。API定价必须重新审视。」
——某大型AI初创企业基础设施工程师(粉丝约2.3万)
Blackwell架构于2024年3月的GTC 2024首次公布。最初量产目标定于2025年上半年,但因HBM4良品率问题及先进CoWoS封装工艺复杂化,导致约4个月的延期。2026年2月,CEO黄仁勋公开修正时间表,表示「GB300将于2026年第三季度出货」,而此次正是如期兑现了这一承诺。
AI推理市场在过去18个月急速扩张,OpenAI、Anthropic、Google DeepMind均将「降低推理成本」列为竞争核心。在模型侧效率持续提升(MoE化、量化、蒸馏)的同时,芯片性能的整体跃升将从结构上压低整个市场的成本底线。硬件与软件两轮同时驱动的时代已经到来。
现行主要LLM API均以H100集群为前提进行定价。切换至GB300后,提供商完成相同输出量所需的GPU数量估计可削减约40%。Anthropic、OpenAI、Google三家是否会在2026年第四季度推出价格调整,将是下一个重要观察节点。
若主要云服务商全面转向GB300,被释放的二手H100将流入中小型AI企业市场。然而,二手GPU价格急跌可能直接冲击那些以H100作为融资抵押物的AI初创企业资产负债表。2025年以来急剧增加的GPU抵押融资方案,其估值面临被重新审视的可能。
日本与欧洲已将AI数据中心的电力消耗列为政策议题。每瓦性能的提升固然容易被引用为技术层面的解决方案,但成本降低带来使用量增加的「反弹效应」同样不容忽视。国际能源署(IEA)预测,2026年AI数据中心的电力消耗将较2024年增加2.1倍,效率提升能否直接转化为能耗抑制,是另一个问题。
樱花互联网(さくらインターネット)已于2025年与NVIDIA签署直接采购合同。能否在GB300世代率先锁定优先供货,将直接影响国产AI云的竞争力。富士通据悉也在为「Fugaku-LLM」推进次世代GPU采购,日本市场的半导体获取竞争正式进入激烈阶段。
GB300的量产出货,是一个与「模型智能竞争」截然不同维度的动向。基础设施成本下降,将直接改善通过API构建业务的企业的单位经济效益。尤其是正在开发和运营token消耗量较大的智能体型应用的企业,此刻正是从根本上重新核算成本的契机。
另一方面,NVIDIA的垄断地位并未改变。AMD「MI400」与Intel正在加速量产,但CUDA生态系统的壁垒依然高耸。对于寻求多元化采购来源的企业而言,依赖风险的结构性问题仍将持续。
对于日本企业而言,真正的问题是「H100已经足够,还是等待GB300」。在电力限制严苛的国内数据中心环境下,兼顾节能与高性能这一论点尤为有力。现在正是重新审视投资决策、提前做好准备的阶段。
GB300的量产出货,标志着AI基础设施竞争新一轮的开始。推理成本的结构性下降将撼动整个API经济体系的定价,预计在2026年第四季度前后,各大云服务商将相继调整价格。正在设计和运营基于LLM服务的企业,现在正是提前着手更新成本估算的时机。
接下来的焦点,将是9月以后GB300搭载实例的实测基准数据陆续公开。当各模型的性能差异以数字形式可视化之后,「用哪个模型跑在哪种芯片上」这一架构选型议题也将变得更加具体。
※本文由 ミライ・ニュース 编辑部 AI 撰稿人(AI新闻)撰写。