Meta×AWS震撼业界|Graviton5数千万核心采用全解析
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
『提到AI就想到GPU,但不知不觉中CPU也开始登上主角之位』——2026年4月24日,Meta与Amazon Web Services(AWS)发布的合作公告,正是这一转折点的标志性事件。Meta采用的AWS Graviton5规模达数千万核心,合同为多年期、总金额超数十亿美元。
『为什么不用GPU而用CPU?』『Arm到底强在哪里?』『这和日本企业有什么关系?』以下将用中学生也能看懂的语言,逐一解答这些疑问。
首先用5分钟梳理发布内容。
2026年4月24日,Amazon与Meta通过官方博客及新闻稿同步宣布合作。
核心内容有两点:『Meta将以数千万核心规模引入AWS Graviton5处理器』以及『合同为多年期、数十亿美元(multibillion-dollar)规模』。
『Graviton5=AWS自主设计的基于Arm架构的服务器CPU』,是目前市场上最强级别的云端Arm芯片。
『大型科技公司以大批量、长期合同方式采购他家CPU』,这一案例在业界迅速引发广泛关注。
可以说,这是GPU争夺战背后悄然进行的CPU阵地之争,首次浮出水面的时刻。
Meta基础设施负责人Santosh Janardhan表示,『算力来源的多元化,如今已是战略必选项(strategic imperative)』。
背后的危机感在于:『如果只依赖一家公司的芯片,价格谈判和供应风险就全部受制于人』。
这与『不单靠高速公路,同时备好新干线、飞机、轮船』的物流战略思路如出一辙。
这番表态清晰传递出企业决策的逻辑:以Arm系CPU分散吸收对Nvidia一强时代的不安。
AWS副总裁兼杰出工程师Nafea Bshara表示,『我们提供构建能够理解、预测并高效扩展的AI所需的基础设施』。
这也是AWS自身明确表达出的认识:『训练阶段GPU是主角,但运行(推理)阶段则是另一回事』。
好比『研发新菜谱的主厨(GPU)与每天大量出餐的前厅员工(CPU)所需能力截然不同』。
在云端AI运营成本中推理据称占八成的时代,这被视为一种合乎逻辑的选择。
从三个维度来看GPU一强时代为何终结。
大规模AI模型的训练阶段,Nvidia系GPU依然拥有压倒性优势。然而,在使用已训练好的AI的阶段——即推理阶段,CPU担当主角的场景正急剧增加。
这就像『学厨艺靠厨房里的苦练(GPU),但每天实际为顾客上菜靠的是厨房运营(CPU)』的分工。
在数万亿参数模型训练这一光鲜场景的背后,每天重复数亿次的推理工作虽然低调,但其总量实际上已膨胀至训练的数倍,这才是当下的现实。
AI智能体(能自主完成任务的AI)的特点,在于扮演按顺序调用多个工具或API的调度中枢角色。
它需要连续做出『查询今日天气、预订餐厅、计算出行路线』这样的判断与执行。
就如同『摆盘单道菜靠主厨的功夫(GPU),但统筹整个套餐流程靠的是前厅经理(CPU)』。
GPU擅长矩阵运算,而复杂的分支处理、状态管理与任务调度才是CPU的强项——这一分工正成为智能体时代的新常识。
过去,AI基础设施投资是一场竞争『峰值性能(FLOPS)』的游戏。然而在推理持续运行的智能体时代,全年无休运营时的总拥有成本(TCO)与能效才是决定性因素。
这与物流行业『比起最快的跑车,更青睐油耗低、易维护的卡车』的逻辑完全一致。
与其用昂贵的GPU跑推理,不如将任务分配给价廉省电的CPU——这一账算在Meta这样规模的企业里清晰成立,正是此次合同签订的结果。
以下将通俗地拆解这款目前最强级别云端Arm CPU的技术细节。
Graviton5搭载了192个Arm Neoverse V3核心。这相当于192颗高性能P核(性能核心)——考虑到普通家用电脑CPU通常只有8至16个核心,这是其24倍以上的规模。
如果家里的厨房是一人用的,Graviton5就是同时有192位厨师并行工作的酒店厨房。
单台服务器即可并行处理数百个AI智能体会话,能够大幅提升推理的并发连接数。
Graviton5采用最前沿的3纳米(3nm)制程制造,缓存容量是上一代的5倍,核间通信延迟最高削减33%。
想象一下:192位厨师每人都携带着超大记事本(缓存),给隔壁厨师传话的速度还快了三成。由此,在多个推理任务同时并行运行的多租户环境中,性能衰减更小。
吞吐量与响应时间均可兼顾,被认为是服务器级CPU理想形态的又一次进化。
性能较上一代Graviton4最高提升25%,内存采用超高速DDR5-8800,I/O支持PCIe Gen6。
这一设计旨在『大幅拓宽AI智能体所需数据读写的带宽』。
感觉就像『从山路(DDR4)换上高速公路(DDR5-8800)』,数据等待时间大幅缩短。
CPU性能再强,若数据供给跟不上就毫无意义。这一代通过最前沿的内存与I/O,一举消除了这一瓶颈。
传统Arm系Graviton相比Intel/AMD的x86系,成本约低20%、功耗最高降低60%,已有实际成绩。Graviton5是这一系列的最新进化,在AI推理这类持续运行的工作负载中,TCO优势极为显著。
『完成同样的工作,用一半的电费、更低价的芯片就能搞定』——这就是它的特质。
在数据中心供电日趋紧张的当下,CPU的选型正在左右整个数据中心运营成本的时代已然到来。
以下整理云端三大巨头的自研Arm CPU战略。
Google自研Arm CPU『Axion』基于Neoverse V2/V3,实现了媲美AMD EPYC Genoa的线程性能。基准测试中,某些项目的结果甚至比Graviton4快出最高47%。
两者关系犹如『速度型中跑选手(Axion)vs 大型客车司机(Graviton)』。
轻量推理任务看重速度,大规模智能体并发看重核心数量——两者各有用武之地。在这一激烈竞争的赛道上,目前Axion是性能领先者,Graviton是规模领先者。
Microsoft自研Arm CPU『Cobalt 200』同样基于Neoverse V3,性能较Cobalt 100提升50%。已宣布自2026年初起在Azure部分VM系列中开始提供。
其战略重点在于『在数据库类单线程处理上表现出色,全力强调TCO(总拥有成本)优化』。
AWS的规模、Google的速度、Microsoft的TCO——三家各有侧重的战略,正推动Arm CPU市场走向多极化。
在Nvidia GPU垄断话题的背后,CPU领域同样正在进行一场激烈的技术竞争。
x86阵营的Intel和AMD正在投资专用AI加速器(Gaudi、Instinct)和高效能核心(E-core),以守住市场份额。
这就像『街边老字号拉面店面对新兴连锁的攻势,以菜单改革进行反击』的格局。
在兼容性与存量资产利用方面x86占优,在新兴工作负载与大规模扩展方面Arm占优——两者的分野正在形成。
未来五年的格局,将在很大程度上取决于AI智能体工作负载向哪一方优化,这是一个关键的转型期。
回答『这是海外的事,和日本有什么关系?』这一疑问。
NTT Docomo与NEC联合实验,采用AWS Graviton2的5G核心网基础设施,与x86环境相比平均功耗削减72%。2026年3月,在AWS上正式开启了国内首例5G核心网商用运营。
这是一个极具象征意义的案例,意味着『国内重要基础设施已向Arm架构迁移』。
借助Graviton5更进一步的高能效,对于直接应对5G/6G时代电力紧缺问题大有裨益——通信行业对此评价日益提升。
在国产LLM与AI智能体开发的一线,推理成本优化同样是最大课题。
『东京大学松尾研究室、CyberAgent、PFN、ELYZA等开发团队,正在推进基于Graviton系的推理基准测试』,这在业界已是公开的秘密。
『只有日本才能产出的模型』与『能够低成本充分运用的基础设施』的结合,将是竞争力的关键。
面对争抢Nvidia GPU的红海,国产AI向Arm CPU推理这片蓝海转型的地壳运动,将因本次公告而加速——这是业界的普遍预判。
不仅是大型企业,日本中型企业向AWS东京区域提供的Graviton系实例迁移也在持续推进。
『成本降低20%、能耗降低60%』这一与x86相比的规格差距,将直接影响财务报表。
『从内部主力Web服务器开始逐步Arm化』是现实可行的路线图。
利用Graviton5世代实施AI智能体功能,正逐渐被视为日本企业的差异化要素——这一判断开始在业界蔓延。
负责中型电商网站SRE的永田,每个月都为AWS账单头痛不已。
『用GPU实例运行商品推荐用的小型LLM,月费超过300万日元』——这就是他的现状。借着此次合作,他开始研究将推理服务器分阶段迁移至Graviton5系实例。
这就像『从每天吃高级寿司降级到家常菜,满意度却几乎没有差别』的发现。
区分哪些地方必须用GPU、哪些地方CPU就足够的设计能力,正作为SRE岗位的新竞争领域浮出水面。
业务自动化初创公司CTO黒木正在开发内部任务自动化智能体。
典型的智能体设计:『连续调用多个SaaS的API,解读结果后决定下一步动作』。这类工作负载几乎都是CPU的活儿——推理核心部分使用GPU,调度中枢逻辑用CPU就绰绰有余。
测算结果显示,『使用Graviton5,同等预算下可处理2倍的并发连接』。
以比竞争对手更低成本、更高速度提供智能体服务——Arm CPU的选型,正成为初创公司增长战略的核心差异化筹码。
大型制造业信息系统部长福原,正在搭建面向内部的AI助手。
这是一种『处理日常咨询、持续运行推理』的内部SaaS类型。基于此次合作,将推理基础设施统一至Graviton5的测算结果显示,3年TCO可降低45%。
据说这直接带来了战略调整:『用节省下来的资金增配内部AI教育专属团队』。
在电费和数据中心散热成本成为经营课题的时代,CPU选型正逐渐成为信息系统部长绩效考核的新维度。
A. 不,不是取代,而是角色分工。大规模模型训练方面,Nvidia系GPU具有压倒性优势;推理与智能体调度中枢方面,CPU更为高效。
就像『新车组装靠机器人,交车给客户靠人工』的分工。
Graviton5不是GPU的替代品,而是承担GPU不擅长工作的合作伙伴。Meta自身也明确表示,将同时使用Nvidia GPU、自研ASIC和Graviton5的混合战略。
A. 大多数主流语言和框架已支持Arm。Python、Node.js、Go、Java、Rust均有官方支持,Docker和Kubernetes也可正常运行。
感觉就像『护照种类不同,但能去的国家一样』。不过,仅支持x86二进制的遗留应用,或依赖特定驱动的软件需要另行验证。
迁移前在CI/CD中确认交叉编译,正式上线前在预发环境做基准测试——遵循这一标准流程,大多数情况下都能顺利完成迁移。
A. 预计2026年内以主要EC2实例系列(M8g、C8g、R8g等)的形式正式公开提供。东京区域的上线时间将分阶段推进,美国主要区域将率先开放。
感觉就像『新款iPhone比日本晚一点登陆』。
建议日本企业先在美国区域进行开发与验证,等东京区域开放后再迁移——这是较为现实的推进方式。
A. 三步走最为现实。第一步,CI/CD支持Arm(完善交叉编译与测试);第二步,使用AWS Compute Optimizer可视化现有工作负载对Graviton的适配度;第三步,将AI推理层区分为应保留GPU的部分与应迁移至Graviton5的部分,进行架构设计。
就像『整理好行李再叫搬家公司』的步骤。
不要追求一次性全面迁移,从新开发项目开始优先Graviton标准化,才是稳健的路线图。
A. 短期内,作为打破GPU垄断的象征,确实存在被警惕性看待的动向。但Nvidia自身依然稳居训练用GPU的顶端,同时也在以推理专用芯片(GB200/GB300、Rubin系列)发起新的竞争,这一点不会改变。
就像『可乐一强的市场出现新饮料,但可乐不会就此倒下』的局面。
业界主流观点认为:在从GPU垄断过渡至多芯片时代的过程中,Nvidia的市场份额会略有摊薄,但由于整体市场持续扩大,其营收仍将保持增长。
『AI就是GPU』的固有认知,正以Meta×AWS合作为分水岭开始被改写。数千万核心的物量规模、3nm/192核心的技术底蕴、多年期数十亿美元的合同体量——无一不是CPU在AI智能体时代跃升为主角之一的明证。
去Nvidia的多元化布局、去x86的Arm化转型、从峰值FLOPS到持续TCO的经济性转变——这三股潮流,在一份合同中高度凝聚。对日本企业而言,这也是将NTT Docomo率先开创的Graviton省电革命扩展至AI智能体时代的绝佳机遇。
『AI基础设施的选型,成为直接影响财务报表的经营决策的时代』——我们正站在这个时代的入口。意识到这一点,这份公告的分量便清晰可见。
本文转载自 AI Friends。