Meta×AWS 충격|Graviton5 수천만 코어 채택의 전모
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
'AI라고 하면 GPU라고 생각했는데, 어느새 CPU도 주역의 자리에 올라서게 되었다'——2026년 4월 24일, Meta와 Amazon Web Services(AWS)가 발표한 제휴는 바로 그런 전환점을 상징하는 뉴스입니다. Meta가 채택하는 AWS Graviton5는 수천만 코어 규모, 계약은 다년간으로 총액 수십억 달러 이상.
'왜 GPU가 아닌 CPU인가?', 'Arm은 어디가 대단한가?', '일본 기업과 무슨 관련이 있는가?'라는 의문을 중학생도 이해할 수 있는 말로 풀어갑니다.
먼저 발표 내용을 5분으로 정리합니다.
2026년 4월 24일, Amazon과 Meta는 공식 블로그·프레스 릴리스를 통해 제휴를 일제히 공표했습니다.
'Meta가 AWS Graviton5 프로세서를 수천만 코어 규모로 도입한다', '계약은 다년간·수십억 달러(multibillion-dollar) 규모'라는 두 가지가 핵심입니다.
'Graviton5=AWS가 자체 설계한 Arm 기반 서버용 CPU'로, 현재 시장 최강급의 클라우드용 Arm 칩입니다.
'대형 IT 기업이 타사의 CPU를 대량으로 장기 계약으로 구매한다'는 사례는 업계에서도 단번에 화제가 되었습니다.
GPU 쟁탈전의 이면에서 진행되던 CPU 영토 싸움이 전면에 나온 순간이라 할 수 있습니다.
Meta의 인프라 책임자 Santosh Janardhan 씨는, '컴퓨트 소스의 다양화는 이제 전략적 명제(strategic imperative)다'라고 언급했습니다.
'단 한 회사의 칩에 의존하면, 가격 협상도 공급 리스크도 전부 상대방 마음대로'라는 위기감이 배경에 있습니다.
'고속도로에 의존하지 않고, 신칸센·비행기·배도 전부 준비한다'는 물류 전략과 같은 발상입니다.
1강 Nvidia 시대의 불안을 Arm 계열 CPU로 분산 흡수하려는 기업 판단이, 명확히 읽히는 발언이 되었습니다.
AWS의 VP 겸 Distinguished Engineer인 Nafea Bshara 씨는, '이해하고, 예측하며, 효율적으로 스케일하는 AI를 만들기 위한 기반을 제공한다'고 말했습니다.
'학습은 GPU가 주역, 하지만 작동시키는(추론하는) 단계는 별개'라는 인식을 AWS 스스로 명확히 밝힌 모양새입니다.
'새로운 레시피를 개발하는 셰프(GPU)와, 매일 대량으로 요리를 내오는 홀 스태프(CPU)는 다른 능력이 필요하다'는 이해 방식입니다.
클라우드 AI 운영 비용의 80%는 추론이라고 알려진 시대의, 논리적인 선택으로 자리매김됩니다.
GPU 일강이 아니게 된 이유를 세 가지 각도에서 살펴봅니다.
대규모 AI 모델의 학습(트레이닝)에서는 지금도 Nvidia 계열 GPU가 압도적인 강점을 지닙니다. 그러나 완성된 AI를 사용하는 단계=추론에서는, CPU가 주역이 되는 장면이 급증하고 있습니다.
'요리를 배우는 것은 주방에서의 수련(GPU), 하지만 실제로 매일 손님에게 내오는 것은 주방 운영(CPU)'이라는 분업입니다.
수조 개 파라미터의 모델 학습이라는 화려한 세계의 이면에서, 수억 번이나 반복되는 추론이라는 평범한 작업의 총량이 사실 학습의 수배에 달하는 것이 현실입니다.
AI 에이전트(자율적으로 태스크를 수행하는 AI)의 특징은, 여러 도구나 API를 순서대로 호출하는 컨트롤 타워 역할입니다.
'오늘의 날씨를 알아보고, 레스토랑을 예약하고, 이동 경로를 계산한다'는 식의 연속적인 판단과 실행이 필요합니다.
'요리 한 가지 담음은 셰프의 솜씨(GPU)라도, 코스 전체의 진행을 총괄하는 것은 홀 책임자(CPU)'라는 구도입니다.
GPU는 행렬 계산에 능하지만, 복잡한 분기·상태 관리·스케줄링은 CPU의 본령이라는 분업이, 에이전트 시대의 새로운 상식이 되어가고 있습니다.
지금까지 AI 인프라 투자는 '피크 성능(FLOPS)'을 경쟁하는 세계였습니다. 그러나 추론이 상시 가동되는 에이전트 시대에서는, 24시간 365일 운용했을 때의 총 소유 비용(TCO)과 전력 효율이 결정적입니다.
'최고 속도의 스포츠카보다, 연비와 유지보수성이 뛰어난 트럭'이 선택되는 물류 업계의 논리와 같습니다.
고가의 GPU를 추론에 다 쓰는 것보다, 저렴하고 저전력인 CPU에 분배하는 편이 경제적이라는 계산이, Meta 규모의 기업에서 명확히 성립된 결과가 이번 계약입니다.
현재 시장 최강급의 클라우드 Arm CPU의 내용을 알기 쉽게 분석합니다.
Graviton5는 Arm Neoverse V3 코어를 192개 탑재하고 있습니다. 이는 고성능 P코어(퍼포먼스 코어) 192개 분——일반적인 가정용 PC의 CPU가 8~16코어인 점을 감안하면, 24배 이상의 규모입니다.
'집 주방이 1인용이라면, Graviton5는 192명 분의 요리사가 동시에 움직이는 호텔 주방'의 크기감입니다.
1대로 AI 에이전트 수백 세션을 병렬로 처리할 수 있는 물량으로, 추론의 동시 접속 수를 한 번에 끌어올리는 것이 특징입니다.
Graviton5는 3나노미터(3nm)의 최첨단 공정으로 제조되어, 캐시 용량은 전세대의 5배, 코어 간 통신 지연은 최대 33% 감소했습니다.
'192명의 요리사가 각자 거대한 메모장(캐시)을 갖고, 옆 요리사에게 전달하는 속도가 30% 빨라진' 상태입니다. 이로써 여러 추론 잡이 동시 병행으로 움직이는 멀티테넌트 환경에서도 성능 저하가 적은 것이 장점입니다.
처리량과 응답 시간 모두 균형 있게 나온다는, 서버용 CPU의 이상형에 가까워졌다고 평가됩니다.
성능은 전세대 Graviton4 대비 최대 25% 향상, 메모리는 초고속의 DDR5-8800, I/O는 PCIe Gen6에 대응합니다.
'AI 에이전트가 필요로 하는 데이터의 읽기·쓰기 대역폭이, 비교할 수 없을 만큼 넓어지는' 설계입니다.
'산길(DDR4)에서 고속도로(DDR5-8800)로 갈아타는' 감각으로, 데이터 대기 시간이 단축됩니다.
CPU 성능이 올라도, 데이터 공급이 따라오지 못하면 의미 없는 병목을, 최첨단 메모리·I/O로 단번에 해소한 세대로 자리매김됩니다.
기존의 Arm 계열 Graviton은 Intel/AMD의 x86 계열 대비 비용 약 20% 절감, 전력 최대 60% 절감이라는 실적을 갖고 있습니다. Graviton5는 그 계보의 최신 진화로, AI 추론처럼 상시 가동 워크로드에서는 TCO 면에서 압도적으로 유리합니다.
'같은 일을, 전기 요금 절반으로, 저렴한 칩으로 처리할 수 있다'는 특성입니다.
데이터 센터의 전력 공급이 빠듯해진 현재, CPU 선정으로 데이터 센터 전체의 운영비가 달라지는 시대가 도래하고 있습니다.
클라우드 3대 기업의 자체 Arm CPU 전략을 정리합니다.
Google의 자체 Arm CPU 'Axion'은, Neoverse V2/V3 기반으로, AMD EPYC Genoa급의 스레드 성능을 실현합니다. 벤치마크에서는, Graviton4 대비 항목에 따라 최대 47% 빠르다는 결과도 있습니다.
'빠른 중거리 선수(Axion) vs 대형 버스 운전사(Graviton)'와 같은 관계입니다.
가벼운 추론 잡에서는 속도가 효과적이고, 에이전트 대량 병렬에서는 코어 수가 효과적이라는 분업이 이루어집니다. 용도에 따라 승자가 바뀌는 격전 지대에서, 현재로서는 Axion이 성능 리더, Graviton이 규모 리더라는 포지셔닝입니다.
Microsoft의 자체 Arm CPU 'Cobalt 200'도 Neoverse V3 기반으로, Cobalt 100 대비 50% 성능 향상. 2026년 초부터 Azure의 일부 VM 패밀리에서 제공 개시된다고 발표되었습니다.
'데이터베이스 계열의 단일 스레드 처리에 강하고, TCO(총 소유 비용) 최적화를 전면에 내세우는' 전략입니다.
AWS의 규모, Google의 속도, Microsoft의 TCO라는 각양각색의 전략이, Arm CPU 시장을 다극화하고 있습니다.
Nvidia GPU 독점 이야기의 그늘에서, CPU 측에서도 치열한 기술 경쟁이 진행 중입니다.
x86 진영의 Intel과 AMD는, 점유율 방어를 위해 전용 AI 액셀러레이터(Gaudi, Instinct)와 고효율 코어(E-core)에 투자하고 있습니다.
'동네 오래된 라면 가게가, 신흥 체인의 공세에 메뉴 혁신으로 대항하는' 구도입니다.
호환성·기존 자산의 활용 용이성에서는 x86이 유리하고, 신규 워크로드·대규모 스케일에서는 Arm이 유리하다는 구분이 있습니다.
향후 5년간의 세력 지도는, AI 에이전트 워크로드가 어느 쪽에 최적화되느냐에 따라 결정되는 중요한 전환기에 들어서고 있습니다.
'해외 이야기인데, 일본과 무슨 관련이 있는가?'라는 의문에 답합니다.
NTT도코모는 NEC와의 공동 실험에서, AWS Graviton2를 채택한 5G 코어 네트워크 기반의 소비전력을, x86 환경 대비 평균 72% 절감하는 데 성공했습니다. 2026년 3월에는 AWS 상에서의 5G 코어 상용 운용을 국내에서 처음으로 개시했습니다.
'국내 중요 인프라가 Arm 기반으로 이전했다'는 의미에서, 매우 상징적인 사례입니다.
Graviton5의 더 높은 효율을 활용한다면, 5G/6G 시대의 전력 부족에 직접적으로 효과가 있다는 순풍으로서, 통신 업계의 평가가 높아지고 있습니다.
국산 LLM·AI 에이전트 개발 현장에서도, 추론 비용 최적화는 최대의 과제입니다.
'도쿄대 마츠오 연구실, CyberAgent, PFN, ELYZA 등의 개발팀이, Graviton 계열에서의 추론 벤치마크를 진행하고 있다'는 상황이 업계에서 알려져 있습니다.
'일본에서만 낼 수 있는 모델'과 '저렴하게 쓸 수 있는 인프라'의 조합이, 경쟁력의 결정적 요소입니다.
Nvidia GPU를 서로 차지하려는 레드 오션에 대해, Arm CPU 추론이라는 블루 오션으로 움직이는 국산 AI의 지각 변동이, 이번 발표로 가속화될 것이라는 전망입니다.
대기업 이외의 일본 기업에서도, AWS 도쿄 리전에서 제공되는 Graviton 계열 인스턴스로의 이전은 진행 중입니다.
'비용 20% 절감, 전력 60% 절감'이라는 x86 대비 스펙 차이는, 결산 영향에 직결됩니다.
'사내의 주력 웹 서버부터 순서대로 Arm화해 나간다'는 것이 현실적인 로드맵입니다.
Graviton5 세대를 사용한 AI 에이전트 기능 구현이 일본 기업의 차별화 요소가 될 것이라는 전망이 퍼지기 시작하고 있습니다.
중견 EC 사이트의 SRE 담당 나가타 씨는, 매달 AWS 청구서에 골머리를 앓고 있었습니다.
'상품 추천용 소형 LLM을 GPU 인스턴스로 운용했더니, 월 300만 엔 초과'라는 상황이었습니다. 이번 제휴를 계기로, 추론 서버를 Graviton5 계열 인스턴스로 단계적으로 이전하는 검토를 시작했습니다.
'고급 스시를 매일 먹던 상태에서, 가정식으로 수준을 낮춰도 만족도는 거의 같다'는 발견입니다.
GPU를 써야 할 곳과, CPU로 충분한 곳을 구분하는 설계 능력이, SRE 직종의 새로운 경쟁 영역으로 떠오르고 있습니다.
업무 자동화 스타트업의 CTO 구로키 씨는, 사내 태스크 자동화 에이전트를 개발 중입니다.
'여러 SaaS의 API를 연속 호출하고, 결과를 해석해 다음 동작을 결정한다'는 전형적인 에이전트 설계입니다. 이 워크로드는 대부분이 CPU 작업——추론 코어 부분은 GPU를 쓰지만, 컨트롤 타워 로직은 CPU로 충분합니다.
'Graviton5라면, 같은 예산으로 2배의 동시 접속을 처리할 수 있다'는 시산이 나왔습니다.
경쟁사보다 저렴하고 빠른 에이전트를 제공하는 차별화 소재로서, Arm CPU 선정이 스타트업의 성장 전략의 중심이 되고 있습니다.
대형 제조업의 정보시스템 과장 후쿠하라 씨는, 사내용 AI 어시스턴트를 구축 중입니다.
'일상적인 문의 대응으로 상시 추론을 돌리는' 유형의 사내 SaaS입니다. 이번 제휴를 반영해, 추론 기반을 Graviton5로 통일한 시산에서는, 3년 TCO 45% 절감이라는 결과가 나왔습니다.
'절감된 재원으로 사내 AI 교육 전담 팀을 증원할 수 있다'는 전략 변경으로 이어졌다고 합니다.
전기 요금과 데이터 센터 냉각 비용이 경영 과제가 되는 시대에, CPU 선정이 정보시스템 부장의 평가 지표가 되는 움직임이 확산되고 있습니다.
A. 아니요, 대체가 아니라 역할 분담입니다. 대규모 모델의 학습(트레이닝)은 Nvidia 계열 GPU가 압도적으로 유리하고, 추론이나 에이전트의 컨트롤 타워는 CPU가 효율적입니다.
'신차 조립은 로봇, 고객에게 인도하는 것은 사람'과 같은 분업입니다.
GPU의 대체가 아니라, GPU가 苦手한 작업을 맡는 파트너라는 포지셔닝입니다. Meta 자신도 Nvidia GPU, 자체 ASIC, Graviton5의 세 가지를 병용하는 하이브리드 전략을 명확히 밝히고 있습니다.
A. 대부분의 주요 언어·프레임워크는 Arm 대응 완료. Python, Node.js, Go, Java, Rust 등은 공식 지원, Docker·Kubernetes도 문제없이 동작합니다.
'여권의 종류가 달라도, 갈 수 있는 나라는 같다'는 감각입니다. 다만, x86 바이너리만 있는 레거시 앱이나, 특정 드라이버에 의존하는 소프트웨어는 검증이 필요합니다.
이전 전에 CI/CD에서 크로스 빌드를 확인하고, 본번 전에 스테이징에서 벤치를 측정하는 표준적인 절차를 따르면, 대부분의 경우 원활하게 이전할 수 있습니다.
A. 2026년 내에 주요 EC2 인스턴스 패밀리(M8g, C8g, R8g 등)로 일반 제공 개시 예정. 도쿄 리전으로의 전개 시기는 단계적으로, 미국 주요 리전이 선행하는 전망입니다.
'신형 iPhone이 한국에 약간 늦게 출시되는' 감각입니다.
먼저 미국 리전에서 개발·검증을 하고, 제공 개시 후에 도쿄 리전으로 이전하는 전략이, 일본 기업의 현실적인 진행 방법으로 권장됩니다.
A. 3단계가 현실적입니다. 첫 번째로 CI/CD의 Arm 대응(크로스 빌드·테스트 정비), 두 번째로 AWS Compute Optimizer에서 현행 워크로드의 Graviton 적합도를 가시화, 세 번째로 AI 추론 레이어를 GPU로 남겨야 할 부분과 Graviton5로 이전할 부분으로 나누는 설계입니다.
'짐의 내용을 정리하고 나서 이삿짐 업체를 부르는' 것과 같은 절차입니다.
급하게 전체 이전을 노리지 않고, 신규 개발부터 먼저 Graviton 표준화하는 것이 정석 로드맵입니다.
A. 단기적으로는 GPU 독점 붕괴의 상징으로 경계받는 움직임이 있습니다. 다만 Nvidia 자신도 학습용 GPU의 최강자로 계속 군림하고 있으며, 추론 전용 칩(GB200/GB300, Rubin 계열)으로도 승부를 걸고 있다는 점은 변하지 않습니다.
'콜라 1강 시장에 새로운 음료가 등장해도, 콜라가 쓰러지는 건 아니다'라는 상황입니다.
GPU 독점에서 멀티칩 시대로 이전하는 과정에서, Nvidia의 점유율은 다소 줄어들겠지만, 시장 전체가 확대되고 있기 때문에 매출은 계속 늘어난다는 견해가 업계의 주류입니다.
'AI라고 하면 GPU'였던 상식이, Meta×AWS 제휴를 계기로 다시 쓰이기 시작하고 있습니다. 수천만 코어라는 물량, 3nm/192코어의 기술, 다년간·수십억 달러라는 계약 규모——모두 CPU가 AI 에이전트 시대의 주역 중 하나로 부상한 증거입니다.
탈Nvidia를 노리는 다양화, 탈x86을 추진하는 Arm 시프트, 피크 FLOPS에서 지속 TCO로의 경제성 전환——이 세 가지 흐름이, 하나의 계약에 응축되어 있습니다. 일본 기업에게도, NTT도코모가 선두에 선 Graviton의 저전력 혁명을, AI 에이전트 시대로 확장하는 좋은 기회입니다.
'AI 인프라 선정이, 결산에 직결되는 경영 판단이 되는 시대'의 입구를, 우리는 지금 건너고 있다——그렇게 바라보면, 이 발표의 무게가 보이기 시작합니다.
이 글은 AI Friends에서 크로스포스트한 글입니다.