NVIDIA "GB300 Blackwell Ultra" 양산 출하 시작——추론 처리량 2.5배로 LLM 비용 구조가 바뀐다
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
NVIDIA는 2026년 8월 14일, 차세대 AI 가속기 "GB300 Blackwell Ultra"의 양산 출하 시작을 공식 발표했다. 전 세대 "H100" 대비 AI 추론 처리량이 최대 2.5배, HBM4 메모리 용량 288GB를 탑재하며, AWS·Azure·GCP로의 납품이 당일부터 시작됐다. LLM 호스팅의 단가 비용 구조가 향후 3~6개월 안에 재편될 것으로 전망된다.
NVIDIA가 8월 14일, 공식 블로그에서 "GB300 Blackwell Ultra GPU"의 양산 출하 시작을 발표했다. 주요 사양은 다음과 같다.
AWS·Azure·Google Cloud 3사는 당일 프레스 릴리스를 통해 "GB300 탑재 인스턴스"를 2026년 Q4에 제공할 예정이라고 밝혔다. Meta·Microsoft·xAI도 데이터센터 우선 조달 계약을 체결한 것으로 알려졌다.
X(구 Twitter)에서는 발표 직후부터 반응이 이어졌다.
"GB300 출하 시작, H100 기준의 비용 추산을 오늘 밤 안에 전부 다시 계산한다. 같은 추론량으로 GPU 대수가 40% 줄어드는 계산. API 프라이싱 재검토 필수"
——대형 AI 스타트업, 인프라 담당 엔지니어(팔로워 약 2.3만 명)
Blackwell 아키텍처는 2024년 3월 GTC 2024에서 처음 공개됐다. 당초 2025년 상반기를 양산 목표로 했으나, HBM4의 수율 문제와 첨단 CoWoS 패키징의 복잡화로 인해 약 4개월의 지연이 발생했다. 2026년 2월에 젠슨 황 CEO가 "GB300은 2026년 Q3 출하"라고 수정 발표한 바 있으며, 이번 출하는 그 약속대로 이루어진 것이다.
AI 추론 시장은 지난 18개월간 급격히 확대됐으며, OpenAI·Anthropic·Google DeepMind 모두 "추론 비용 절감"을 경쟁 축으로 삼고 있다. 모델 측의 효율화(MoE화, 양자화, 증류)가 진행되는 한편, 칩 성능의 전반적인 향상은 시장 전체의 비용 바닥을 구조적으로 끌어내린다. 하드웨어와 소프트웨어 두 가지 바퀴가 동시에 돌아가기 시작한 국면이다.
현재 주요 LLM API는 H100 클러스터를 전제로 가격이 책정되어 있다. GB300으로의 전환에 따라, 프로바이더는 동일한 출력량에 필요한 GPU 대수를 약 40% 줄일 수 있게 된다. Anthropic·OpenAI·Google 3사가 2026년 Q4에 가격 개정을 내놓을지 여부가 다음 관찰 포인트가 된다.
대형 클라우드가 GB300으로 이전하면, 방출되는 중고 H100이 중소 AI 사업자에게 흘러든다. 반면 중고 GPU 가격의 급락은 H100을 담보로 한 자금 조달 스킴을 활용하고 있는 AI 스타트업의 밸런스시트에 직격탄이 될 리스크가 있다. 2025년에 급증한 GPU 담보 대출의 평가가 재검토를 강요받을 가능성이 있다.
일본·유럽에서 AI 데이터센터의 전력 소비가 정책 과제로 부상하고 있다. 와트당 성능 향상은 기술적 해법으로 인용되기 쉽지만, 가격이 내려가면 사용량이 늘어나는 "리바운드 효과"에 주의가 필요하다. IEA 예측에 따르면 2026년 AI 데이터센터 전력 소비는 2024년 대비 2.1배로 증가할 것으로 보이며, 효율화가 소비 억제로 직결되는지는 별개의 문제다.
사쿠라 인터넷은 2025년 NVIDIA와 직접 조달 계약을 체결했다. GB300 세대에서 우선 확보가 가능한지 여부가 국산 AI 클라우드의 경쟁력을 좌우한다. 후지쯔도 "Fugaku-LLM"용으로 차세대 GPU 조달을 추진하고 있는 것으로 알려져, 일본 시장에서의 반도체 접근 경쟁이 본격화하는 국면에 접어들었다.
GB300의 출하 시작은 "모델의 스마트함 경쟁"과는 다른 차원의 움직임이다. 인프라 비용이 내려가면, API를 통해 비즈니스를 구성하는 기업의 유닛 이코노믹스가 직접 개선된다. 특히 토큰 소비량이 많은 에이전트형 애플리케이션을 개발·운영하고 있는 사업자에게는, 비용 추산을 근거부터 다시 계산할 계기가 된다.
한편 NVIDIA의 독점적 지위는 변하지 않는다. AMD "MI400"이나 Intel이 양산화를 서두르고 있지만, CUDA 에코시스템의 장벽은 여전히 높다. 조달처의 다양화를 원하는 기업에게는 의존 리스크가 계속되는 구조다.
일본 기업에게 있어 현실적인 질문은 "H100으로 충분한가, GB300을 기다릴 것인가"이다. 저전력·고성능의 양립은, 전력 제약이 엄격한 국내 데이터센터 사정에서 특히 유효한 논점이 된다. 투자 판단의 재검토를 지금부터 준비해야 할 국면에 접어들었다.
GB300의 출하 시작은 AI 인프라 경쟁의 새로운 라운드의 시작이다. 추론 비용의 구조적 하락은 API 이코노미 전체의 프라이싱을 흔들고, 2026년 Q4에 걸쳐 클라우드 각사의 가격 개정이 잇따를 것으로 보인다. LLM을 활용한 서비스를 설계·운영하고 있는 사업자는, 비용 추산의 업데이트를 지금부터 준비해야 할 국면에 접어들었다.
다음으로 주목해야 할 것은, GB300 탑재 인스턴스의 실측 벤치마크가 나오는 9월 이후다. 모델별 성능 차이가 수치로 가시화되면, "어떤 모델을 어떤 칩에서 돌릴 것인가"라는 아키텍처 선정의 논점도 구체화된다.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.