Meta「Llama 4 Ultra」공식 공개——MMLU 93.2%로 오픈소스 추론 모델의 경쟁 구도가 바뀐다
機械翻訳 / Machine-translated
Meta가 2026년 8월 22일, 오픈소스 대규모 언어 모델 「Llama 4 Ultra」를 Hugging Face 및 자사 개발자 포털에서 공식 공개했다. 총 파라미터 4,050억(MoE 구조·실효 활성화 파라미터 약 860억), MMLU 93.2%. 「클로즈드 API에 의존하지 않고, GPT-4o 수준의 추론을 자사 인프라에서 구동한다」는 선택지가, 인프라 비용을 감당할 수 있는 조직에게는 현실적인 해법이 되어가고 있다.
Meta는 일본 시각 2026년 8월 22일 23시(PT 당일 오전), 「Llama 4 Ultra」의 가중치 파일과 모델 카드를 Hugging Face에서 일반 공개했다. 라이선스는 Llama 4 Community License(월간 활성 사용자 7억 명 초과 서비스를 제외하고 상업적 이용 가능).
주요 사양:
「Llama 4 Ultra를 8×H200에서 BF16 풀 정밀도로 구동했다. 속도는 GPT-4o의 API 응답보다 약간 느리지만, 품질은 동등하거나 그 이상이다. 사내 데이터에 대한 추가 학습이 가능하다는 점이 가장 큰 차이점이다」(ML계 스타트업 CTO, 팔로워 1.2만 명)
Llama 시리즈는 2023년 2월 Llama 1 공개 이후, 각 버전마다 오픈소스 LLM의 성능 상한을 갱신해왔다. 2025년 4월 공개된 Llama 4 세대(Scout / Maverick)에서 처음으로 클로즈드 모델과의 격차가 줄어들었으며, 이번 Ultra는 그 최대 구성으로 자리매김된다.
Meta가 이 규모를 오픈소스로 계속 공개하는 배경에는, 클라우드 AI 시장에서 AWS·Google Cloud와의 차별화, 그리고 광고·커머스 기반으로의 내재화라는 전략적 동기가 있다. 「AI 민주화」는 슬로건이 아니라, 에코시스템 지배의 레이어를 아래로 이동시키는 수단으로 해석된다.
오픈소스 경쟁 모델로는 DeepSeek V4(6,710억 MoE)가 2026년 초에 성능 면에서 앞서간 경위가 있지만, Ultra는 상업용 라이선스의 명확성과 추론 효율의 균형으로 차별화를 꾀하고 있다.
MMLU 93.2%는 지식·추론의 폭넓음을, HumanEval 89.7%는 코딩 특화의 깊이를 나타낸다. 어느 한쪽만 높은 전문 모델은 존재했지만, 양쪽에서 90% 전후를 기록하는 오픈 모델은 지금까지 거의 없었다. 범용 에이전트의 기반 모델로 활용 가능한 임계값을, 사실상 처음으로 넘어선 단계다.
4,050억 총 파라미터임에도 불구하고, 1회 추론 시 동작하는 것은 860억 상당. H200×8로 운영할 경우, GPT-4o API 환산으로 동일 품질의 작업을 연간 60~70% 비용 절감으로 처리할 수 있다는 시산이 복수의 ML 엔지니어로부터 보고되고 있다. 단, 인프라 구축·유지 비용은 별도 발생하므로, 중소 규모에서는 여전히 API가 합리적인 선택지가 된다.
법률 문서 전문·코드베이스 전체·장기 대화 로그가 1개의 요청에 담길 수 있다. 다만 실제로 이 길이의 컨텍스트를 모두 활용하려면, 추론 속도와 메모리 요구 사항이 트레이드오프가 된다. 현시점에서는 「수만~수십만 토큰」이 실운용에서의 현실적인 상한으로 보인다.
상업용 라이선스와 공개 가중치의 조합은, 기업이 자사 데이터로 파인튜닝 → 사내 배포를 자체적으로 완결할 수 있음을 의미한다. 클로즈드 API에서는 불가능했던 기밀 데이터의 활용이, 법무·컴플라이언스·의료 영역에서 본격적으로 검토될 것으로 보인다.
Llama 4 Ultra의 공개가 「분기점」이 된다고 판단하는 이유는 하나다: MMLU 93.2%라는 수치가 「충분히 쓸 수 있다」는 심리적 임계값을 넘어섰다는 점이다.
지금까지 오픈 모델은 「클로즈드보다 약간 부족한 대안」으로 취급되어왔다. Ultra는 벤치마크 상에서 「클로즈드와 동등하거나 그 이상」의 자리에 처음으로 올랐다. GPT-4o 대비 API 의존을 해소하는 의사결정이, 앞으로 6개월 내에 복수의 대기업에서 나올 것으로 보인다.
한편 주의할 점도 있다. 「구동할 수 있다」와 「업무에서 제대로 활용한다」 사이에는, RAG 파이프라인 설계·안전 필터 튜닝·모니터링 체계 구축이 통째로 끼어 있다. Ultra를 「선택지에 추가하는」 판단과 「전면 전환하는」 판단은, 전혀 다른 리스크 프로파일을 지닌다.
Meta가 다음에 어떻게 움직이는지도 주목할 만하다. Ultra 공개와 동시에, Llama 4용 파인튜닝 최적화 툴 「Llama Tune」의 프리뷰가 조용히 고지되었다. 이것이 정비되면, 비 ML 엔지니어도 자사 커스터마이징의 입구에 설 수 있는 구조가 된다. 오픈소스 측의 에코시스템이, 클로즈드 측의 매니지드 서비스에 가까운 편의성을 갖추기 시작하는 전환점으로 기억될지도 모른다.
Llama 4 Ultra는 「오픈소스로 GPT-4o급」을 현실로 끌어당겼다. 클로즈드 API를 계속 사용할 것인가, 인프라 투자를 통해 오픈 모델을 내재화할 것인가——그 판단을 요구받는 조직이 2026년 가을에 걸쳐 늘어날 것으로 보인다.
당신의 조직은 지금, 어느 쪽의 베팅을 선택할 준비가 되어 있는가.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.