Meta「Llama 4 Maverick」완전판 공개——오픈 웨이트 LLM이 자체 추론 시대를 열다
機械翻訳 / Machine-translated
Meta가 Llama 4 시리즈 최상위 모델 「Maverick」의 완전한 웨이트를 2026년 9월 11일에 공개했다. 추정 4,000억 파라미터 규모임에도 상업용 라이선스 배포 형태를 취한 이번 구성은, 「GPT-5급 모델을 자체 서버에서 운영한다」는 선택지를 처음으로 현실적인 비용 계산 범위 안에 집어넣었다. LLM 시장에서 「API 구매냐, 자체 추론이냐」라는 질문이 오늘부터 실무 수준에서 본격적으로 제기되기 시작했다.
Meta는 한국 시간 기준 9월 11일 22시, Hugging Face에서 Maverick의 전체 웨이트를 공개했다. 동시에 공개된 기술 보고서에서는 MMLU 89.3%, GSM8K 96.8%를 기록했다. 주요 벤치마크 평균에서 GPT-5와의 격차는 2.1포인트 이내로, 「최전선 성능에서는 격차가 있다」는 2025년 말 시점의 업계 인식이 사실상 뒤집혔다.
「Maverick을 RTX 6090 8장으로 구동했다. 초당 23토큰. API 비용의 월 환산 대비 약 8분의 1. 이는 조직 단위로 전환을 검토할 만한 수치다」——대형 SaaS 기업 AI 인프라 담당 엔지니어 (X, 팔로워 2.2만)
라이선스는 독자적인 「Llama 4 Community License」로, 월간 활성 사용자 7억 명 초과 사업자에 한해 Meta에 사전 신청을 의무화한다. 실질적으로 해당하는 곳은 Google·Microsoft·Amazon·ByteDance 등 극히 일부이며, 대다수 기업에는 실질적인 제약이 되지 않는다.
Llama 3 공개(2024년) 이후, 오픈 웨이트 LLM의 성능 곡선은 가파른 상승세를 보였다. 2026년 전반기에 걸쳐 Meta는 Scout(70B급), Ranger(200B급)를 단계적으로 출시했으며, Maverick은 그 최종 장에 해당한다.
추론 비용 측면에서, GPT-5 API의 입력 단가가 $5/MTok 전후로 알려진 반면, 양자화(INT4)를 적용한 Maverick의 자체 추론은 $0.6〜$1.2/MTok라는 시산이 다수의 엔지니어로부터 보고되고 있다. AWS 스팟 인스턴스(p5.48xlarge)를 활용하면 시간당 $32 전후의 운영도 계산상 성립한다.
공식 사양에서 최대 512K 토큰의 컨텍스트 윈도우가 확인됐다. 대규모 코드베이스 분석이나 장문 문서 처리가 필요한 에이전트 워크플로에서, 단일 프롬프트로 처리 가능한 범위가 크게 확대된다.
풀 정밀도 추론에는 GPU 8장 이상이 권장되지만, INT4 양자화 적용 시 4장 구성에서도 초당 15〜20토큰이 나온다는 보고가 있다. 온프레미스 GPU 서버를 보유한 중규모 기업에서도 선택지로 떠오르기 시작했다.
Llama 3 이후 정비된 LoRA·QLoRA 에코시스템은 Maverick에도 즉시 대응하며, 공개 후 수 시간 만에 업계 특화 파인튜닝 코드가 GitHub에 등장했다. 앞으로 수 주 내에 파생 모델이 급증할 것으로 전망된다.
외부 API로의 데이터 전송이 규제상 어려운 금융·의료·행정 분야에서는, GPT-5급 성능을 자체 환경에서 구현할 수 있다는 것의 의미가 크다. 일본 국내에서도 개인정보보호법 관점에서 자체 추론 수요가 존재하며, 도입 검토 논의가 실무 수준으로 내려올 것으로 보인다.
이번 공개가 지닌 의미는 단순한 「강력한 오픈 모델의 등장」이 아니다. 「프로프라이어터리 API를 전제로 한 설계를 언제까지 이어갈 것인가」라는 질문을 조직의 의사결정 수준으로 끌어올렸다는 점에서 구조적인 변화다.
OpenAI와 Anthropic이 제공하는 추론 최적화——o-series의 사고 연쇄, Claude의 장문맥 신뢰성——는 여전히 차별화 요인으로 기능한다. 그러나 범용 텍스트 생성·요약·정보 추출과 같은 광범위한 유스케이스에서는, 앞으로 6〜12개월 내에 오픈 웨이트 선택이 「설명이 필요 없는 디폴트」로 이행될 것이다.
특히 주목해야 할 것은 비용 민감도가 높은 중규모 SaaS와 스타트업이다. 월간 API 비용이 수백만 원 규모에 달한 사업자에게 있어, 인프라 투자를 포함해 계산해도 전환의 ROI가 성립하기 시작하는 선에 오늘부터 진입할 수 있다.
Llama 4 Maverick의 등장으로, 「어떤 모델을 사용하느냐」가 아니라 「어떤 추론 기반에 올라타느냐」가 2027년 이후 AI 조달의 핵심 문제가 된다. GPU를 보유한 조직은 지금 당장 비용을 재계산해야 하고, 보유하지 않은 조직은 클라우드 추론 서비스의 로드맵 재검토를 요구받는다. 당신의 조직은 API 의존을 이어갈 것인가, 아니면 추론의 내재화에 나설 것인가.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.