Meta "Llama 4 Scout" 상용 API 정식 공개——비용 70% 절감으로 OSS LLM의 경쟁 구도가 바뀐다
機械翻訳 / Machine-translated
Meta는 2026년 8월 13일, "Llama 4 Scout"의 상용 API(Llama API) 제공을 정식으로 시작했다. 입력 1M 토큰당 $0.11——GPT-4o의 약 30% 수준의 가격——에 최대 512k 토큰의 컨텍스트 윈도우와 멀티모달 입력을 갖춘 모델이 유료 API로 사용 가능해지면서, OSS 모델이 "성능은 떨어지지만 저렴하다"는 기존의 공식을 무너뜨리고 있다.
Meta는 Llama 4 Scout(액티브 파라미터 17B, 총 109B의 MoE 아키텍처)를 2026년 4월에 가중치 공개한 바 있으나, 이번 발표는 Llama API를 통한 유료 상용 제공의 정식 시작을 의미한다.
공식 발표 시점의 주요 사양은 다음과 같다.
X(트위터)에서는 공개 직후부터 국내외 엔지니어들의 반응이 확산됐다.
"Scout가 상용 API로 동작하게 됐다. 512k 멀티모달에 이 가격대는, 다음 유스케이스 선정에서 무시할 수 없는 선택지가 된다" (엔지니어 계정, 좋아요 약 1,400개)
상용 AI의 API 가격은 2025년 하반기부터 급격한 하락 국면에 접어들었으며, 주요 클로즈드 모델도 1M 토큰당 $0.30~$1.00 전후가 표준적인 가격대가 됐다. 그 가운데 Meta는 가중치 공개와 동시에 유료 API도 전개하는 이중 전략으로 전환한 것으로 보인다.
비용에 대한 민감도는 국내에서도 높다. 경제산업성의 생성 AI 활용 동향 조사(2026년 7월 공표)에 따르면, 국내 기업의 AI 도입에 있어 "이용 비용의 높음"을 최대 장벽으로 꼽은 비율이 43%에 달했으며, 저비용·상용 이용 가능한 모델에 대한 수요는 여전히 강하다. Llama 4 Scout의 라이선스는 월간 활성 사용자 7억 명 이상의 기업에는 제한이 있으나, 대다수의 일본 기업은 상용 이용 범위에 해당된다.
입력 $0.11/1M 토큰은 GPT-4o(동 $0.38) 대비 약 71% 절감에 해당한다. 다만 MMLU·BIG-Bench Hard 등의 벤치마크에서는 GPT-4o 및 Gemini 2.5 Pro와의 격차가 여전히 존재하는 것으로 보이며, "비용 대 성능"의 트레이드오프 판단이 요구되는 국면이다. 배치 처리·요약·분류 등 정확도 민감도가 상대적으로 낮은 태스크부터 시도해 보는 것이 현실적인 접근법이 될 것이다.
512k 토큰은 계약서 100~200장 분량을 일괄 처리할 수 있는 규모다. 법무·회계·연구 분야에서 자체 RAG 파이프라인 구축 비용을 절감할 가능성이 있으며, 장문서 관리 도구 통합을 검토하던 기업에게는 투자 판단을 재검토할 근거가 된다.
Llama 4 Scout는 셀프호스트도 계속 가능하다. GPU 조달 비용 및 운영 공수와 비교해 API가 경제적으로 더 합리적인지는 규모에 따라 달라진다. 데이터 주권·GDPR 대응이 엄격한 업종에서는 계속해서 셀프호스트가 주류가 될 것으로 보인다.
지금까지 Meta는 모델 공개의 주된 목적을 광고 사업의 간접 효과에 두고, API 수익화에는 소극적이었다. 이번 유료 API 진입은 그 방침 전환을 보여주는 신호로 받아들여야 하며, 향후 Maverick 풀 모델의 상용 API 전개도 현실성을 띠게 된다.
주목해야 할 점은 "Meta가 모델을 팔기 시작했다"는 구조적 변화에 있다. 지금까지 OpenAI·Anthropic·Google 3사가 지배해 온 상용 API 시장에, OSS를 출발점으로 하는 대형 테크 기업이 본격 참여한 형태다. Mistral Large 3(기보)와 함께 보면, 2026년 하반기는 OSS계 API의 가격 경쟁이 한층 치열해지는 국면에 접어들었다고 판단할 수 있다.
일본 기업에 대한 시사점은 명확하다. "GPT-4o냐 Gemini냐"는 사실상의 양자택일 구도가 무너지고, Llama 4 Scout와 Mistral Large 3가 비교 테이블에 올라오게 된다. 선정 기준이 "모델의 신뢰성"에서 "태스크별 비용 대비 효과"로 이동하는 흐름은 멈추지 않는다. 조달 담당자에게는 벤치마크 스코어와 자사 태스크의 상관관계를 스스로 검증하는 능력이 요구되는 시대가 됐다.
멀티모달 API를 $0.11/1M 토큰 수준으로 이용할 수 있게 됨으로써, 제조업의 이미지 검사나 소매업의 상품 카탈로그 처리 등, 지금까지 비용을 이유로 미뤄왔던 현장 실증이 본격화될 가능성도 있다.
Llama 4 Scout API의 정식 공개는, OSS 모델이 "연구·실험용"에서 "상용 비용 경쟁의 당사자"로 입지를 옮긴 한 수다. 다음 관심 포인트는 Llama 4 Maverick 풀 모델의 상용 API화 타이밍과 가격 설정이다. 복수의 저비용 API가 병존하는 환경에서는, "어떤 모델을 선택하는가"보다 "어떤 태스크에 무엇을 배치하는가"의 설계 능력이 기업 AI의 실질적인 경쟁력을 좌우한다.
※본 기사는 미래이·뉴스 편집부의 AI 라이터(AI뉴스)가 작성하고 있습니다.