Meta发布「Llama 4 Ultra」——MMLU 93.2%重塑开源推理模型竞争格局
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Meta于2026年8月22日,在Hugging Face及其开发者门户正式发布了开源大型语言模型「Llama 4 Ultra」。该模型总参数量达4050亿(MoE架构,实际激活参数约860亿),MMLU得分93.2%。对于拥有足够基础设施投入能力的组织而言,"无需依赖闭源API、在自有基础设施上运行GPT-4o级别推理"正逐渐成为一种现实可行的选择。
Meta于北京时间2026年8月22日23时(太平洋时间同日上午),在Hugging Face公开发布了「Llama 4 Ultra」的权重文件与模型卡。授权协议为Llama 4 Community License(月活跃用户超过7亿的服务除外,其余可商用)。
主要规格:
「我们在8×H200上以BF16全精度运行了Llama 4 Ultra。速度比GPT-4o的API响应略慢,但质量相当甚至更优。能够对内部数据进行追加训练,是最大的差异所在。」(某ML方向创业公司CTO,拥有1.2万粉丝)
Llama系列自2023年2月发布Llama 1以来,每个版本都刷新了开源LLM的性能上限。2025年4月发布的Llama 4系列(Scout / Maverick)首次明显缩小了与闭源模型的差距,此次的Ultra则被定位为该系列的最大规模版本。
Meta持续以开源形式发布如此大规模模型的背后,存在明确的战略动机:在云AI市场上与AWS、Google Cloud形成差异化,以及将其嵌入广告与商业基础设施。「AI民主化」并非单纯口号,更被视为将生态系统主导权向底层迁移的战略布局。
在开源竞争对手中,DeepSeek V4(6710亿MoE)曾于2026年初在性能上抢先一步,但Ultra凭借清晰的商用授权与推理效率之间的平衡寻求差异化。
MMLU 93.2%体现了知识与推理的广度,HumanEval 89.7%则展示了代码生成的专项深度。此前存在某一项指标突出的专用模型,但能在两项指标上均达到90%附近的开源模型几乎从未出现。这标志着作为通用Agent基础模型所需的门槛,事实上被首次突破。
尽管总参数高达4050亿,每次推理实际运行的仅相当于860亿参数。多位ML工程师测算指出,使用H200×8进行部署时,处理同等质量任务的年度成本相较GPT-4o API可降低60~70%。但需注意,基础设施的搭建与维护成本另行计算,因此对中小规模组织而言,使用API仍是合理之选。
完整法律文件、整个代码库、长期对话记录均可容纳于单次请求中。然而,要真正用满这一长度的上下文,推理速度与内存需求之间存在权衡。目前来看,「数万至数十万Token」仍是实际生产中较为现实的上限。
商用授权与公开权重的组合,意味着企业可以使用自有数据进行微调,并完全在内部完成部署。闭源API无法实现的敏感数据利用场景,预计将在法律、合规、医疗等领域进入实质性探讨阶段。
我们判断Llama 4 Ultra的发布将成为一个「分水岭」,原因只有一个:MMLU 93.2%这一数字,已超越了「足够可用」的心理门槛。
过去,开源模型始终被视为「比闭源稍逊一筹的替代方案」。Ultra首次在基准测试上坐上了「与闭源持平甚至更优」的席位。预计在未来6个月内,将有多家大型企业作出降低对GPT-4o API依赖的决策。
不过,也有需要注意之处。「能跑起来」与「能在业务中熟练运用」之间,横亘着RAG流水线设计、安全过滤器调优以及监控体系搭建等一系列工作。「将Ultra纳入选项」与「全面迁移至Ultra」,是风险特征截然不同的两种决策。
Meta接下来的动向同样值得关注。在发布Ultra的同时,面向Llama 4的微调优化工具「Llama Tune」的预览版也悄然发布。若该工具趋于完善,非ML工程师也将能够踏上自定义模型的入门之路。这或许将被记录为一个转折点——开源生态系统开始拥有与闭源托管服务相近的便利性。
Llama 4 Ultra将「开源实现GPT-4o级别」拉近为现实。继续使用闭源API,还是投入基础设施将开源模型内部化——预计在2026年秋季前后,将有越来越多的组织面临这一抉择。
你的组织,现在是否已准备好选择哪种押注方式?
※本文由 未来新闻编辑部 AI写手(AI新闻)撰写。