Meta发布"Llama 4 Maverick"完整版——开放权重大模型开启自建推理新时代
機械翻訳 / Machine-translated
Meta于2026年9月11日正式公开了Llama 4系列旗舰模型"Maverick"的完整权重。该模型参数规模估计达4000亿,同时附带商业许可证发布——这一组合首次将"在自有服务器上运行GPT-5级别模型"的选择纳入了切实可行的成本核算范围。"购买API还是自建推理"这一问题,从今天起已可在实务层面真正提上议程。
北京时间9月11日22时,Meta在Hugging Face上公开了Maverick的全部权重。同步发布的技术报告显示,该模型在MMLU上达到89.3%,GSM8K达到96.8%。主要基准测试的平均分与GPT-5的差距已收窄至2.1个百分点以内,彻底颠覆了2025年底业界普遍认为"前沿性能仍有明显差距"的判断。
"用8张RTX 6090跑Maverick,每秒23个token。折算成月度API费用约为其八分之一。这对组织级别的迁移已具备充分的研究价值。"——某大型SaaS企业AI基础设施工程师(X平台,2.2万粉丝)
许可证采用独有的"Llama 4 Community License",仅要求月活跃用户超过7亿的企业事先向Meta提出申请。实际符合条件的仅为Google、Microsoft、Amazon、ByteDance等极少数公司,对绝大多数企业而言并不构成实质性限制。
自Llama 3发布(2024年)以来,开放权重大模型的性能曲线持续陡峭攀升。进入2026年上半年,Meta相继推出了Scout(70B级)和Ranger(200B级),而Maverick正是这一系列的终章。
在推理成本方面,GPT-5 API的输入单价约为$5/MTok,而多位工程师测算显示,对Maverick进行INT4量化后的自建推理成本约为$0.6~$1.2/MTok。若善用AWS竞价实例(p5.48xlarge),理论上每小时约$32即可完成运营部署。
官方规格确认最大上下文窗口为512K token。在需要处理大型代码库分析或长文档的智能体工作流中,单次提示可处理的范围大幅扩展。
全精度推理建议使用8张以上GPU,但据报告显示,应用INT4量化后,4卡配置仍可实现每秒15~20个token的输出。这意味着拥有本地GPU服务器的中型企业也开始将其纳入选项。
自Llama 3以来逐步完善的LoRA/QLoRA生态系统对Maverick实现了当日兼容,开源数小时后GitHub上便出现了面向垂直行业的微调代码。预计未来数周内衍生模型将迎来爆发式增长。
在金融、医疗、政务等因合规原因难以向外部API传输数据的领域,能够在自有环境中实现GPT-5级别的性能意义重大。在日本,从个人信息保护法的角度出发,自建推理的需求同样存在,预计相关讨论将迅速落地至实务层面。
此次发布的意义,远不止于"又一个强大开放模型的出现"。其结构性变化在于:它将"还要继续依赖专有API设计多久"这一问题,提升至了组织决策层面。
OpenAI和Anthropic在推理优化方面的差异化优势——o系列的思维链推理、Claude的长上下文可靠性——仍然具备独特价值。然而,在通用文本生成、摘要、信息抽取等广泛应用场景中,未来6至12个月内,选择开放权重模型或将成为"无需解释的默认选项"。
尤其值得关注的是成本敏感度较高的中型SaaS企业和初创公司。对于月度API费用已达数百万日元规模的企业来说,即便计入基础设施投资,迁移的ROI从今天起已开始进入可行区间。
Llama 4 Maverick的问世,意味着2027年以后AI采购的核心议题将不再是"选用哪个模型",而是"选择哪种推理基础设施"。拥有GPU的组织应立即重新核算成本;没有GPU的组织则需重新审视云端推理服务的路线图。您的组织,是继续依赖API,还是迈出推理自建的第一步?
※本文由 未来新闻编辑部 AI写作助手(AI新闻)撰写。