Meta发布「Llama 4.1 Scout」——视觉推理达到GPT-4o水准,开放权重迎来转折点
機械翻訳 / Machine-translated
Meta于2026年8月28日正式发布了支持多模态的开放权重模型「Llama 4.1 Scout」。该模型采用激活参数17B、MoE(混合专家)架构,在视觉推理基准测试MMBench中取得82.4分——与GPT-4o(83.1分)的差距缩小至0.7个百分点。「与顶级闭源模型等效运行」在可商用的开放权重模型中,首次成为切实可行的选择。
Meta同日在Hugging Face与GitHub上公开了权重文件及授权协议。Llama 4.1 Scout的主要规格如下。
发布后,X平台上迅速涌现出开发者的反应。
「在本地跑了一下Llama 4.1 Scout,能达到可以集成进产品的水准,运行相当顺畅。让我开始重新考虑是否还有必要持续为云端API买单。」(软件工程师,粉丝2.2万)
Llama 4系列自2026年4月发布以来,在文本处理方面已基本达到现有闭源模型的同等性能。然而在视觉推理方面,主力型号Llama 4 Maverick(70B)的MMBench得分仍停留在79.1分,与GPT-4o、Gemini 2.5 Flash之间的差距被评估为「在实际应用中不可忽视的水平」。
此次Scout对架构进行了MoE改造,在将推理计算成本相较Maverick降低约61%的同时,提升了视觉精度。INT4量化版本可在个人GPU(RTX 4090 × 2及以上)上运行全部功能,数据中心以外的部署选择由此真正具备了可行性。
据估算,将激活参数17B的模型进行自托管,推理成本相较GPT-4o API可削减约82%(基于A100 × 8配置、吞吐量120 req/min的假设)。对于中等规模SaaS的多模态功能而言,摆脱云端依赖在财务上趋于合理的临界点已经到来。
直接输入4分钟以内视频的功能,是前一代Llama 4系列所不具备的。监控视频自动分析、招聘面试视频筛选、电商商品视频标签生成等应用场景,由此可通过开放权重模型实现。预计今年下半年,从现有闭源API转向该模型的动力将进一步增强。
与上月发布的Hugging Face SmolLM3(1.7B)形成对比,Scout承担的是「本地服务器~云端中间层」的角色。将轻量模型无法处理的任务回退至Scout的分层推理模式,预计将在开发现场逐渐普及。
「开放权重追平闭源」这样的标题,我们此前已写过数次。但这一次的意义有所不同。视频输入一直是各家作为「接近核心的差异化功能」加以守护的领域。Meta选择将其开放,与其解读为对API业务的冲击,不如说是押注生态系统扩张的战略更为准确。
同日Meta还公布了与Meta AI Studio的联动,意在以Scout为核心推动产品开发。将开发者纳入生态系统后,如何借助社交平台与广告基础设施驱动数据飞轮——那才是真正的竞争焦点所在。
有一点需要注意,那就是精度对实现方式的依赖性。INT4量化下的视频处理,视频时长越长精度下降越明显(4分钟满时约下降3~5%),在生产环境中,必须对硬件要求和量化位数进行严格评估。
Llama 4.1 Scout的发布,动摇了多模态实现中「只能选闭源API」这一既有前提。下一个关注焦点,是Google与Anthropic将在何时调整面向边缘~中间层模型的定价与授权结构。开放权重带来的压力从上方加速成本竞争的格局,预计将在2026年底前愈发清晰。
※本文由ミライ・ニュース编辑部AI写手(AI新闻)撰写。