Mistral Large 3正式发布——数学与编程精度超越GPT-4o,欧洲LLM的竞争格局正在改变
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Mistral AI于2026年8月3日,通过API及Mistral Platform正式发布了旗舰模型"Mistral Large 3"。该模型在数学推理基准测试(MATH)中达到89.3%,编程评估(HumanEval)达到92.1%,在三项主要指标上均超越GPT-4o。这也是欧洲本土LLM首次跻身全球排行榜前三。
发布公告于日本时间8月3日23时(巴黎时间16时)与官方博客同步发出,API即时生效。输入Token定价为$1.8/1M,输出Token为$5.4/1M,比近期OpenAI与Anthropic主力模型低20~35%。
上下文窗口为128K Token。函数调用精度在BERCLEval(工具使用评估)中达到88.7%,被认为已达到Agent应用场景的实用水准。
"Large 3,HumanEval超过92了。接近o3-mini的精度,成本却只有三分之一。如果是Agent用途,值得认真考虑切换。"(科技类账号,粉丝2.2万)
Mistral AI是一家成立于2023年的法国初创公司,截至2025年底已累计完成C轮共12亿美元融资。该公司在欧盟AI法规(EU AI Act)框架下推进开放权重策略,凭借Mistral 7B和Mixtral 8x22B在价格竞争力上持续发力。
此次发布的Large 3为闭源模型,但明确表示将通过Mistral Platform及面向微调用途的有限权重许可证进行提供,走的是完全开源与企业级之间的差异化中间路线。
自2026年4月欧盟委员会在采购政策中明文规定"确保欧盟域内数据主权"以来,该公司已在德国、法国等地陆续获得多个公共采购项目。Large 3的推出正是顺应这一趋势而来。
HumanEval 92.1%表示函数级自动测试的通过率。在实际开发流程中,"补全建议→自动生成测试→代码审查"三个环节中,前两个环节均可实现高精度自动化。与OpenAI o3系列的差距已缩小至5个百分点以内。
Mistral估算,若以Large 3替代企业主要用途中的GPT-4o,在月均1T Token规模下,每年可节省成本逾800万美元。但综合工具精度差异与微调成本的实际TCO(总拥有成本)仍需个别评估验证。
EU AI Act对高风险类别所要求的透明度义务(第13条),与Large 3的策略日志功能在设计上高度契合,这在实际业务中具备明显优势。自2026年8月起对金融、医疗领域高风险AI的监管开始适用,越来越多的采购标准明确倾向于欧洲供应商。
若只看基准数字,容易一笔带过"又出了一个号称超越GPT-4o的模型",但Large 3的本质在于价格与监管合规的组合优势。在欧洲公共采购、金融和医疗行业,"性能80分、成本减半、符合法规"实际上正越来越多地被优先选择,而非"性能满分、成本高昂、游走灰色地带"。
对于日本企业而言,有两个切入点值得关注:一是欧洲本地子公司的AI系统采购标准可能发生变化;二是Mistral的成本水准可作为与GPT-4o价格谈判的筹码。后者对国内系统集成商和云服务商来说,将是不可忽视的变量。
下一个关注焦点是Large 3技术移植至Mistral Codestral系列的时间表。若编程专用模型以同等价格区间推出,GitHub Copilot、Cursor、Devin之间的竞争格局将进一步改变。
"欧洲本土能在性能、成本、合规三个维度上同时参与竞争"——这正是此次发布向市场传递的核心信息。其定价已足以触发对现有合同的重新审视,AI采购负责人有必要在本周内开展对比评估。在你的技术栈中,有哪些组件是可以被替换的?
※本文由ミライ・ニュース编辑部AI写手(AI新闻)撰写。