Mistral反击|Medium 3.5×4块GPU解锁自托管
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI模型的世界只有中美两强"——这一认知,或许已经到了该被改写的时候。
2026年4月29日,法国Mistral AI发布了旗舰模型"Medium 3.5"。它以SWE-Bench 77.6%的成绩追上了Claude Sonnet 4.5的背影,同时以修改版MIT许可证开放权重,仅需4块GPU便可本地部署,震撼登场。同日发布的Vibe Remote Agents还将"让云端自动写代码"的能力纳入标配。
本文将一口气梳理Medium 3.5的规格与定位、SWE-Bench 77.6%所代表的实用价值、4块GPU可运行的开放权重所带来的颠覆力、Vibe Remote Agents的运作机制、定价与运营现实、竞品比较,以及对中国市场的潜在影响。
Medium 3.5是Mistral首款将指令跟随(按指示执行)、推理(思考)、编程(写代码)三大能力集成于一体的旗舰产品。
过去Mistral以"小型Mistral 7B""专注编程的Devstral"等分工模型为主,而Medium 3.5可以一台兼顾所有场景。这就像一家此前需要多位专职厨师的餐厅,终于迎来了一位全能总厨。
该模型还支持按请求调节"思考深度"——简单问题快速回答,难题则深入推理。一个模型覆盖多种用途的设计,将大幅降低运营成本与模型选型的复杂度。
先介绍一下公司背景。Mistral AI于2023年在巴黎成立,是法国人工智能企业,也是欧洲代表性的大型语言模型(LLM)开发初创公司。
创始人兼CEO Arthur Mensch曾任职于Google DeepMind,公司成立仅9个月便以媲美OpenAI的性能引发广泛关注。2026年3月,Mistral为在巴黎和瑞典建设数据中心,完成了8.3亿美元(约60亿人民币)的融资,正逐步确立欧洲AI基础设施核心地位。
作为继美国OpenAI、Anthropic和中国DeepSeek、Qwen之后的"第三势力",Mistral备受关注,并计划于2026年内进军日本市场。
此次发布不仅带来了模型本身,更带来了"使用方式"的革新。Mistral同日还发布了Vibe Remote Agents(云端异步编程智能体)以及Le Chat的Work Mode(跨工具业务智能体)。
过去的编程AI基本运行于本地PC,而Vibe的理念是"全权交给云端,睡觉时让它帮你写"。这更像是不在家自己做饭,而是向外部商业厨房下单:"明天早上之前帮我做好"。
Le Chat的Work Mode则是一款管家式AI,能在单次对话中完成邮件草拟、调研和多工具联动。可在Pro、Team、Enterprise套餐中使用。
理解基准测试的内容,才能感受到77.6%这个数字的分量。SWE-Bench Verified汇集了GitHub上真实的开源Bug报告,向AI下达"写出修复此Bug的代码"的指令,并评估修复补丁是否能正确运行。这不是纸上谈兵的考试,而是解决现场问题的实操测试。
Medium 3.5以77.6%的成绩超越了Devstral 2和Qwen 3.5 397B(规模是其四倍的模型),与榜单常客Gemini 3.1 Pro Preview(78.8%)仅差1分。就像一个正在冲击准一级的选手,不知不觉已与一级持有者并肩站上决赛舞台。
它已完全跨越编程AI实用门槛,不再是"辅助工具",而是达到了可称为"同事"的水准。
另一个值得关注的数字同样不容忽视。τ³(tau-cube)-Telecom是衡量AI智能体处理电信行业客服任务解决率的基准,Medium 3.5录得91.4分。
这是一项综合测试,考核"调用多个API、结合历史上下文完成客户服务"的总体智能体能力,是面向长期任务而非一次性问答的指标。91.4分所代表的水准,不是只会背菜谱的厨师,而是听取客人喜好、取出食材、反复试味、最终完成一道菜的总厨级综合实力。
这意味着Medium 3.5不只擅长编程,作为企业业务自动化智能体同样游刃有余。
"一次能处理多少信息"也是重要指标。Medium 3.5拥有256k(25.6万)token的上下文长度,换算成中文约为20万字,足以一次性读入一本书以上的内容。
例如,可以一次性输入整个代码库(数百个文件)并下达"找出这个Bug的根源"的指令。这就像不是一边查字典一边做题的学生,而是把教科书全部记在脑子里再解题的学生。
长篇合同审查、大型代码库重构、长期项目历史回溯等过去需要"分批喂入"的任务,现在一次搞定。以256k超越Claude Sonnet 4.5的200k和GPT-4o的128k,在长文处理领域位居顶尖。
先梳理许可证的核心要点。Medium 3.5以"Modified MIT License(修改版MIT许可证)"发布,任何人均可从Hugging Face免费下载,商业和非商业用途均可使用。
但对于"拥有大规模营收的企业"设有例外条款,可能需要签订附加协议。简而言之:中小企业和个人开发者完全自由,超大型企业则需走另一条合规通道。这类似于街边小店可以自由使用菜谱,而大型连锁餐厅则需另行获得授权许可。
这与LLaMA、DeepSeek相同的"准开源"路线一脉相承,同时体现了欧洲企业对合规性的重视,是一套兼顾实用与规范的许可证设计。
最受关注的莫过于硬件要求。Medium 3.5在FP8(8位浮点)精度下,仅需4块数据中心级GPU(NVIDIA H100 80GB×4,共320GB显存)即可运行。
对于一款1280亿参数级旗舰模型而言,这一硬件需求极为轻量,使企业在本地部署环境中以现实可控的投入实现落地成为可能。GPT-4o和Claude只能通过API调用,而Medium 3.5可以部署在自有服务器上,因此预计在无法将机密数据传输至外部的金融、医疗、政务等领域将迎来快速普及。
这就像不是整体买断名厨,而是获得完整菜谱和厨具,在自己的店里重现——GPU成本不低,但长期运营下来远比按月付费的API更加经济。
软件层面同样完备。Medium 3.5兼容主流LLM推理引擎vLLM、SGLang、Ollama,工程师可按喜好自由选择。
此外还单独发布了用于高速推理的"EAGLE"模型,配套提供将token生成速度提升数倍的机制。
vLLM是基于Python的高速服务器,SGLang擅长结构化推理,Ollama则是在个人Mac上也能运行的轻量工具。从想在本地尝试的工程师,到负责生产部署的基础设施团队,每种环境都有最优方案可选。
用一句话概括Vibe的创新:"编程AI的运行位置变了。"以往的Claude Code、Cursor、GitHub Copilot基本运行于本地PC,而Vibe运行在Mistral的云端,用户只需下达指令即可。它支持并行执行多个任务,完成后发送通知。
不再是自己站进厨房,而是向配备多位厨师的商业厨房投递订单:"这个、这个、还有这个,明天早上之前搞定"——体验感完全变了。
执行过程中,文件差异(修改内容)和工具调用进度均可视化呈现,无需担心"全权交给AI却不知道它在做什么"。可通过Mistral Vibe CLI(命令行)或Le Chat(聊天界面)启动,自然融入现有开发流程。
能否在实际工作中落地,关键在于"如何与其他工具连接"。Vibe标配集成了GitHub(代码与PR)、Linear·Jira(任务管理)、Sentry(错误监控)、Slack·Teams(聊天通报)。
例如,Sentry触发错误时,Vibe自动定位根因代码,在GitHub创建分支并编写补丁,提交PR,再在Slack上汇报——整套流程只需一条指令即可完成。工单(Jira)→库存(GitHub)→烹饪(编程)→摆盘(PR)→上菜(Slack通知),全自动运转。
工程师只需说"我想做什么",后续流程由Vibe全权处理。这意味着可以将精力专注于需求与方案讨论,是开发流程的一个转折点。
另一个有趣的功能是"Teleport(传送)"。它能将本地PC上进行到一半的作业会话,连同历史记录一并迁移至云端继续执行。
比如出门前在咖啡馆写了一半的代码,不需要回家后再继续,而是在外出期间由云端的Vibe接力完成——做好前期准备离开后,另一位厨师接手直至完成。
这一理念将会议和通勤时间转化为"AI的工作时间",有望将工程师的实际产出时间实质性地翻倍乃至更多。由于在沙盒环境(隔离的安全作业空间)中执行,也无需担心破坏生产环境。
来看关键的定价体系。Medium 3.5的API价格为输入1.5美元、输出7.5美元(均为每百万token单价)。
这约为竞品Claude Sonnet 4.5(输入$3、输出$15)的一半,也低于GPT-4o(输入$2.5、输出$10),对注重性价比的用户极具吸引力。性价比落差犹如在小酒馆的价格享受到了米其林餐厅的同等水准。
以每日百万token输入输出的中等规模系统为例,仅从Claude切换到Mistral,每月节省的API费用就相当可观。支持Pro(个人开发者)、Team(团队)、Enterprise(大企业)三档套餐,可按需灵活扩展。
除API外,还有其他使用方式。在Mistral官方聊天应用"Le Chat"中,Pro/Team/Enterprise月度套餐均可使用Medium 3.5,新功能Work Mode也一并包含。
如同ChatGPT,可直接通过浏览器或手机App使用,非技术用户也能轻松访问Mistral最新模型。API版是食材直供,Le Chat版是成品餐食,根据用途各取所需。
支持中文输入输出,语言障碍无需担忧。具体月费因地区和套餐而异,建议前往Mistral官网查询。费用感与ChatGPT Plus、Claude Pro(月费约$20)处于同等水平。
API计费与自托管哪个更合算,取决于用量规模。月均1亿token(小至中等规模系统)适合API,月均超10亿token(大规模生产运营)则是4块H100自托管更具经济性的分界点。
H100×4台的云端租用费约为每月数万至数十万元人民币。对于处理机密数据的企业,可同时实现"降低成本+数据主权"的双重收益。偶尔外出就餐(API)更划算,每天三餐都在家(自托管)则更省——逻辑简单明了。
中小企业用API、大型企业自托管的分工格局基本成型,而Mistral两种选项均以同等质量提供,这是与其他厂商的重要区别。
先看与Anthropic旗舰模型的对比。Claude Sonnet 4.5在SWE-Bench上约为77〜78%,推理稳定性和安全措施获得业界最高评价。
但价格为输入$3·输出$15,是Medium 3.5的两倍,且仅提供API,没有开放权重。如果Claude是"顶级法餐三星店",那Mistral就是"同等味道、小酒馆价格、还能带走菜谱的餐厅"。
机密性最为关键的场景(法务、医疗等)选Claude更放心,希望兼顾成本与数据主权的场景则Mistral占优。Anthropic引以为傲的"Constitutional AI"(宪法式AI,独特安全方法)在Mistral上需通过提示词工程另行覆盖,运营经验的积累将是成败关键。
与OpenAI系产品的比较同样值得关注。GPT-4o和GPT-5.5在知识、多模态、推理方面综合实力强劲,ChatGPT的生态系统是其压倒性优势。
弱点在于不开放权重、仅提供API、无法自托管,数据必须经过OpenAI服务器——封闭性明显。OpenAI是"全球连锁的一流餐厅",Mistral是"附带菜谱可在家重现的欧洲品牌"。
"想把AI外包出去"选OpenAI,"想把AI握在自己手里"选Mistral——结构清晰。在金融、国防、制造业等机密领域,Mistral自托管需求预计将持续增长,有望在OpenAI的优势地盘打开缺口。
Google的Gemini同样是比较对象。Gemini 3.1 Pro Preview在SWE-Bench上录得78.8%,比Medium 3.5(77.6%)高出1.2个百分点,编程性能基本持平。
Gemini的优势在于与Google搜索·Workspace的深度集成,弱点则是封闭生态、多云运营灵活性不足。Gemini是"Google系连锁店,积分可累积",Mistral是"独立品牌,食材来源不受限"——性格迥异。
"公司内部全面依赖Google"选Gemini,"多云或本地混合部署"则Mistral更易上手。比起分数上的细微差距,与自身IT基础设施的兼容性才是现实中更重要的决策依据。
Mistral的日本市场布局也在加速。2026年5月,Mensch CEO接受日本经济新闻采访时表示,"年内将在日本设立据点,抢抓制造业数字化需求"。
主要目标客户是希望摆脱中美AI依赖、转向欧洲AI的日本大型企业(汽车、电气、银行等)。这就像对中美快餐略感疲倦的日本美食家,终于迎来了一家正宗法国餐厅的开业。
日本特有的机密保护文化(不愿将内部数据外传)与Mistral的开放权重战略高度契合。日经crosstech分析,2026年下半年,丰田、三菱UFJ、NTT等大型企业的PoC(概念验证)导入将接连落地。
日语性能同样备受关注。Mistral模型标准支持中文等多语言输入输出,乐天和Stability AI Japan曾基于历代Mistral模型发布日语专属版本,积累了实践先例。
Medium 3.5预计同样会推出类似的微调版本,日语自然度有望大幅提升。就像法国总厨来到日本,独立研发"符合日本人口味的法式和风料理"——地域优化将持续推进。
就现有Medium 3.5而言,日语编程指令和文档摘要已达到充分实用的水准,但方言和特定行业术语建议等待日语专属版发布后再行使用。日语LLM的选择版图,将从"OpenAI/Anthropic/Google/中国系"扩展为加入"法国"的四极格局。
与日本政府国产LLM政策的关系同样值得关注。2026年4月,日本数字厅将国产LLM"源内(Gennai)"以开源形式发布,定位为政府AI基础设施的核心。
Mistral作为"商业旗舰",源内作为"国家基础设施",二者各司其职,预计呈互补而非竞争关系。源内是公共设施性质的集中供餐中心,Mistral是民营服务性质的街边餐厅——职能不重叠。
欧洲与日本均朝着"建立美中以外的AI主权"方向协同推进,政府和自治体采用源内、民营企业采用Mistral的分工格局将逐步形成。对日本AI战略而言,Mistral的进入在拓宽选择多样性方面具有重要积极意义。
东京某SaaS初创公司CTO田中,于2026年5月将Claude Sonnet 4.5每月60万日元的API费用切换至Mistral Medium 3.5,压缩至约30万日元,节省近一半。
他进一步引入Vibe Remote Agents,将公司内部Bug工单自动分配给Vibe,工程师则专注于方案讨论。"每天30条Sentry告警,Vibe连夜调查,上班时已有10个PR在等待。工程师的实际产出感觉提升了1.5倍。"田中回忆道。
这相当于每月花30万日元租用一个24小时营业的商业厨房,性价比完胜。节省出来的费用用于招募新工程师,开发组织的成长循环进一步加速。
在东京某大型银行负责系统开发的佐藤,因涉及客户账户数据,面临不得将数据传至外部API的严格限制。此前公司内部的代码生成AI性能不足,AI落地一度令人沮丧。
2026年5月,他在公司内部H100×4台服务器上部署了Medium 3.5,实现了在完全不外传机密数据的前提下,在内网使用SWE-Bench 77.6%性能的AI环境。"修改版MIT许可证通过了法务审核,4块GPU的运营成本测算也顺利过关。AI大规模落地终于正式启动了。"佐藤感慨道。
这就像禁止外出就餐的员工食堂,终于迎来了一位三星主厨——日本金融业期待已久的"在守护数据主权的同时使用最前沿AI"的选择,就此成为现实。
横滨自由职业工程师山田,从2026年5月起在家中高性能Mac Studio(M3 Ultra·192GB统一内存)上通过Ollama运行Medium 3.5量化版。
"API费用为零,个人项目每月跑100万token,而且离线也能用。"山田说。他借助Vibe CLI对个人项目代码进行夜间批量Review,早上醒来GitHub上已整齐排列着重构建议。
这种体验,就像在家里备齐了米其林级菜谱和全套厨具,一个人做出正宗料理。对于自由职业者和个人开发者而言,不再为API费用担忧、尽情玩转最新AI的时代,终于到来了。
A. Le Chat月度套餐是最便捷的入口,工程师则以Vibe CLI为首选。
非技术用户只需在浏览器注册Le Chat即可使用,操作感与ChatGPT相同。工程师则可在本地安装Vibe CLI并接入API,融入编程工作流,是最快的上手路径。
自托管每月GPU成本较高,除非使用量极大或涉及机密数据,否则不建议优先考虑。可以把它理解为三个阶段:外出就餐(Le Chat)→外卖到家(API)→自己开火认真做(自托管)。建议先从Le Chat上手体验,再按需升级至API或自托管。
A. 中等规模Web应用的Bug修复和重构已达到即战力水平,从零开始的大型新项目目前仍需人工辅助。
读取现有代码库、定位Bug、编写通过测试的补丁——这类工作已经达到甚至超越人类的质量水准。另一方面,从梳理业务需求出发的全新项目,目前还无法全权交给AI,仍需人类架构师主导决策。按菜谱做菜已近乎完美,创意料理则需与人类协作——明确这条边界,灵活调配使用方式至关重要。
使用诀窍有两点:"将任务细化后交给AI"以及"最终审查必须由人工完成"。仅这两点,就有团队反馈开发速度提升了2〜3倍。
A. 核心是:可以下载模型"内容",在自己的服务器上运行,也可以修改。
可从Hugging Face官方页面下载权重(训练好的参数),支持针对自身业务进行微调(增量训练)。这是与Claude、GPT等API型产品最大的差别,不将数据传至外部即可使用AI,在数据主权上具有决定性优势。
就像此前只提供堂食的餐厅,终于公开了菜谱。在家随意复刻、自由改良,全不受限。需注意两点:"大规模营收企业需另行签订协议"以及"运行GPU成本由用户自行承担"。中小企业和个人则完全免费使用。
A. 个人购买难度较大,使用云端资源更为现实。
NVIDIA H100 80GB单卡约450万日元,4张超过1800万日元。数据中心级电源和冷却设施同样不可或缺,家庭自置几乎不现实。使用云端方案,AWS、Azure、GCP均提供H100×4实例,每小时约3,000〜5,000日元,月使用100小时也在30〜50万日元以内。
个人用户还有另一条路:通过量化版(降低精度以减轻体积的模型),在Mac Studio或RTX 4090×2上运行,借助Ollama可在数十万日元级别的PC上跑出实用速度。买商业厨房、租共享厨房、还是用家用灶台——三选其一,按需求和预算决定即可。
"AI领域中美两强格局已定"——这一前提,已经到了该被改写的时候。
2026年4月29日Mistral发布的Medium 3.5,以SWE-Bench 77.6%的实用编程性能,通过修改版MIT许可证的开放权重形式亮相,正是欧洲AI的正式反击。4块GPU即可自托管,API价格约为Claude Sonnet 4.5的一半,还借助Vibe Remote Agents实现了云端异步编程。结合Mistral于2026年内进军日本的计划,对于所有希望兼顾机密性与成本的企业而言,它正在成为最具竞争力的选择。
今天就能开始的准备有三步:①前往Le Chat(chat.mistral.ai)亲身感受其实力,②安装Vibe CLI尝试编程集成,③梳理自身的机密需求、API成本、GPU资产,制作与Claude/GPT的对比表——欧洲AI的认真出手,正在切实改变开发现场的面貌。
本文转载自 AI Friends。