DeepSeek「R3」正式发布——数学与编程推理超越o3,成本仅为其1/8
機械翻訳 / Machine-translated
DeepSeek于2026年8月29日正式发布了专注推理的模型「R3」。该模型在AMATH(高级数学推理)基准测试中以0.8分的优势超过OpenAI「o3」,并在SWE-bench Verified上创下72.4%的新纪录。模型权重同步以MIT许可证开放发布,API单价约为o3的八分之一。「开放、低价、基准榜首」三大条件同时具备,尚属首次,企业推理AI的部署设计从本周起将面临全面重审。
2026年8月29日17:00 UTC,DeepSeek在Hugging Face上同步发布了「DeepSeek-R3」的模型权重与技术报告。总参数量为671B(混合专家架构),但推理时的激活参数控制在37B,相较于同等规模的稠密模型具有显著的成本优势。
主要基准测试结果(来自官方技术报告):
发布后,X(原Twitter)上开发者的验证帖子迅速涌现,「R3 AMATH」于日本时间29日深夜登上热搜趋势。
「试用了DeepSeek R3。如果SWE-bench的分数属实,本周内就需要重新审视编程智能体的骨干模型选型。我们内部的对比评测,现在就启动。」
DeepSeek于2025年1月发布「R1」,同年7月推出「R2」,进一步强化了多步推理(链式思维扩展)能力。此次R3是「R2」发布约13个月后的继任版本。该公司总部位于北京,核心研究团队主要由清华大学、北京大学出身的研究人员组成。
MoE架构能够将推理时的计算成本从671B规模压缩至相当于37B的水平,Google的Gemini系列和Mistral的「Mixtral」均已采用这一架构。R3据称进一步提升了激活选择的效率,但独立验证目前仍在进行中。
API服务于同日开放。公布价格为每100万输入token 0.55美元,相较于o3(4.40美元)约为其八分之一。
MIT许可证允许无限制地进行商业使用、修改和再分发。自建基础设施部署成为切实可行的选择,已有多名工程师估算,在AWS、Azure上的推理成本相较于o3 API最多可降低65%。国内系统集成商与云服务商对R3进行微调并打造垂直SaaS的方案,预计将在未来90天内付诸行动。
SWE-bench Verified是衡量模型能否自动修复真实GitHub Issue的指标。72.4%这一数字意味着「约10个Issue中有7个以上能够输出相当于人工Pull Request的修复方案」。代码审查前置环节的自动化,乃至Bug分类处理的自动化,已逐渐进入可落地的范畴。
截至2025年底,「前沿模型由美国主导」的格局被视为定论。R3在AMATH上的榜首表现,可能成为对这一格局的具体反证。不过,独立可复现性验证目前仍十分有限,过去也曾出现发布值与第三方验证值相差5至8分的情况。现阶段下定论为时尚早。
在日本的金融、医疗、公共部门,将中国企业模型集成到企业系统时的风险评估是必要环节。API调用与本地部署在风险画像上存在显著差异,这一点容易被忽视。
R3之所以有别于其他发布,在于「权重开放、价格颠覆、基准榜首」三要素同时具备。通常任意一条便足以构成新闻价值,三条齐聚时,市场的调整压力将呈乘数级放大。2025年R1发布时,英伟达市值单日蒸发约5900亿美元的记忆仍历历在目。
但立即拍板采用仍需谨慎。当下应做的,是「本周内启动针对自身使用场景的对比评测流程」。尤其是编程智能体、法务文件分析、数理优化这三个领域,优先级较高。反之,对于以响应速度和稳定性优先于推理精度的客户对话类任务,高分数未必能直接转化为优势,同样需要留意。
预计下周内将有多项独立复现实验结果公开,届时评估结论将出现较大变动。
DeepSeek R3有望成为首个同时满足「开放×低价×高性能推理」条件的模型。基准测试的第三方验证与实际运行稳定性确认双双到位的下周前后,将是第一个决策时间窗口。你的组织下一次模型评估周期的触发时间,定在了何时?
※本文由 ミライ・ニュース 编辑部 AI 作者(AI新闻)撰写。