阿里巴巴"Qwen 3.5"——中国产LLM登顶榜首,以开放权重迈向产业落地
機械翻訳 / Machine-translated
阿里云于9月7日(日本时间)正式发布大规模语言模型"Qwen 3.5"。该模型在数学推理基准测试"MATH-500"中取得92.4分,在代码评估"LiveCodeBench v4"中取得78.1分,双双超越GPT-4o(88.3分·74.9分)和Gemini 2 Pro(89.1分·75.6分)。720B参数的开放权重版本以Apache 2.0许可证于当日同步发布,为长期寻求摆脱API依赖的企业提供了清晰的替代选项。
阿里巴巴于日本时间14:00通过官方博客及X官方账号公布了Qwen 3.5的详细信息。模型分三个规格提供:
发布说明中记载:"支持72种语言,日语评估得分较上一代提升31%。"X平台上的日语工程师社区也随即出现大量速报。
"用内部数据对Qwen 3.5-72B进行了微调。已达到可从GPT-4o迁移的水平,成本降至原来的1/5以下。"(工程师类账号,点赞2.1万)
Qwen系列自2023年初版发布以来,历经约三年实现了快速成长。2025年初的Qwen 2.5阶段,该系列在日语及代码领域已获得顶级评价,开放权重版本的持续完善也推动了生态系统的扩张。
阿里云于2026年3月宣布"三年内对AI与云计算累计投入5000亿元人民币(约9.6万亿日元)",模型研发团队规模翻倍,此次720B模型被视为迄今最大规模的成果输出。
在中美半导体管制持续的背景下,外界曾有观点认为阿里云的GPU采购受到制约,而此次基准测试结果表明,"即便处于限制之下,仍有能力参与性能竞争"。
API单价$0.18/M输入token大幅低于Claude 5 Haiku($0.30)。若同等性能区间内的价差如此显著,对成本敏感度较高的初创企业及中型企业的采用速度有望加快。
以Apache 2.0许可证开放720B模型,对希望规避厂商锁定的大型企业及政府机构极具吸引力。由于可在自有云环境中部署,在数据主权法规严格的日本及欧盟市场落地变得更具可行性。
发布说明称较上一代提升31%,但评估数据集的具体构成尚未公开。在JSQuAD、JEMHopQA等标准基准的独立验证结果出齐之前,不应将这一数字照单全收。优先以内部数据进行实测才是务实之举。
当72B级别的开放权重模型以低于API的成本可用时,行业专属模型的内部开发将提速。制造、金融、医疗等专有知识直接关乎竞争优势的领域,预计将率先出现相关动作。
使用API模式时,需确认提示词与响应将经由阿里云基础设施传输。若以开放权重在本地部署,可规避这一限制,但训练数据的透明度目前仍较为有限。对于关键业务场景,在第三方模型审计结果出齐之前暂缓投入生产,也是合理的判断。
单看数字,"中国玩家再度登顶"或许是显而易见的标题,但此次的真正意义不在于基准排名,而在于开放权重720B的存在本身。
一旦出现一个性能比肩GPT-4o、且可在Apache 2.0许可下自由使用的模型,此前以API按量计费为前提的AI导入成本逻辑便随之瓦解。过去仅从"性能 vs 成本"维度进行厂商选型的企业,如今多了第三个轴——"开放权重自主运营 vs API全托管"。
日语性能提升31%能否在实际场景中切实感受到,未来两到三周内应会有独立基准评测结果陆续出炉。需要确认的三个关键点是:长文摘要精度、敬语与文体控制、专业术语(医疗·法律·制造)的转换精度。若这三点均表现出色,"等待国产模型,还是直接上Qwen 3.5"的实务决策时刻将随之到来。
"在性能和可用性上均逊于西方"这一前提,已随此次发布而不再成立。将中国产开放权重LLM纳入AI采购比较维度的时机已经到来——你所在的组织,判断标准是否还停留在2025年以前?
Qwen 3.5在性能、成本与许可证三个维度上均具有明确的吸引力。接下来率先行动的,将是独立基准测试社区,以及尝试进行日语微调的工程师群体。预计两到三周内实测数据将陆续汇聚,采用决策的基础也将随之成形。
※本文由 ミライ・ニュース 编辑部的AI写手(AI新闻)撰写。