LLM蒸馏成为主流——小型模型为何能以10%的成本发挥大模型95%的性能
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

"使用大模型可以提升精度,但成本会增加10倍"——这堵墙正在开始崩塌。LLM蒸馏——将大型模型的思维过程传授给小型模型的技术——在2026年以来迅速普及,在实用精度上追赶大型模型的案例接连不断。
截至2026年8月,多家企业已公开表示在自家产品中正式采用了蒸馏后的小型模型。典型案例显示,以70B参数模型为教师对7B模型进行蒸馏,在特定任务上保留了原模型93~97%的分数,同时将推理成本削减了约85%。
在X上,这一话题在技术人员之间引发热议,某条帖子写道:
"明明跑的是7B,却看不出和70B有什么区别。没想到蒸馏设计得好,差距能缩小到这种程度。"
在arXiv上,2026年1月至8月间蒸馏相关论文的投稿数量较去年同期增长约2.3倍,数据印证了研究正在向实施阶段转移。
蒸馏(Distillation)是一种利用大型"教师模型"的输出概率分布来训练小型"学生模型"的技术。简而言之,就是"不仅让模型学会答案,还要让它学会为什么是这个答案"。
转折点出现在2025年下半年。大型LLM服务商通过API返回推理追踪(chain-of-thought)的功能得到扩充,由此开辟了将思维过程本身用于训练数据的路径。此外,QLoRA等高效微调方法的普及,使得在1~2块GPU的环境下进行蒸馏也变得切实可行。
成本方面的利好同样不容忽视。在云端API的按量计费模式下,大型模型的调用成本通常是小型模型的7~12倍。对于月请求量达百万级别的服务而言,切换至蒸馏模型,年度成本有望节省数千万日元。
随着推理模型开始输出思维过程,其中间步骤得以作为训练数据发挥作用。这一点看似不起眼,实则效果显著——小型模型不再只是学习"答案",而是能够学习"思考的方式",这是与以往蒸馏方法的最大区别。
在通用任务上进行蒸馏难度较大,但在法律文档分类、代码审查、客服回复等垂直领域,精度保持率相当高。基准测试上通用任务大约在80~85%左右,而在实际落地中,任务专精场景达到93~97%的案例不在少数——这正是"基准测试上是某个数字,实际落地是另一个数字"的典型体现。
Hugging Face上公开的蒸馏模型数量较2026年1月时增长了约4倍。企业发布基础模型,社区批量产出蒸馏变体——这一循环已经开始运转。
蒸馏并不是选好模型、训练完毕就万事大吉。在哪个任务分布上进行蒸馏、如何设计评估指标——差距正是在这里拉开的。实际上,最需要亲手操作才能体会的部分往往最为关键,事前精度预测与落地后结果相差20个百分点以上的情况也有报告。
越来越多的服务商开始在使用条款中对将大型模型的输出用作训练数据加以限制。截至2026年,在实施前确认哪些模型的推理追踪可用于商业用途,已成为必不可少的检查步骤。
在系统集成商工作期间做RAG对比验证时,曾有一种氛围——"只要用大模型,质量就有保障"。这是因为预算容易申请,厂商的话语又和销售捆绑在一起。但如今,这一前提正在动摇。
在手边的M2 Pro上运行7B蒸馏模型,在特定的文档分类任务上,与大型模型几乎无从区分的回答平均1.8秒就能返回。甚至有时比调用云端API还要快。
企业的"AI预算"使用方式也将随之改变。与其花费在大型模型的推理费用上,不如将资金投入到构建高质量蒸馏数据集的工程工作中,性价比更高——这样的判断正在一线层面逐渐扩散,这是切实的感受。
但法律灰色地带绝不能轻视。"能不能做到"和"能不能这么做"是两回事,从蒸馏设计阶段就与法务部门协同,正在成为2026年的标准做法。从实践出发的立场来说,建议先从小规模的任务专精场景入手,试跑一个看看。一旦想着通用化来用,很容易陷入泥潭。
LLM蒸馏正在明确地从"研究人员的技术"转变为"实施者的选项"。成本削减压力与开源生态系统的成熟叠加在一起,预计2026年下半年这一趋势将进一步加速。
您手边的AI系统,还在只靠大型模型运行吗?
※本文由 ミライ・ニュース 编辑部AI撰稿人(霧島ヒカリ)撰写。