Sakana AI「KAME」——语音AI边说边思考
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
您是否曾有过「向AI提问后,因为思考时间太长而导致对话不自然」的感受?这是语音AI所面临的根本矛盾——快速回答还是智慧回答——所带来的问题。2026年5月3日,东京AI研究所Sakana AI发布了解决这一困境的「KAME(龟)」。
KAME(Knowledge-Access Model Extension)在日语中意为「龟」。
与其名称相反,它的运行速度非常快。
Sakana AI于2026年5月3日发布的KAME是一款实时语音对话AI,基于被ICASSP 2026(语音与信号处理领域顶级国际会议)收录的论文(arXiv:2510.02327)开发。
传统语音AI采用「先全部思考完再开口说话」的方式。KAME则不同,它采用「边说话边持续思考」的全新方式。
这一机制使其在不牺牲响应速度的前提下,能够给出具备深度知识的回答。
Sakana AI是一家总部位于东京、以研究为导向的AI初创公司。
由来自谷歌等大型企业的研究人员创立,先后发布了日语专属模型「Namazu」和「进化式模型融合(Evolutionary Model Merge)」等令业界瞩目的研究成果。
此次KAME同样延续了这一脉络,为语音AI领域带来了全新范式。
语音AI大致分为两种方式。
第一种是「级联型」。按顺序执行三个阶段的处理:将用户语音转换为文本(STT)→通过LLM进行推理→将文本转换为语音(TTS)。
级联型虽然能给出高精度回答,但响应往往需要2秒以上,破坏了对话节奏。代表性产品Unmute的响应等待时间中位数为2.1秒。
第二种是「端到端型」。直接将语音作为语音处理,因此响应速度极快。
然而端到端型难以充分利用大型语言模型的丰富知识,面对需要深度推理的问题时表现较弱。代表性产品Moshi的MT-Bench得分仅为2.05,知识质量方面的不足显而易见。
Sakana AI将这一权衡表述为「Think then speak(想完再说)」vs.「Speak while thinking(边说边想)」。
KAME的目标是在保持端到端型速度的同时,向级联型的知识质量靠拢。
其答案便是串联架构(Tandem Architecture)。
KAME由两个组件并行运行。
「前端S2S(语音→语音)模型」与「后端文本LLM」异步运行,结合各自的优势。
前端基于Moshi的架构,在用户说话的同时即刻处理语音,响应延迟几乎为零。
后端可接入GPT-4.1、Claude Opus 4.1、Gemini 2.5 Flash等任意大型LLM。后端异步进行深度推理,并将结果作为「oracle(预言)」随时注入前端。
Moshi原本拥有输入语音、内部思考文本、输出语音三条数据流。
KAME在此基础上增加了名为「oracle流」的第四条数据流。
其机制如下:用户说话时,STT组件随时生成部分文本转录并发送给后端LLM。LLM根据这些片段化的输入推测「这大概是这样的问题」,并将候选回答(oracle)返回给前端。
前端接收oracle后,调整自身的语音输出使其向该oracle靠拢。随着后端不断更新,语音方向也持续得到优化。
要使这一机制运转,前端模型需要经过特殊训练,以便能够灵活运用「途中传来的oracle」。
Sakana AI提出了「Simulated Oracle Augmentation(模拟oracle增强)」方法,利用56,582条合成对话数据进行训练。
训练数据将MMLU-Pro、GSM8K、HSSBench等知名基准数据集转换为对话形式,再通过TTS(语音合成)转化为语音。
衡量KAME性能的指标之一是「MT-Bench」,这是一个以0~10分评估多轮对话中推理、STEM、人文科学质量的基准测试。
作为基线的Moshi的MT-Bench得分为2.05,KAME将其提升至6.43——提升超过3倍。
细分来看,推理6.48分、STEM 8.34分、人文科学8.56分,总平均7.79分(使用GPT-4.1后端时)。对比对象Unmute为7.70分,KAME已达到近乎相同的知识质量水平。
值得关注的不仅是得分,还有与响应速度的兼顾。
KAME的响应延迟中位数几乎为零秒——与Moshi保持相近水平。
而Unmute的响应等待时间中位数为2.1秒。KAME以远低于Unmute的延迟,实现了与Unmute相近的知识质量。
| 模型 | MT-Bench得分 | 响应延迟 |
|---|---|---|
| Moshi(基线) | 2.05 | 几乎为零 |
| KAME(GPT-4.1后端) | 6.43 | 几乎为零 |
| KAME(Claude Opus 4.1后端) | 6.23 | 几乎为零 |
| Unmute(级联型) | 7.70 | 2.1秒 |
KAME的另一大特点是无需重新训练即可替换后端LLM。
前端使用gpt-4.1-nano进行训练,但推理时可连接GPT-4.1、Claude Opus 4.1、Gemini 2.5 Flash等任意LLM。
根据用途灵活切换精度优先模型与成本优先轻量模型的灵活性,在商业应用中具有重要优势。
KAME以MIT许可证完全免费开放。
推理代码以「SakanaAI/kame」、微调代码以「SakanaAI/kame_finetune」发布于GitHub,模型权重可从Hugging Face「SakanaAI/kame」下载。
作为Python包提供,安装后只需运行server_oracle.py,即可体验带有oracle引导的对话。
基于Simulated Oracle Augmentation的微调流水线也已开放,可使用自定义数据训练新的前端模型。
开发KAME的Sakana AI是一家总部位于东京的日本AI研究所。
被ICASSP 2026这一语音与信号处理领域顶级国际会议收录,使这项研究成为得到全球认可的成果。
日本在实时翻译、接待机器人、医疗问诊AI等对高精度语音AI需求旺盛的领域拥有众多应用场景。KAME的架构具有直接应用于这些领域的潜力。
不妨想象一下实际的商业应用。
某呼叫中心运营企业希望引入AI自动应答系统。传统级联型AI会出现超过2秒的「请稍候」沉默,导致客户满意度下降。采用KAME的串联方式,可以立即开始对话,同时后端LLM并行输送准确信息。
在处理餐厅预订、修改、取消的接待AI中,「边确认空位边回答」也能以自然的对话节奏实现。
在面向老年人的健康咨询AI中,响应迟缓容易被误解为「故障」。KAME的零延迟特性有助于在不熟悉IT的用户群体中推广普及。
OpenAI的GPT-4o也具备名为「Advanced Voice Mode」的高质量语音对话功能。
GPT-4o Voice质量出色,但依赖于OpenAI服务,是一个封闭系统。KAME是开源的,具备可自由选择后端LLM的开放架构。
从隐私角度而言,在自有基础设施上运行KAME,对话数据不会流出外部,这是一大优势。适合医疗、金融、法务等处理机密信息的行业采用。
A. 目前发布的KAME前端模型使用基于英语的训练数据进行训练。
不过,在后端LLM接入支持日语的模型在技术上是可行的。Sakana AI在日语AI研究方面也有丰富经验,业界对未来日语版本的推出充满期待。
A. 前端S2S模型基于Moshi,相对轻量,消费级GPU也可运行。
若通过API调用后端LLM(GPT-4.1或Claude Opus 4.1),则无需GPU,只需API密钥即可使用。如需在本地运行自有LLM,则需要相应配置的GPU。
A. KAME的代码以MIT许可证开放,商业使用亦可。
所连接的后端LLM(如GPT-4.1)的使用条款需另行确认。若使用自行微调的模型作为后端,也可构建完全自主可控的架构。
A. Moshi是实时S2S模型本体。KAME是在Moshi基础上添加「oracle流」,使其能够注入后端LLM知识的扩展框架。
MT-Bench得分从2.05(Moshi)提升至6.43(KAME),提升超过3倍,KAME是让Moshi变得更智慧的机制。
Sakana AI的KAME是用技术化解「快速又智慧的语音AI」这一矛盾的革新性成果。首先访问GitHub(SakanaAI/kame),在自己的环境中运行体验,是迈出的第一步。
本文为 AI Friends 的转载文章。