Sakana AI「KAME」— 음성 AI가 말하면서 생각한다
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
「AI에게 질문했는데 생각하는 시간이 걸려서 대화가 어색하다」고 느낀 적 있으신가요? 이것은 음성 AI가 안고 있는 근본적인 모순——빠르게 답할 것인가, 똑똑하게 답할 것인가——에서 비롯되는 문제입니다. 2026년 5월 3일, 도쿄 기반 AI 연구소 Sakana AI가 이 딜레마를 해결하는 「KAME(카메)」를 공개했습니다.
KAME(Knowledge-Access Model Extension)는 일본어로 「거북이(亀)」를 의미합니다.
이름과 달리, 그 동작은 매우 빠른 것이 특징입니다.
Sakana AI가 2026년 5월 3일에 공개한 KAME는 실시간 음성 대화 AI입니다. ICASSP 2026이라는 음성·신호처리 분야의 최상위 국제 학회에 채택된 논문(arXiv:2510.02327)을 기반으로 개발되었습니다.
기존 음성 AI는 「먼저 전부 생각하고 나서 말하는」 방식이었습니다. KAME는 다릅니다. 「말하면서 동시에 계속 생각하는」 새로운 방식을 채택하고 있습니다.
이 구조 덕분에 응답 속도를 희생하지 않으면서도 깊은 지식을 갖춘 답변이 가능해졌습니다.
Sakana AI는 도쿄를 거점으로 하는 연구 중심 AI 스타트업입니다.
Google 등 대형 기업 출신 연구자들이 설립했으며, 일본어 특화 모델 「Namazu」나 「진화적 모델 병합(Evolutionary Model Merge)」 등 업계를 놀라게 한 연구를 잇달아 발표해왔습니다.
이번 KAME도 그 흐름을 잇는 성과로, 음성 AI 분야에 새로운 패러다임을 가져오고 있습니다.
음성 AI는 크게 두 가지 방식으로 나뉩니다.
첫 번째는 「캐스케이드형」입니다. 사용자의 음성을 텍스트로 변환(STT)→ LLM으로 추론 → 텍스트를 음성으로 변환(TTS)이라는 3단계 처리를 순서대로 수행합니다.
캐스케이드형은 높은 정밀도의 답변이 가능한 반면, 응답까지 2초 이상 걸리는 경우가 많아 대화의 템포가 손상됩니다. 대표 사례인 Unmute는 중앙값 기준 2.1초의 응답 대기 시간이 있습니다.
두 번째는 「엔드 투 엔드형」입니다. 음성을 음성으로 직접 처리하므로 응답이 매우 빠릅니다.
하지만 엔드 투 엔드형은 대규모 언어 모델의 풍부한 지식을 활용하기 어렵고, 깊은 추론이 필요한 질문에는 약한 경향이 있습니다. 대표적인 Moshi의 MT-Bench 점수는 불과 2.05로, 지식 품질의 과제가 명확합니다.
Sakana AI는 이 트레이드오프를 「Think then speak(생각하고 나서 말하기)」 vs. 「Speak while thinking(말하면서 생각하기)」로 표현하고 있습니다.
KAME가 목표로 한 것은, 엔드 투 엔드형의 속도를 유지하면서 캐스케이드형의 지식 품질에 가까워지는 것입니다.
그 답이 바로 탠덤 아키텍처입니다.
KAME는 두 개의 컴포넌트가 병렬로 동작합니다.
「프론트엔드 S2S(음성→음성)모델」과 「백엔드 텍스트 LLM」이 비동기로 동작하며, 각각의 장점을 결합하는 구조입니다.
프론트엔드는 Moshi의 아키텍처를 기반으로 하며, 사용자가 말하는 도중부터 즉시 음성을 처리합니다. 응답 지연은 거의 제로입니다.
백엔드에는 GPT-4.1·Claude Opus 4.1·Gemini 2.5 Flash 등 원하는 대규모 LLM을 연결할 수 있습니다. 백엔드는 비동기로 깊은 추론을 수행하고, 그 결과를 「오라클(oracle:예언)」로서 프론트엔드에 수시로 전달합니다.
Moshi는 원래 입력 음성·내부 사고 텍스트·출력 음성의 3가지 스트림(데이터 흐름)을 갖고 있었습니다.
KAME는 여기에 「오라클 스트림」이라는 네 번째 스트림을 추가했습니다.
동작 방식은 이렇습니다. 사용자가 말하면 STT 컴포넌트가 부분적인 텍스트 전사를 수시로 생성하여 백엔드 LLM에 전송합니다. LLM은 그 단편적인 입력으로부터 「이런 질문일 것이다」라고 추측하고, 후보 답변(오라클)을 프론트엔드에 반환합니다.
프론트엔드는 오라클을 받아 자신의 음성 출력을 그 오라클에 가깝게 조정합니다. 백엔드가 업데이트될 때마다 음성의 방향성이 정교해지는 구조입니다.
이 구조를 작동시키려면, 프론트엔드 모델이 「도중에 전달되는 오라클」을 활용하는 특별한 훈련이 필요합니다.
Sakana AI가 고안한 「Simulated Oracle Augmentation(모의 오라클 보강)」이라는 기법으로, 56,582건의 합성 대화 데이터를 통해 학습시켰습니다.
학습 데이터는 MMLU-Pro·GSM8K·HSSBench라는 유명한 벤치마크 데이터셋을 대화 형식으로 변환하고, TTS(음성 합성)로 음성화한 것입니다.
KAME의 성능을 측정한 지표 중 하나가 「MT-Bench」입니다. 멀티턴 대화(여러 번의 주고받기)에서 추론·STEM·인문과학의 품질을 0~10점으로 평가하는 벤치마크입니다.
베이스라인인 Moshi의 MT-Bench 점수는 2.05였습니다. KAME는 이를 6.43까지 끌어올렸습니다——3배 이상의 향상입니다.
세부 점수를 보면, 추론 6.48점·STEM 8.34점·인문과학 8.56점으로, 총평균은 7.79점(GPT-4.1 백엔드 사용 시). 비교 대상인 Unmute는 7.70점이므로, 거의 동등한 지식 품질에 도달했습니다.
주목할 점은 점수만이 아니라 응답 속도와의 양립입니다.
KAME의 응답 지연은 중앙값 기준 거의 제로 초——Moshi와 거의 동일한 수준을 유지하고 있습니다.
반면 Unmute의 응답 대기 시간은 중앙값 2.1초. KAME는 Unmute에 가까운 지식 품질을 Unmute보다 훨씬 낮은 지연으로 실현하고 있습니다.
| 모델 | MT-Bench 점수 | 응답 지연 |
|---|---|---|
| Moshi(베이스라인) | 2.05 | 거의 제로 |
| KAME(GPT-4.1 백엔드) | 6.43 | 거의 제로 |
| KAME(Claude Opus 4.1 백엔드) | 6.23 | 거의 제로 |
| Unmute(캐스케이드형) | 7.70 | 2.1초 |
KAME의 또 다른 특징은, 백엔드 LLM을 재훈련 없이 교체할 수 있다는 점입니다.
프론트엔드는 gpt-4.1-nano로 훈련되었지만, 추론 시에는 GPT-4.1·Claude Opus 4.1·Gemini 2.5 Flash 등 임의의 LLM에 연결할 수 있습니다.
용도에 따라 정밀도 중시 모델과 비용 중시 경량 모델을 구분해 사용할 수 있는 유연성은 비즈니스 활용에서 큰 장점이 됩니다.
KAME는 MIT 라이선스로 완전 무상 공개되어 있습니다.
추론 코드는 「SakanaAI/kame」, 파인튜닝 코드는 「SakanaAI/kame_finetune」으로 GitHub에 공개되어 있으며, 모델 가중치는 Hugging Face 「SakanaAI/kame」에서 다운로드 가능합니다.
Python 패키지로 제공되며, 설치 후 server_oracle.py를 실행하는 것만으로 오라클 가이드 대화를 체험할 수 있습니다.
Simulated Oracle Augmentation을 이용한 파인튜닝 파이프라인도 공개되어 있어, 독자적인 데이터로 새로운 프론트엔드 모델을 훈련할 수 있습니다.
KAME를 개발한 Sakana AI는 도쿄를 거점으로 하는 일본 발 AI 연구소입니다.
ICASSP 2026이라는 음성·신호처리 분야의 최상위 국제 학회에 채택됨으로써, 이 연구는 세계적으로 인정받은 성과가 되었습니다.
일본은 실시간 번역·접객 로봇·의료 문진 AI 등 고정밀 음성 AI에 대한 수요가 높은 분야를 많이 보유하고 있습니다. KAME의 아키텍처는 이러한 영역에 직접 응용될 가능성이 있습니다.
실제 비즈니스 활용을 상상해보겠습니다.
어떤 콜센터 운영 기업이 AI를 통한 자동 응대 시스템을 도입하려 합니다. 기존 캐스케이드형 AI에서는 「잠시만 기다려 주세요」라는 침묵이 2초 이상 이어지며 고객 만족도가 낮아졌습니다. KAME의 탠덤 방식이라면 즉시 대화를 시작하면서, 백엔드 LLM이 정확한 정보를 병렬로 전달합니다.
레스토랑 예약·변경·취소를 처리하는 접객 AI에서도, 「빈 자리를 확인하면서 답변하는」 것이 자연스러운 대화 템포로 실현될 수 있습니다.
고령자 대상 건강 상담 AI에서는, 응답이 느리면 「고장났다」고 오해받는 경우가 있습니다. KAME의 제로 지연 특성은 IT에 익숙하지 않은 사용자층으로의 보급을 뒷받침합니다.
OpenAI의 GPT-4o에도 「Advanced Voice Mode」라는 고품질 음성 대화 기능이 있습니다.
GPT-4o Voice는 고품질이지만, OpenAI 서비스에 의존하는 닫힌 시스템입니다. KAME는 오픈소스로, 백엔드 LLM을 자유롭게 선택할 수 있는 열린 아키텍처입니다.
프라이버시 측면에서도, 자사 인프라 위에서 KAME를 구동하면 대화 데이터가 외부로 나가지 않는다는 장점이 있습니다. 의료·금융·법무 등 기밀 정보를 다루는 업종에서의 채택에 적합합니다.
A. 현재 공개된 KAME의 프론트엔드 모델은 영어 기반 학습 데이터로 훈련되어 있습니다.
다만, 백엔드 LLM에 일본어 지원 모델을 연결하는 것은 기술적으로 가능합니다. Sakana AI는 일본어 AI 연구 실적도 있어, 향후 일본어 버전 출시에 대한 기대가 높아지고 있습니다.
A. 프론트엔드 S2S 모델은 Moshi 기반으로 비교적 경량이므로, 소비자용 GPU에서도 동작합니다.
백엔드 LLM을 API 경유(GPT-4.1이나 Claude Opus 4.1)로 호출하는 경우에는 GPU가 불필요하며, API 키만으로 이용할 수 있습니다. 자체 LLM을 로컬에서 구동하고 싶은 경우에는 그에 맞는 GPU가 필요합니다.
A. KAME의 코드는 MIT 라이선스로 공개되어 있으며, 상업적 이용도 가능합니다.
연결하는 백엔드 LLM(GPT-4.1 등)의 이용 약관은 별도로 확인이 필요합니다. 자체적으로 파인튜닝한 모델을 백엔드에 사용하면, 완전히 통제 가능한 구성도 만들 수 있습니다.
A. Moshi는 실시간 S2S 모델 본체입니다. KAME는 Moshi에 「오라클 스트림」을 추가하여 백엔드 LLM의 지식을 주입할 수 있게 한 확장 프레임워크입니다.
MT-Bench 점수는 2.05(Moshi)→ 6.43(KAME)으로 3배 이상 향상되었으며, KAME는 Moshi를 더 똑똑하게 만드는 구조입니다.
Sakana AI의 KAME는 「빠르고 똑똑한 음성 AI」라는 모순을 기술로 해소한 혁신적인 성과입니다. 먼저 GitHub(SakanaAI/kame)에 접속하여 자신의 환경에서 직접 구동해보는 것이 첫 번째 걸음이 될 것입니다.
이 기사는 AI Friends 의 크로스포스트입니다.