Hugging Face, TTS 평가 기준 통일… 8000개 모델 랭킹화
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
이 글에서 알 수 있는 것
Hugging Face가 2026년 9월 30일, 음성 합성 AI(TTS)의 성능을 비교할 수 있는 'Open TTS Leaderboard'를 공개했습니다. TTS란 '텍스트를 사람과 같은 음성으로 변환하는 기술'을 말합니다.
현재 Hugging Face 플랫폼에는 8000개가 넘는 TTS 모델이 공개되어 있습니다. 그러나 평가 방식이 제각각이어서 '어떤 것이 정말 우수한가'를 비교하기 어려운 상황이었습니다.
이번 리더보드는 모든 모델을 동일한 기준으로 측정해 랭킹 형식으로 공개하는 것입니다. 즉, AI 음성 품질을 비교하는 '공통된 잣대'가 처음으로 탄생한 셈입니다.
기존 음성 합성 AI 평가는 주로 두 가지 방식으로 이루어졌습니다. 첫 번째는 '사람에 의한 투표'입니다. 예를 들어 TTS Arena v2나 Voice Arena에서는 여러 음성을 들으며 마음에 드는 것에 투표하는 방식이 활용되었습니다.
그러나 이 방식에는 약점이 있었습니다. 사람의 취향은 시간이나 기분에 따라 달라지기 때문에, 동일한 사람도 투표 결과가 일관되지 않을 수 있었습니다. 또한 결과가 나오기까지 몇 주가 걸리는 것도 과제였습니다.
두 번째 문제는 '영어 중심의 평가'입니다. 많은 리더보드가 영어로만 성능을 측정했습니다. 영어에서 고성능이더라도 일본어나 중국어에서는 품질이 떨어지는 경우가 많아, 실제 사용감과 괴리가 생겼습니다.
Open TTS Leaderboard는 이러한 문제들을 '객관적인 수치 지표'와 '다국어 지원'으로 해결했습니다. 평가에 걸리는 시간도 몇 주에서 몇 시간으로 대폭 단축되었습니다.
Open TTS Leaderboard에서는 5가지 지표로 모델을 평가합니다. 각각 무엇을 측정하는지 살펴보겠습니다.
1. WER / CER(명료성)
생성된 음성이 얼마나 정확하게 들리는지를 측정하는 지표입니다. WER은 Word Error Rate(단어 오류율), CER은 Character Error Rate(문자 오류율)의 약자입니다. 영어 등은 WER, 일본어나 중국어는 CER로 평가됩니다. 수치가 낮을수록 명료한 음성입니다.
2. RTFx(배치 처리 속도)
Real-Time Factor의 약자로, 1초분의 음성을 생성하는 데 몇 초가 걸리는지를 나타냅니다. 예를 들어 RTFx가 0.5라면, 1초짜리 음성을 0.5초 만에 만들 수 있다는 의미입니다. 수치가 작을수록 빠릅니다.
3. TTFA(스트리밍 지연)
Time To First Audio의 약자로, 음성 생성을 시작한 후 첫 소리가 나오기까지의 시간입니다. 실시간 대화 AI나 음성 어시스턴트에서는 이 수치가 작을수록 더 자연스러운 대화가 가능합니다.
4. SIM(화자 유사도)
Speaker Similarity의 약자로, 음성 클론 기능(특정 사람의 목소리를 재현하는 기능)의 정확도를 측정합니다. 원본 목소리와 생성된 목소리가 얼마나 비슷한지를 0에서 1 사이의 수치로 나타내며, 1에 가까울수록 유사합니다.
5. 모델 크기
AI 모델의 데이터 용량입니다. 작은 모델일수록 경량화되어 스마트폰이나 PC에서도 구동하기 쉬워집니다. 다만, 성능과의 균형이 중요합니다.
이 지표들은 GPU H200이라는 고성능 컴퓨터나 일반 CPU에서 측정됩니다. 실제 사용 환경에 가까운 조건에서 테스트된다는 점이 핵심입니다.
Open TTS Leaderboard는 일본어에도 대응합니다. 평가 데이터셋으로는 'Seed TTS Eval'과 'CV3 Eval'이 사용되며, 여러 언어로 성능을 측정할 수 있습니다.
2026년 일본어 TTS 시장은 활기를 띠고 있습니다. 예를 들어 Google의 Gemini 3.8 TTS는 Voice Arena의 블라인드 평가에서 일본어 9개 모델 중 1위를 차지했습니다. 또한 Alibaba 산하 연구 기관이 발표한 Qwen-Audio-3.0-TTS도 일본어를 포함한 16개 언어를 지원하며 종합 랭킹 1위에 올랐습니다.
일본에서 개발된 모델도 등장하고 있습니다. 'Irodori-TTS-v4-Large'는 33억 파라미터의 일본어 특화 모델로, 제로샷 음성 클론(소량의 음성 샘플로 목소리를 재현하는 기능)과 이모지를 활용한 감정 제어가 가능합니다.
주목할 점은 다국어 모델과 일본어 특화 모델의 품질 차이가 줄어들고 있다는 것입니다. 이전에는 일본어 전용 모델이 아니면 품질이 떨어지는 경향이 있었지만, 최신 다국어 모델은 일본어에서도 충분히 실용적인 수준에 도달했습니다.
음성 클론 기술은 이미 비즈니스 현장에서 활용되고 있습니다. 대표적인 사례 3가지를 소개합니다.
나레이션 제작의 효율화
나레이터가 자신의 목소리를 AI에 등록해 두면, 대본 수정이 있을 때 변경된 부분만 자동으로 생성할 수 있습니다. 녹음 스튜디오 섭외나 재녹음이 불필요해져 비용과 납기를 대폭 줄일 수 있습니다.
이러닝 교재의 대량 제작
사내 연수나 교육 콘텐츠를 강사의 목소리로 자동 생성할 수 있습니다. 예를 들어, 강사가 부재 중에도 새로운 교재를 추가하거나 내용을 업데이트할 수 있어 교육 부서의 부담이 줄어듭니다.
고객 지원 자동화
IVR(자동 음성 응답 시스템)에 음성 클론을 적용하면, 기업 대표자나 캐릭터의 목소리로 안내할 수 있습니다. 브랜드 이미지를 유지하면서 24시간 365일 대응이 가능해집니다.
2026년 현재, 불과 3초에서 30초의 음성 샘플만으로 고정밀 클론을 만드는 '제로샷 클론' 기술이 실용 수준에 도달했습니다. ElevenLabs의 Instant Voice Cloning 등 개인도 활용할 수 있는 도구가 늘어나며 도입 장벽이 낮아지고 있습니다.
Open TTS Leaderboard의 등장은 음성 AI 시장에 두 가지 변화를 가져올 것으로 예상됩니다.
첫 번째는 '개발 경쟁의 가속화'입니다. 공통 평가 기준이 생김으로써 개발자들이 명확한 목표를 가지고 모델을 개선할 수 있게 되었습니다. 랭킹 상위를 목표로 하는 경쟁이 활발해지며 기술 혁신의 속도가 빨라질 것입니다.
두 번째는 '선택의 투명성'입니다. 기업이 TTS 모델을 선택할 때 지금까지는 시행착오가 필요했습니다. 그러나 리더보드에서 성능과 비용의 균형을 한눈에 비교할 수 있게 되어, 도입 의사결정이 원활해질 것입니다.
Hugging Face는 앞으로 평가 스크립트를 오픈소스화하고, 새로운 데이터셋과 지표를 추가할 예정입니다. 커뮤니티 피드백을 수렴하는 체계도 갖추고 있어, 리더보드 자체가 계속 진화하는 구조로 되어 있습니다.
이 글은 AI Friends 에서 크로스포스트한 글입니다.