Hugging Face统一TTS评估标准,8000个模型完成排行榜化
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
本文要点
Hugging Face 于2026年9月30日发布了"Open TTS Leaderboard",可用于比较语音合成AI(TTS)的性能。TTS 是指"将文本转换为类似人类语音的技术"。
目前,Hugging Face 平台上已公开超过8000个TTS模型。然而,由于评估方法各不相同,很难判断"哪个模型才是真正优秀的"。
本次排行榜将所有模型按照统一标准进行测量,并以排名形式公开。换言之,这是首次诞生了比较AI语音质量的"共同衡量尺度"。
以往对语音合成AI的评估,主要通过两种方式进行。第一种是"人工投票"。例如在 TTS Arena v2 和 Voice Arena 中,采用的是让用户对比收听多段语音后投票选出喜欢的方式。
然而这种方法存在弱点。由于人的喜好随时间和心情而变化,同一个人的投票结果也可能缺乏一致性。此外,等待结果需要数周时间也是一大问题。
第二个问题是"以英语为中心的评估"。许多排行榜仅以英语衡量模型性能。即使英语表现优异,日语或中文的质量往往有所下降,与实际使用体验之间存在落差。
Open TTS Leaderboard 通过"客观数值指标"与"多语言支持"解决了上述问题。评估所需时间也从数周大幅缩短至数小时。
Open TTS Leaderboard 通过5项指标对模型进行评估。下面逐一介绍各项指标的测量内容。
1. WER / CER(清晰度)
衡量生成语音的可听清程度。WER 是 Word Error Rate(词错误率)的缩写,CER 是 Character Error Rate(字符错误率)的缩写。英语等语言使用WER评估,日语和中文使用CER评估。数值越低,语音越清晰。
2. RTFx(批处理速度)
Real-Time Factor 的缩写,表示生成1秒音频所需的时间。例如RTFx为0.5,意味着可以在0.5秒内生成1秒的语音。数值越小,速度越快。
3. TTFA(流式传输延迟)
Time To First Audio 的缩写,指从开始生成语音到输出第一个声音所需的时间。对于实时对话AI和语音助手而言,该数值越小,对话越流畅。
4. SIM(说话人相似度)
Speaker Similarity 的缩写,用于衡量声音克隆功能(还原特定人声的功能)的精度。以0到1的数值表示原始声音与生成声音的相似程度,越接近1表示越相似。
5. 模型大小
AI模型的数据量。模型越小,越轻量,也越容易在智能手机或电脑上运行。但性能与大小之间的平衡至关重要。
上述指标在 GPU H200 等高性能计算机或普通CPU上进行测量,测试条件贴近实际使用环境,这一点尤为关键。
Open TTS Leaderboard 也支持日语评估。评估数据集使用"Seed TTS Eval"和"CV3 Eval",可对多种语言的性能进行测量。
2026年的日语TTS市场十分活跃。例如,Google 的 Gemini 3.8 TTS 在 Voice Arena 的盲测评估中,从9个日语模型中荣登第一。此外,阿里巴巴旗下研究机构发布的 Qwen-Audio-3.0-TTS 支持包括日语在内的16种语言,并在综合排名中位居榜首。
日本本土模型也相继涌现。"Irodori-TTS-v4-Large"是一个拥有33亿参数的日语专用模型,支持零样本声音克隆(从少量语音样本还原声音的功能)以及通过表情符号进行情感控制。
值得关注的是,多语言模型与日语专用模型之间的质量差距正在缩小。过去,非日语专用模型的质量往往有所下降,但最新的多语言模型在日语上也已达到充分实用的水平。
声音克隆技术已在日本商业实践中得到应用。以下介绍三个典型案例。
配音制作的效率化
配音演员只需提前将自己的声音注册到AI中,即使台本有所修改,也可自动生成差异部分。无需安排录音棚或重新录音,大幅降低成本并缩短交付周期。
在线学习教材的批量生产
可用讲师的声音自动生成企业内部培训或教育内容。例如,即使讲师不在场,也可以添加新教材或更新内容,从而减轻教育部门的负担。
客户支持自动化
将声音克隆集成到IVR(自动语音应答系统)中,即可用企业代表或品牌形象角色的声音提供服务。在保持品牌形象的同时,实现全年365天、每天24小时的服务响应。
截至2026年,仅需3秒至30秒的语音样本即可制作高精度克隆的"零样本克隆"技术已达到实用水平。ElevenLabs 的 Instant Voice Cloning 等个人可用的工具日益增多,应用门槛持续降低。
Open TTS Leaderboard 的出现,预计将为语音AI市场带来两方面变化。
第一是"开发竞争的加速"。有了统一的评估标准,开发者可以设定明确目标并持续优化模型。争夺排行榜前列的竞争将愈发激烈,技术创新的速度也将随之提升。
第二是"选择的透明性"。以往企业在选择TTS模型时,往往需要反复试错。而排行榜让用户能够直观比较性能与成本的平衡,使引入决策更加顺畅。
Hugging Face 计划未来将评估脚本开源,并添加新的数据集和指标。同时也建立了接受社区反馈的机制,排行榜本身将持续演进迭代。
本文转载自 AI Friends。