VUI Labs 自研语音生成模型 Luna-TTS,近期在两大全球主流真人盲听榜单中分列第一第三,跻身全球第一梯队。
01 一场“蒙住眼睛”的全球语音比赛
在 Hugging Face TTS Arena 中,Luna-TTS 与 ElevenLabs、Cartesia、Hume 等全球主流语音模型同台竞技,并荣登 Rating 总榜第一。
与此同时,在独立 AI Benchmark 平台 Artificial Analysis 的 Provider Voice TTS 榜单中,Luna-TTS 位列全球第 3,排名超过 Google Gemini、StepAudio 等主流模型。
两个榜单的评测机制有所不同,但都把真实用户的听感放在核心位置:面对同一文本生成的语音,用户在不知道模型和品牌的情况下进行盲听选择。
在这场声音的赛场,Luna-TTS 走在了全球最前列。
长期以来,如何有效评估 TTS 模型效果一直是个难题。
字错率等客观指标主要衡量语音内容是否准确,难以反映自然度、韵律和情感表达等听感差异。传统实验室 MOS 主观评测虽然能够补充人耳评价,但受测试样本规模、用户群体和实验环境等因素限制,也难以充分代表更广泛用户在真实使用中的听觉偏好。
Hugging Face TTS Arena 和 Artificial Analysis 都选择了一种更直接的方式:让全球真实用户在平台进行匿名盲听,对不同模型生成的语音进行比较并选择自己的偏好。
所以全球用户的每一次选择,都会被记录为两款模型之间的一次正面对决。
02 为什么是 Luna-TTS?
两大榜单的盲测都是只听声音,不看品牌。Luna-TTS 能够拿下第一,不是依靠某个独立参数,而是因为它在“像真人”所需要的五个层面上同时做到了自然与稳定。
说得准确
发音、断句和语句衔接是自然表达的基础。面对随机的一段文本,Luna-TTS 都能够保持清晰、连贯,不让读音错误打断听感。
Ladies and gentlemen, attention please. This is the boarding announcement for flight 123 to New York. We are now boarding at gate B15.
音频时长:00:09
理解一句话应该怎么说
真人不会平均地念出每个字,而会根据语义决定哪里停顿、哪个词重读、语速何时变化。Luna-TTS 能够让韵律跟随内容,让声音拥有自然的重点和节奏。
At first, the sea was perfectly calm, with only a light breeze brushing against the boat. Then, just as the sun began to rise, a pod of dolphins suddenly broke the surface—racing through the waves, one after another.
音频时长:00:15
让情绪真正进入表达
同一句话,在惊喜、克制、失落或调侃的状态下,会呈现完全不同的声音。Luna-TTS 支持多音色与情感控制,让音高、力度、节奏和句尾共同服务于语义,而不是简单地为声音添加“情绪标签”。
You actually remembered.
音频时长:00:07
会保留人类说话的细节
换气、犹豫、轻笑、叹气,以及说话过程中细微的情绪变化,构成了真实交流的质感。Luna-TTS 让这些没有写进文字里的信息自然出现在声音中,减少机械朗读的痕迹。
You actually kept this photo. I thought you'd lost it years ago. Thank you, really.
音频时长:00:06
长文本语音表达依然稳定
短句自然只是起点。面对有声书、播客、短剧和多角色内容,Luna-TTS 能够在长时间中保持音色、角色和表达风格的一致,持续完成连贯的声音表达。
When the rain stopped, a thin veil of mist still hung over the valley. Evan opened the cabin window and watched the village lights come on one by one, suddenly remembering what his mother had told him before she left: when the road ahead is unclear, keep moving forward, one step at a time. He slipped the unsent letter into his bag and set out along the river before darkness fully fell; the lights behind him slowly faded, while the sound of water grew louder in the distance.
音频时长:00:33
这五种能力共同构成了 Luna-TTS 对自然表达的理解:不仅把文字准确地读出来,也尽可能贴近真人说话时的节奏、情绪和细节。
Hugging Face TTS Arena 和 Artificial Analysis 的匿名盲听结果,为 Luna-TTS 提供了一次来自真实用户的阶段性验证。
更多 Luna-TTS 作品欢迎进入 VUI Labs 微信视频号了解
03 从语音大模型到实时 Voice Agent
Luna-TTS 在语音自然度与人类听感上的领先表现只是我们在语音交互链路的起点。
以 Luna 语音基座为核心,我们将语音理解、语音生成与实时交互能力,通过模型 API、创作者和开发者平台、语音 Agent 平台,接入电话、App、智能硬件与企业业务系统。
我们的长期方向是让语音 Agent 真正进入业务流程:理解用户需求、连接知识与信息、调用工具,并交付可记录、可复盘、可持续优化的结果。
从 Voice Generation 走向 Voice Interaction,VUI Labs 将持续推动语音成为连接用户、Agent、设备与业务系统的新入口。
让 AI 真正能听、会说、懂场景、会行动。
04 全球领先,只是起点
一次阶段性的榜单领先,是全球用户对 Luna-TTS 的公开选择,也是 VUI Labs 继续向前的起点。
接下来,我们仍会继续打磨声音的自然度、稳定性与表达边界,让 Luna-TTS 在更长的文本、更复杂的语境和更丰富的情绪中,都能把每句话说得更拟人、更自然、更细腻。