- 48小时新闻排行
- 7天新闻排行
| 刚刚,「中国版Thinking Machines Lab」诞生! 全球语音与交互界,骤然杀出一家撼动格局的硬核AI初创。 它,就是宇生月伴(VUI Labs)。 在语音界最权威榜单之一的Hugging Face TTS Arena上,VUI Labs的Luna-TTS 模型力压群雄,击败了ElevenLabs,以及MiniMax、Cartesia等国内外明星大厂,强势登顶全球第一!
在独立AI评测平台Artificial Analysis的Speech Arena榜单上,它直接超越了谷歌,获得全球第三!
这家大放异彩的中国硬核 AI 初创公司,愿景清晰而宏大——从高精度的 TTS 语音模型切入,以语音作为最具自然感与即时性的交互入口,最终贯通多模态,打通全双工的 Voice Agent闭环。 无论是以语音为突破口构建新一代交互范式,还是通过实时语音反馈倒逼多模态基座能力的演进,它都展现出了与 Thinking Machines Lab 较为相似的路线。两家公司的路线,竟然不谋而合。 现在,VUI Labs拿出的语音模型发布不久,就一举横扫了全球权威榜单,锋芒毕露,势不可挡。 击败巨头登顶全球TOP 1, Luna-TTS 模型凭什么? 下面这段《人民的名义》中高育良和侯亮平的对话,背后到底是不是真人? 要是不告诉你答案,打赌你猜不出来。 同理,这个视频,也是真人AI傻傻分不清。 英文的球赛解说,对物理发声细节还原得很真实,听觉体验直接拉满。 给自然纪录片配音,毫无违和感,仿佛背后真有个配音演员。 用在科技旁白的解说里,也是十分丝滑。 为什么现在的语音 AI 已经很好听了,但在情绪激动时依然偏生硬,操着不自然的播音腔? 这并非主流的自回归(AR)模型不够强大,而是它「从左到右逐字生成」的文本逻辑,难以充分刻画声音中多个维度同时变化的复杂性。 人类说话时,情绪、音色、呼吸是全局交织的;而 AR 架构强制单向顺序生成,不仅拉高了长句的延迟,还极易引发「一步错、步步错」的累积误差。 为了突破这一机制天花板,VUI Labs 拿出的王牌 Luna-TTS,提供了一条全新的破局路线,彻底颠覆了这种传统架构。
Luna-TTS 把传统「逐Token生成语音」的路线,改造成了一套更像扩散模型的语音生成系统,同时还专门做了一条实时流式分支。 具体来说,它先把声音压缩成适合语言模型处理的离散Token,再让一个基于Qwen3改造的 Diffusion LM一次并行预测大量语音Token;需要实时对话时,则进一步改造成按块生成的Luna-TTS Realtime。 架构改造后,取得的结果惊人。
arxiv:https://arxiv.org/abs/2608.11593 github demo page:https://vuilabs-ai.github.io/luna-tts 六项指标全球第一 Luna-TTS在「像真人」的五个层面上,都做到了非常突出的自然与稳定。
它说得准确,发音、断句和语句衔接都很自然连贯。 它的语流中包含足够的抑扬顿挫,轻重缓急恰到好处。 更难得的是,它能根据不同语境切换情绪——在惊喜、克制、失落或调侃的状态下,会呈现完全不同的声音。每一句话,都仿佛带着温度。 人类的换气、犹豫、轻笑、叹气,以及说话过程中细微的情绪变化,构成了真实交流的质感,而Luna-TTS把这些信息,都呈现在了声音中。 即使是长语音文本,它也依然能稳定表达。 而且,它的音视频克隆能力也是直接拉满。只需几分钟的样本,就能复刻出说话人的音色、语气甚至呼吸节奏,简直以假乱真。 比如亮剑中经典的意大利炮情节。 以及诸葛亮在两军阵前痛斥王朗的名场面。 这段《教父》的汉化版配音,真的绝了,完全还原出了原配音中的味道,沧桑又有压迫感。 六个第一的含金量:四项语音质量指标+两项模型效率指标 在最新的技术报告中,Luna-TTS不仅在Seed-TTS-Eval评测中关于语音质量的四项指标全拿第一(显著优势超越了字节Seed、MiniMax、智谱和Qwen系列等),更是在「野外」复杂环境下的CV3-Eval评测中,展现了惊人的纠错与抗噪能力。
这四个第一,含金量超高。 除了语音质量的性能指标上,它还在首包延迟和实时率两个效率指标上,也是第一。 总结来说,就是语音质量最好、生成效率最高、首包延迟最低。
首包延迟全球第一
端到端实时率(RTF)位列第一 它到底牛在哪里?核心就在于以下突破。 架构演进:从预训练 AR 语言模型到 Block Diffusion 的「三步走」 在 TTS 领域,从基座语言模型初始化,是业界公认的有效范式。文本大模型天然具备强大的多语言文本理解、字词对齐、拼写规则以及复杂语种(如日韩语)的书写系统建模能力。 因此,团队并没有从头训练声学模型,而是从Qwen3-0.6B出发,设计了一套清晰的渐进式改造路线。
在 CV3-Eval 等 Benchmark 中,存在大量长句、不规则标点及复杂口语等「难文本」。 面对这种难文本,双向扩散架构是更合适的。 原因就在于,AR模型自身有很大的局限性。 自回归模型采用左到右的 Next-Token 预测,一旦前期采样出现微小偏差,错误就会在 Prefix 中永久冻结并滚雪球式累积,导致 TTS 常见的跳字、重复和吞音。 这就体现出了双向 Diffusion的优势:TTS 与自由文本生成不同,其输出音频的语义内容本质上被输入文本高度约束。 双向掩码扩散,允许模型在去噪过程中同时看到全局的过去和未来上下文,通过多步置信度精炼动态修正局部错误,这就大幅消除了暴露偏差。 Tokenizer 创新:Luna-Codec 的「语义锚定」与声学解耦 第二点,就是Tokenizer的创新。 在多码本 Residual Vector Quantization神经编解码器中,如果直接进行端到端重构训练,前几个码本(Codebooks)往往会过早卷入细微的频谱细节,导致文本向音频 Token 的预测极其不稳定。 为此,Luna-Codec采用了8 码本架构,在24kHz的采样率下达到了25Hz帧率(每秒 200 个 Token)。
在训练 Tokenizer 时,团队通过引入额外的预训练 WavLM 语义蒸馏 Loss,将语言/语义信息强行「锚定」在第一层码本(CB1)中。 CB1 负责提供稳定的语言/字音骨架,剩下的 CB2–CB8 码本则自由捕获音色、环境声道、情绪和韵律细节。 这种从「语义到声学」的层次化设计,大幅降低了扩散模型从文本预测完整音频网格的难度。 强化学习突破:离散掩码扩散模型上的 GRPO 迁移 Luna-TTS的核心算法创新之一,是将基于GRPO的强化学习后训练,成功迁移到非自回归离散掩码扩散模型上。 在传统的自回归语音模型中,策略梯度更新可以顺理成章地沿着「从左到右」的链式概率分解进行。 然而,Luna-TTS作为一个非自回归掩码扩散模型,是通过多步迭代去噪并行生成音频网格的,无法直接按链式法则计算输出概率。 为了破解这一难题,Luna-TTS成功将 GRPO 迁移到了离散掩码扩散模型上,其核心在于轨迹感知与字典序奖励。
Block Diffusion 与工程落地 为了满足全双工 Agent 和实时交互场景,团队提出了 Luna-TTS Realtime实时语音合成方案。
在这个过程中,语音不是逐帧生成的,而是切成一个个 1.28秒(32帧) 的小块。块之间采用自回归方式(支持KV Cache加速),块内部则用 8~16步并行去噪 一次生成32帧和8个码本,效率极高。 它的实测性能非常惊艳,在2张H20 GPU 上开启并行CFG部署时,首包延迟(TTFT)只需 41.6毫秒,就能生成并解码出第一个1.28秒的音频块,几乎感觉不到等待。 实时倍率(RTF)低至 0.024,也就是生成1秒语音仅需24毫秒,超过40倍实时速度,完全满足流畅对话需求。 为了让长文本朗读、全双工对话等商业化场景真正跑通,团队在工程侧做了几项关键配套。 比如,他们做了推理同步与显存优化,借助 vLLM-Omni 框架,实现显存解耦和流式Chunk递交,保证长时推理不爆显存、响应平稳。 另外,团队还做了文本正则化:针对特殊符号、数字等「模型容易读错」的文本,构建了一套完善的前端预处理模块,确保无论输入多复杂,模型都能「读得对、读得顺」。 数据工程与真实情感控制 Luna-TTS之所以能在对话听感和表现力上超越 ElevenLabs 等,核心在于百万小时级的极致数据工程与专项退火微调。 首先,在让模型学会「表达情感」之前,团队构建了一个规模高达100万小时的精调多语言语音语料库,涵盖了中文(43.4%)、英文(43.1%)以及日语和韩语(合计 13.6%)。 其次,团队精选出约10万小时的「极高质量」语音子集进行退火训练,极大提高了语音的保真度、鲁棒性和自然韵律。 最后,在第三阶段的训练中,团队引入了带有精细标注的表达性语音数据。 这些标注不光是简单的话语级情绪标签(如 [happy] 开心、[angry] 生气、[sad] 悲伤),更创新性地加入了行内非语言发音标签(NVV),例如 [laughs](笑声)、[sighs](叹息)、[gasps](喘息)、[coughs](咳嗽)等。
这些控制标签不是额外接个模块,而是直接当作文本提示输入给模型,不需要额外的风格编码器或控制头。 这样一来,模型就能在正确的文本位置,自然地带出呼吸、叹息、情绪起伏,听起来更像真人,而不是机械地念稿子。 就这样,Luna-TTS成功在TTS领域实现了「高品质表现力」与「工业级极低延迟」的统一。 它既有情感表现力,又能满足实时场景的低延迟要求,让扩散语音生成到达了新的天花板。 左手顶尖科学家,右手商业操盘手: 一支造梦铁军 在AI大模型这条拥挤的赛道上,拼算力、拼参数固然重要,但归根结底拼的是人。 VUI Labs之所以能在极短的时间内拿出登顶全球的技术,离不开豪华的核心团队。 如果用一个词来形容VUI Labs的基因,那就是:双核驱动。 其中一核,是绝对顶级的科研实力。 VUI Labs创始人兼董事长钱彦旻教授,是上海交通大学计算机学院和人工智能学院特聘教授。
这位年仅38岁就入选教育部长江学者的顶尖科学家,履历非常优秀:清华大学电子工程系博士,剑桥大学机器智能实验室博士后;国家优秀青年科学基金获得者;首位交大睿远青年科技奖-信息与空间奖得主。长期专注于语音对话与多模态交互技术的研究与产业化落地。 更以第一完成人的身份,斩获了中国人工智能界的最高荣誉——吴文俊人工智能自然科学一等奖。 在端到端语音模型这个细分且极具壁垒的领域,钱教授带领的科研团队近5年论文引用量高居全球第3、全国第1! 现在,他已经发表论文超350篇,Google Scholar引用超20,000次。在国际语音技术界,他是公认的探路者,还担任了IEEE SLTC国际语音和语言技术委员会评奖委员会主席。 另一核,则是惊人的商业变现能力。 科技成果不能只停留在实验室的展示架上。VUI Labs的创始人兼CEO梅杰,是一位拥有极强商业嗅觉的连续成功创业者。
在2017至2022年担任Aircourse/爱课COO期间,他用短短3年时间,将公司年营收干到了5亿元以上,管理着800人的庞大团队。 他最擅长的,就是将前沿技术转化为可交付的行业产品,打通从POC验证到规模化上线的「最后一公里」。 除了这两位灵魂人物,VUI Labs还汇聚了一批「天才大脑」。整个研发团队近50人,博士占比高达50%。 这样一支既懂前沿算法,又懂工程落地,更懂商业闭环的全能战队,为打造「Thinking Machines Lab」奠定了最坚实的底座。 7400亿美元的市场:让AI真正打工赚钱 VUI Labs从第一天起就瞄准真实商业场景。 为此,他们构建了清晰的三层产品体系: 模型API:提供语音生成、声音克隆、识别转写、实时翻译等底层能力,性能达到全球顶尖水平,服务稳定可靠; 创作者和开发者平台:提供配音创作、长文本合成、多角色演绎、声音管理与项目导出等工具,并融合图片、视频、音乐生成能力,覆盖从创意到成片的完整创作流程; 语音Agent平台:打通语音识别、语言模型、工具调用与语音生成,提供从场景梳理、知识库配置、低延迟对话编排到部署上线的全流程服务,帮助企业快速搭建可对话、能执行任务的语音 Agent。 这套务实打法已在物流调度、互联网保险、酒旅SaaS等场景规模化落地,数家客户累计完成超100万次真实业务对话。 Luna-TTS在这些场景里是名副其实的「超级员工」——做客服、做销售、做会议助理,能做同传级翻译,也能当座舱管家。 据测算,到2030年,语音+视觉+协作三层能力将撑起2660亿至7400亿美元的市场。 VUI Labs,正稳站在这个入口。 中国AI的下一场战役: 成为人类的「AI Teammate」 未来的世界,我们不需要更多的冷冰冰的问答机器人,我们需要的是像人类一样自然呼吸、思考、协作的AI语音。 宇生月伴正在用他们全面SOTA的技术,向世界证明:在AI语音这个赛道上,中国团队正在引领全球。 中国版的Thinking Machines已经到来。它正在各行各业的隐秘角落里,悄悄上岗。 这一次,最自然的交互方式,将成为商业世界中最强大的生产力。 最后,VUI Labs的官网地址:http://vuilabs.cn/。点击「阅读原文」,赶快去体验吧! |
温哥华 15 分钟前
美国 27 分钟前
加拿大 半小时前
温哥华 半小时前
加拿大 半小时前
美国 半小时前
美国 半小时前

关注获得及时、准确、全方位的新闻消息
