返回信息流
新闻事件
S信号86
机器之心
1 个来源

小红书开源连续自回归语音合成模型dots.tts

小红书与上海交通大学合作开源了dots.tts,这是一个20亿参数的全连续自回归语音合成基础模型,在多个评测基准上达到SOTA水平。该模型支持流式输出、音色微调和任务微调,并提供全量开源代码与检查点,为语音合成领域提供了新的技术路线。

SynthePulse Insight · AI 深度解读

dots.tts:连续自回归语音合成,能否成为TTS的“基座”?

版本 1 · 1 个来源

小红书与上海交大开源dots.tts,以20亿参数连续自回归路线挑战离散Token范式,在多项评测中刷新SOTA,并开放完整训练链路。

  • dots.tts采用全连续自回归架构,在连续隐空间中逐块生成语音,避免离散Token的信息瓶颈。
  • 在Seed-TTS-Eval上,dots.tts平均SIM 79.2、平均WER/CER 2.95%,均达SOTA。
  • 在MiniMax-Speech 24语种测试中,自纠正对齐版本平均SIM 83.9,19个语种单项第一。
  • 支持流式输出和1T1A双流模式,音频首包延迟低至54.4毫秒,SGLang-Omni单卡最高16路并行。
  • 开源六个检查点及训练、推理、微调、蒸馏代码,Apache 2.0许可,支持音色与任务微调。
展开章节目录连续自回归:突破离散Token的天花板

连续自回归:突破离散Token的天花板

dots.tts由小红书dots团队与上海交通大学X-LANCE实验室合作开源,是一个20亿参数、全连续、端到端的自回归TTS基础模型。与主流离散Token方案不同,它直接在连续隐空间中自回归建模,再还原为波形,全链路不依赖离散声学Token。

离散表示将连续语音映射到有限词表,形成信息瓶颈,不同声音细节可能落入同一编号,丢失信息难以恢复。重建评测显示,四种离散表征的PESQ-NB为2.40-2.92,SIM为0.68-0.85;三种连续表征的PESQ-NB达3.99、4.23和4.09,SIM达0.963、0.950和0.969,连续表征在保真度上明显领先。

连续自回归的难点在于误差累积:连续隐变量缺少量化约束,前一步偏差会进入后续历史,长句可能引发啸叫、音色漂移或文本错位。dots.tts通过AudioVAE语义化训练和因果Semantic Encoder缓解这一问题,前者塑造平滑低噪的隐空间,后者提取稳定语义历史,降低长程误差累积。

评测表现:多项基准刷新SOTA

在Seed-TTS-Eval零样本克隆评测中,dots.tts SOAR版本在中文、英文和中文困难集上的WER/CER分别为0.94%、1.30%和6.60%,SIM分别为81.0、77.1和79.5;平均SIM 79.2,平均WER/CER 2.95%,均取得最佳。

在MiniMax-Speech 24语种测试中,自纠正对齐版本平均SIM达83.9,高于其他系统;dots.tts在24种语言中拿下19个语种单项SIM第一,并在另外2个语种并列第一。

在EmergentTTS-Eval上,以gpt-4o-mini-tts为基准,dots.tts SOAR版本句法复杂度得分65.7%,高于所有闭源系统;Base版本情绪表现力得分72.7%,为开源系统最佳。

交互与推理:低延迟与高并发

dots.tts天然支持流式输出,完整文本作为前缀输入,逐步生成音频块。面向LLM实时播报场景,支持1T1A双流模式,上游LLM输出第一个文本Token时语音侧即可开始生成,最大程度降低延迟。

在1T1A场景下,音频首包最快54.4毫秒。SGLang-Omni已支持dots.tts推理,在Seed-TTS-Eval EN测试集上单卡最高16路并行。

这些特性使dots.tts适合实时语音Agent、双工对话等交互场景,兼顾生成质量与工程实用性。

扩展能力:dots.tts.edit与精确编辑

dots.tts.edit沿用基座模型,支持文本、情绪、韵律和停顿四类编辑,可组合操作。它利用连续自回归架构,将源文本、源语音、编辑指令和目标文本统一为条件,一次生成编辑后的语音。

团队构建了双语评测套件doteBench,包含2,081个案例(1,841个单项编辑,240个组合编辑),从指令遵循、局部保持和整体音频质量三维度评估。dots.tts.edit在五类任务上整体领先。

在Seed-TTS-Eval上,dots.tts.edit的识别错误率和说话人相似度与基座接近,说明同一生成器可同时保留零样本合成与精确编辑能力。

开源基座:完整路径与生态意义

dots.tts开源了六个检查点,覆盖基础训练、自纠正对齐、MeanFlow四步/两步/单步蒸馏和1T1A双流模式,并开放训练、推理、微调、蒸馏代码,采用Apache 2.0许可。

开发者可通过CLI、Python API或流式接口进行合成和克隆,仓库提供微调入口、训练配置、数据清单格式和蒸馏脚本,覆盖从调用到继续训练的完整路径。

这一开源策略使研究者可复现连续自回归路线,产品团队可做领域适配和延迟优化,为语音合成大模型提供了可持续生长的“基座”形态。

可信度边界

本文信息主要来自机器之心报道,属于二手来源。评测数据(如Seed-TTS-Eval、MiniMax-Speech)为模型发布方自测或论文结果,未经独立第三方验证,应视为source_claim。部分架构细节(如AudioVAE、Semantic Encoder)来自论文或官方描述,同样为source_claim。

核心结论

dots.tts以连续自回归路线在语音合成领域取得显著进展,开源完整训练链路,为TTS基座模型提供了新范式,但其长期稳定性和跨语言泛化仍需更多独立验证。

主报道

机器之心

主报道来源