小红书发布FireRedTTS3:统一语音克隆、设计与编辑
小红书FireRed团队发布了新一代语音生成与编辑模型FireRedTTS3,该模型在一个框架内实现了多语言多方言的零样本音色克隆、基于自然语言描述的声音设计以及精准的语音编辑功能。其核心创新在于RedAE语音表示,通过语义增强解决了连续语音生成中的误差累积问题,在多个公开评测集上达到行业领先水平。
小红书FireRed团队发布了新一代语音生成与编辑模型FireRedTTS3,该模型在一个框架内实现了多语言多方言的零样本音色克隆、基于自然语言描述的声音设计以及精准的语音编辑功能。其核心创新在于RedAE语音表示,通过语义增强解决了连续语音生成中的误差累积问题,在多个公开评测集上达到行业领先水平。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
小红书 FireRed 团队发布 FireRedTTS3,用同一套 LLM-DiT 框架统一零样本音色克隆、自然语言声音设计与精准语音编辑,在四个公开评测集上领先。其核心是新的连续语音 tokenizer RedAE,通过冻结的「语义教师」在表示层注入语义,缓解连续自回归的误差累积问题。
过去两年,零样本音色克隆已成熟,但用户需求正从「复刻一个声音」转向「控制」:用自然语言描述设计声音,或对已有语音做精准局部修改。FireRedTTS3 的发布正是回应这一需求。
实现控制需闯三关:听懂自然语言指令、精确落到语音属性或片段、不破坏未指定部分。地基是语音表示同时编码语义(内容/风格/意图)与声学细节(音色/气声/音高)。
现有三条路线各有短板:非自回归 Flow Matching 难以借力文本大模型的指令跟随;离散 Token 量化抹掉细粒度声学细节;连续自回归(LLM-DiT)误差累积导致音色漂移。此前补救方案或需额外语义模块,或使架构复杂化。
FireRedTTS3 的第一块基石是连续语音 tokenizer RedAE。团队先训练音频理解模型 FireRedAudio,使其 Audio Encoder 同时理解内容语义和说话人声学线索;训练 RedAE 时冻结该 Encoder 作为语义教师,让 RedAE 输出对齐其特征(MSE 语义蒸馏损失),训练后教师不再参与推理。
RedAE 刻意省去 KL 正则,避免声学信息过度压缩,保留音色细节。输入 24 kHz 波形切为 480 采样点帧(50 Hz),经两个级联 Qwen3 风格 Transformer,下采样到 25 Hz。整体在 GAN 框架下训练,损失含对抗、多尺度 Mel 重建、特征匹配、语义蒸馏四项。
训练数据 50 万小时(干净语音 50%、带噪 25%、音效 10%、音乐 15%),在 32 张 H800 上跑 55 万步。单阶段联合训练,无额外语义分支、无多阶段流水线。
生成框架由三组件构成:Aggregator 将 25 Hz 表示压成 6.25 Hz latent patch;Backbone Transformer 从 Qwen3 初始化,继承文本理解与指令跟随;DiT 模块在 Backbone 条件下做 patch 级去噪,输入为带噪当前 patch 加 12 帧干净历史 latent,训练时以 0.1 概率随机丢弃条件做 CFG。
Base 版面向多语言/多方言克隆:Backbone 从 Qwen3-1.7B-Base 初始化,用 CAM++ 提取说话人嵌入,文本前加语言标签。两阶段训练:第一阶段 260 万小时中英文(17 万步),第二阶段 56 万小时覆盖 24 种语言 + 21 种中文方言。
Instruct 版统一克隆/设计/编辑:Backbone 从带指令能力的 Qwen3-1.7B 初始化,采用 ChatML 格式,用 system prompt 区分任务。关键设计是「先规划、再合成」:声音设计时把自由描述拆解为 12 个声学属性序列;编辑时展开为目标转录 + 编辑区域掩码。不使用显式说话人嵌入和语言标签,第二阶段在 33 万小时数据上训练 4 万步。
在 Seed-TTS-Eval 上,Base 版取得最低平均错误率(3.04%)与最高平均说话人相似度(78.8%),Test-EN 与 Test-ZH 相似度均最优。在 MiniMax-MLS-Test 的 24 种语言上,错误率 3.75%、相似度 84.8%,22/24 种语言相似度位列第一或第二。葡萄牙语与乌克兰语不在 RedAE 训练数据中,仍有竞争力,体现泛化能力。
在 InstructTTSEval(6000 条样本,中英文各 3000)上,Instruct 版在声学参数指定(APS)、风格描述(DSD)、角色扮演(RP)三类指令上均最佳,得益于 12 维结构化方案降低指令歧义。
在 Ming-Freeform-Audio-Edit 上,声学编辑(语速/音高/音量)与语义编辑(插入/删除/替换)大多领先,open 设定下稳定。核心指标:低 WER 与 NoEdit WER、高 ACC、高 SIM、极低 RDE/RAE,实现「改得准、其余不变、音色不漂」。
FireRedTTS3 的关键是把抑制误差累积下沉到表示层,用冻结语义教师注入语义,使稳定性成为表示固有属性。由此,克隆、设计、编辑首次统一进同一套简单 LLM-DiT 框架,tokenizer 单阶段训练、无额外语义模块、无复杂结构。
团队称这是「可持续生长的基座」,从 FireRedTTS、FireRedTTS-1S、FireRedTTS-2 到 FireRedTTS3,一直在构建可生长的语音生成基础设施。未来将拓展语种与方言、丰富指令控制与编辑边界。
需注意:本文为机器之心发布的宣传稿,所有评测结果均为团队自测或官方脚本,未经独立第三方验证;「行业领先」等表述为来源声称。葡萄牙语/乌克兰语泛化结论基于单一评测,且未见语言覆盖细节。
本文信息全部来自机器之心对小红书 FireRed 团队的发布报道,属于一手宣传材料。技术细节、训练数据、评测数字均为团队声称,未经独立验证。评测结果虽称使用官方开源脚本,但未提供第三方复现。
FireRedTTS3 通过 RedAE 在表示层注入语义,用一套 LLM-DiT 框架统一了克隆、设计、编辑,并在四个公开评测集上领先。其意义在于将「控制」能力下沉到表示层,为语音生成提供更简单的基座,但实际效果需独立复现验证。
主报道
主报道来源