Xiaohongshu Releases FireRedTTS3: Unified Speech Cloning, Design, and Editing
Xiaohongshu's FireRed team has released FireRedTTS3, a next-generation speech generation and editing model that unifies zero-shot voice cloning across 24 languages and 21 Chinese dialects, natural language-based voice design, and precise speech editing in a single framework. The key innovation is the RedAE speech representation, which incorporates semantic information to mitigate error accumulation in continuous speech generation, achieving state-of-the-art results on multiple public benchmarks.