FireRedTTS3 – 小红书开源的统一语音生成与编辑模型AI工具2天前发布AI小集03FireRedTTS3是什么FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。模型在四个公开评测集上均取得最优结果,已全面开源可本地部署。FireRedTTS3的主要功能零样本音色克隆:给定几秒参考音频,即可用该音色合成 24 种语言及 21 种中文方言的语音。声音设计:通过自然语言描述即可生成此前不存在的全新音色,无需参考音频。语音编辑:对已有语音的指定区域进行精准修改,包括改词、调速、变调、调音量,其余部分保持不变。FireRedTTS3的技术原理RedAE 语义增强连续表示:在 tokenizer 训练阶段引入语义教师模型进行特征蒸馏,将语义信息注入连续 latent,既保留声学细节又缓解自回归误差累积,无需额外语义模块或多阶段训练。LLM-DiT 生成框架:以 Qwen3-1.7B 为 Backbone 继承文本理解与指令跟随能力,通过 Aggregator 压缩序列后自回归建模,再由 DiT 模块在 Backbone 条件下做 patch 级去噪生成,保持时间连贯性。先规划再合成(Instruct 版):将自然语言指令解析为结构化声学方案或编辑掩码,再映射到 RedAE 表示进行合成,实现对声音设计和语音编辑的精准控制,不破坏未指定区域。微信关注回复“开源”,加入AI开源项目交流群如何使用FireRedTTS3环境准备:克隆 GitHub 仓库并安装requirements.txt中的依赖。模型下载:通过 ModelScope 下载FireRedTeam/FireRedTTS3预训练模型到本地目录。语种识别(可选):下载 FastText 语言识别模型,让 Base 版自动判断输入文本的语种。零样本克隆:加载 Base 版模型,传入参考音频、参考文本和目标文本即可生成对应音色语音。声音设计:调用 Instruct 版的generate_voice_design,仅传入自然语言描述和目标文本即可生成全新音色。语义编辑:调用generate_semantic_edit,用自然语言指令指定插入、删除或替换内容,修改指定区域。声学编辑:调用generate_acoustic_edit,使用固定模板指令(如adjust the speed to 0.5x)调整语速、音高或音量。方言合成:传入带ZH_前缀的方言标签(如ZH_Sichuan),并尽量使用同方言参考音频以获得最佳效果。FireRedTTS3的核心优势三任务统一建模:将音色克隆、声音设计、语音编辑整合到单一模型,无需为不同任务分别训练或切换模型,降低系统复杂度。RedAE 语义增强连续表示:在 tokenizer 训练阶段即注入语义信息,既避免了离散 token 的声学细节损失,又缓解了连续自回归的误差累积,兼顾音质与稳定性。顶尖的多语言/方言能力:支持 24 种语言与 21 种中文方言的零样本克隆,在 MiniMax-MLS-Test 的 24 语种评测中 22 个语言位列前二。四个公开榜单全面领先:在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval、Ming-Freeform-Audio-Edit 上,字错率与说话人相似度均取得最优或次优成绩。精准可控的先规划、再合成:Instruct 版将自然语言指令解析为结构化声学方案后再渲染,确保编辑只影响指定区域,其余内容和音色保持不变。FireRedTTS3的项目地址GitHub仓库:https://github.com/FireRedTeam/FireRedTTS3HuggingFace模型库:https://modelscope.cn/models/FireRedTeam/FireRedTTS3FireRedTTS3的同类竞品对比对比维度FireRedTTS3CosyVoice3开发团队小红书 FireRed 团队阿里通义实验室开源状态模型 + 代码 + Demo 全面开源部分版本开源核心能力克隆 / 设计 / 编辑 统一建模侧重语音克隆与指令控制语言与方言24 种语言 + 21 种中文方言多语言支持,方言覆盖较少技术路线RedAE 连续表示 + LLM-DiT离散 Token + Flow Matching零样本克隆Seed-TTS-Eval 相似度78.8%Seed-TTS-Eval 相似度75.3%声音设计自然语言描述生成全新音色主要支持风格 / 情感控制语音编辑支持精准局部编辑(改词/调速/变调)编辑能力有限,非核心功能推理部署支持本地 GPU 部署,提供完整 API支持本地部署FireRedTTS3的应用场景多语言有声内容制作:用几秒参考音频克隆音色,快速生成 24 种语言的有声书或播客,无需聘请多语种配音员。游戏与虚拟角色配音:通过自然语言描述设计专属角色音色,或精准编辑已有台词中的个别字词,避免整句重录。视频与播客后期剪辑:在成品语音中直接替换错误词汇、调整语速或删除冗余片段,无需回到录音棚重新录制。品牌智能客服:零样本克隆企业专属客服音色,保持一致的品牌声音形象,同时支持多语言服务。方言内容创作:用 21 种中文方言合成本地化内容,如方言短视频、地方文化节目,大幅降低方言配音门槛。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇huashu-excel - 花叔开源的 AI 数据分析 Skill下一篇豆包工作 - 字节跳动推出的 AI Agent 办公产品相关文章BFS-Prover – 字节豆包推出的自动定理证明系统AI小集3Spark-TTS – AI文本转语音工具,支持中英零样本语音克隆AI小集311x – AI数字员工服务平台,自动化销售和市场推广流程AI小集3YouArt – AI创意工作平台,自动构建可视化创作工作流AI小集3Kilo Code – 开源的 VS Code AI Agent扩展工具AI小集3Fineshare FineCut – AI音频编辑软件,支持多格式音频修剪、合并、转换一体化服务AI小集3暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀堆友Agent美图设计室绘蛙AIupdream办公小浣熊秒哒最新收录造剧立刻成片OJO海艺剧场豆包工作精挑翻译最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!1小时前GLM-5.3-Flash – 智谱开源的原生多模态模型1小时前Qwen3.8-Flash – 阿里通义推出的多模态 MoE 模型1小时前Omarchy – 开源的AI原生Linux桌面 ,自然语言生成桌面主题1小时前Play with Putty – 谷歌推出的实时协作 Vibe Coding 工具18小时前AZ8 – AI 视频创作工作台,Agent 实时读取素材与状态20小时前Tutti · VM – 多人多 Agent 并行协作空间,零延迟并行协作20小时前EgoSuite-Open100K – 光轮智能开源的全模态人类行为数据集20小时前PixVerse R2 – 爱诗科技推出的实时全模态世界模型23小时前Breeze TTS 2 – BreezeBlue 推出的新一代语音合成模型23小时前QuickDesk – 开源 AI 原生远程桌面,首款内置 MCP Server23小时前AlphaVow – 一站式 AI 批量图像处理工具2天前Agnes 2.5 Pro Alpha – Agnes AI 开源的多模态推理模型2天前OpenStory – 开源 AI 视频制作平台,一键生成短剧视频2天前Newtake – LiblibAI 推出的海外 AI 视频创作平台2天前