【AI前沿】小红书开源统一语音生成与编辑模型 FireRedTTS3

2026-08-26

FireRedTTS3 – 小红书开源的统一语音生成与编辑模型AI工具10小时前发布AI小集03FireRedTTS3是什么FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。模型在四个公开评测集上均取得最优结果,已全面开源可本地部署。FireRedTTS3的主要功能零样本音色克隆:给定几秒参考音频,即可用该音色合成 24 种语言及 21 种中文方言的语音。声音设计:通过自然语言描述即可生成此前不存在的全新音色,无需参考音频。语音编辑:对已有语音的指定区域进行精准修改,包括改词、调速、变调、调音量,其余部分保持不变。FireRedTTS3的技术原理RedAE 语义增强连续表示:在 tokenizer 训练阶段引入语义教师模型进行特征蒸馏,将语义信息注入连续 latent,既保留声学细节又缓解自回归误差累积,无需额外语义模块或多阶段训练。LLM-DiT 生成框架:以 Qwen3-1.7B 为 Backbone 继承文本理解与指令跟随能力,通过 Aggregator 压缩序列后自回归建模,再由 DiT 模块在 Backbone 条件下做 patch 级去噪生成,保持时间连贯性。先规划再合成(Instruct 版):将自然语言指令解析为结构化声学方案或编辑掩码,再映射到 RedAE 表示进行合成,实现对声音设计和语音编辑的精准控制,不破坏未指定区域。微信关注回复“开源”,加入AI开源项目交流群如何使用FireRedTTS3环境准备:克隆 GitHub 仓库并安装requirements.txt中的依赖。模型下载:通过 ModelScope 下载FireRedTeam/FireRedTTS3预训练模型到本地目录。语种识别(可选):下载 FastText 语言识别模型,让 Base 版自动判断输入文本的语种。零样本克隆:加载 Base 版模型,传入参考音频、参考文本和目标文本即可生成对应音色语音。声音设计:调用 Instruct 版的generate_voice_design,仅传入自然语言描述和目标文本即可生成全新音色。语义编辑:调用generate_semantic_edit,用自然语言指令指定插入、删除或替换内容,修改指定区域。声学编辑:调用generate_acoustic_edit,使用固定模板指令(如adjust the speed to 0.5x)调整语速、音高或音量。方言合成:传入带ZH_前缀的方言标签(如ZH_Sichuan),并尽量使用同方言参考音频以获得最佳效果。FireRedTTS3的核心优势三任务统一建模:将音色克隆、声音设计、语音编辑整合到单一模型,无需为不同任务分别训练或切换模型,降低系统复杂度。RedAE 语义增强连续表示:在 tokenizer 训练阶段即注入语义信息,既避免了离散 token 的声学细节损失,又缓解了连续自回归的误差累积,兼顾音质与稳定性。顶尖的多语言/方言能力:支持 24 种语言与 21 种中文方言的零样本克隆,在 MiniMax-MLS-Test 的 24 语种评测中 22 个语言位列前二。四个公开榜单全面领先:在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval、Ming-Freeform-Audio-Edit 上,字错率与说话人相似度均取得最优或次优成绩。精准可控的先规划、再合成:Instruct 版将自然语言指令解析为结构化声学方案后再渲染,确保编辑只影响指定区域,其余内容和音色保持不变。FireRedTTS3的项目地址GitHub仓库:https://github.com/FireRedTeam/FireRedTTS3HuggingFace模型库:https://modelscope.cn/models/FireRedTeam/FireRedTTS3FireRedTTS3的同类竞品对比对比维度FireRedTTS3CosyVoice3开发团队小红书 FireRed 团队阿里通义实验室开源状态模型 + 代码 + Demo 全面开源部分版本开源核心能力克隆 / 设计 / 编辑 统一建模侧重语音克隆与指令控制语言与方言24 种语言 + 21 种中文方言多语言支持,方言覆盖较少技术路线RedAE 连续表示 + LLM-DiT离散 Token + Flow Matching零样本克隆Seed-TTS-Eval 相似度78.8%Seed-TTS-Eval 相似度75.3%声音设计自然语言描述生成全新音色主要支持风格 / 情感控制语音编辑支持精准局部编辑(改词/调速/变调)编辑能力有限,非核心功能推理部署支持本地 GPU 部署,提供完整 API支持本地部署FireRedTTS3的应用场景多语言有声内容制作:用几秒参考音频克隆音色,快速生成 24 种语言的有声书或播客,无需聘请多语种配音员。游戏与虚拟角色配音:通过自然语言描述设计专属角色音色,或精准编辑已有台词中的个别字词,避免整句重录。视频与播客后期剪辑:在成品语音中直接替换错误词汇、调整语速或删除冗余片段,无需回到录音棚重新录制。品牌智能客服:零样本克隆企业专属客服音色,保持一致的品牌声音形象,同时支持多语言服务。方言内容创作:用 21 种中文方言合成本地化内容,如方言短视频、地方文化节目,大幅降低方言配音门槛。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇huashu-excel - 花叔开源的 AI 数据分析 Skill下一篇豆包工作 - 字节跳动推出的 AI Agent 办公产品相关文章秒画趣拍APP – 商汤科技推出的AI创意写真工具AI小集4BiliNote – 开源 AI 视频笔记工具,自动提取视频内容生成Markdown格式AI小集4Wan – 阿里推出的AI内容创作平台,支持AI绘画、AI视频等AI小集3OpenUtau – 开源的AI歌声合成工具,自动适配系统语言AI小集7ReplaceAnything – 阿里推出的AI替换图片中物体的开源框架AI小集2丰语大模型 – 顺丰推出物流行业的大语言模型,摘要准确率达95%+AI小集4暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀堆友Agent美图设计室绘蛙AIupdream办公小浣熊秒哒最新收录豆包工作精挑翻译AskCcmarmos模兜漫小芽最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!3小时前AlphaVow – 一站式 AI 批量图像处理工具3小时前Agnes 2.5 Pro Alpha – Agnes AI 开源的多模态推理模型4小时前OpenStory – 开源 AI 视频制作平台,一键生成短剧视频4小时前Newtake – LiblibAI 推出的海外 AI 视频创作平台7小时前ScienceClaw – 中科紫东太初推出的科研原生智能体平台7小时前豆包工作 – 字节跳动推出的 AI Agent 办公产品10小时前huashu-excel – 花叔开源的 AI 数据分析 Skill12小时前PikaPio – AI + AR 创意内容社区与零代码创作平台12小时前Faraday – Inherent 推出的 AI 科学家智能体12小时前OpenBot – CopilotKit 开源的企业级 AI Agent 平台1天前HyCreator – 腾讯混元团队推出的 AI 长视频生成平台1天前FreeToken – 开源端侧 MoE 大模型推理系统,支持满血运行2天前TabTin – 开源的全栈 AI Agent 团队协作平台2天前TeleAgent – 中国电信天翼 AI 推出的桌面级通用智能体助手2天前