【AI前沿】小红书 FireRed 推出通用音频语言模型 FireRedAudio

2026-09-02

FireRedAudio – 小红书 FireRed 推出的通用音频语言模型AI工具8小时前发布AI小集02FireRedAudio是什么FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,基于 9B 参数 Qwen3.5 自回归 LLM。模型理解与生成分别使用独立的连续表征通道(Audio Encoder 与 RedAE),再汇入共享 LLM 统一推理。模型同时支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。FireRedAudio的主要功能音频理解:在 MMAU、MMSU 等综合音频问答评测中取得表内最佳成绩,覆盖语音、音乐与环境声理解。多语种 ASR:支持 102 种语言识别,FLEURS-102 平均错误率 14.94%,低资源语种表现尤为突出。Zero-shot TTS:给定任意参考语音即可合成新内容,中英文内容准确率表内领先。Instruct TTS:遵循”用更慢的语速朗读”等自然语言指令,六项评测指标全部领跑。语音编辑:支持语义层面的删除/插入/替换,以及声学层面的变速/变调/变音量。长音频处理:支持最长 1 小时录音,能生成秒级精度的时间线结构化摘要。FireRedAudio的技术原理解耦连续表征:FireRedAudio 的不强迫理解与生成共享同一种音频表示,为两者分别设计独立的连续向量通道:理解侧需要紧凑语义特征以支持长上下文建模,生成侧需要可重建的精细声学特征以保留音色与韵律,两者在共享 LLM 中完成统一推理。理解路径:音频由 Whisper-large-v3 初始化的 Audio Encoder 编码,经 Adapter 压缩为每秒 12.5 个连续表征后输入 9B LLM,直接输出识别文本或理解答案,适配 ASR、音频问答与长音频结构化任务。生成路径:条件音频先经 RedAE(确定性自编码器)压缩为 25Hz、64 维连续 latent,预训练时通过冻结教师编码器进行语义蒸馏以保留内容线索;由 Patch Encoder 每 4 帧聚合成一个 audio step(6.25Hz)送入 LLM;LLM 每预测一个 audio-step token,以其隐藏状态驱动 flow-matching DiT 生成新 latent,最终由 RedAE Decoder 还原为 24kHz 波形。五阶段渐进训练:训练依次完成 Adapter 对齐、Audio Encoder 适配、理解与生成联合训练、多任务后训练、以及 200k 长上下文扩展,累计约 2.66T 非填充多模态 token,逐步叠加能力而非一次性混合所有任务。共享推理中枢:9B Qwen3.5 自回归 LLM 作为唯一可训练主干,负责跨模态推理、任务规划与上下文建模;理解与生成仅在输入表征层解耦,在推理层统一,使模型既能”听懂”又能”开口”而不牺牲各侧的信息保真度。微信关注回复“开源”,加入AI开源项目交流群如何使用FireRedAudio环境配置:从 GitHub 仓库阅读环境与依赖安装说明,准备好运行环境。获取权重:从 Hugging Face 官方页面下载模型权重与配置文件。跑通样例:先执行官方提供的最小推理样例,验证模型版本、音频采样率与输出路径。验证理解:分别测试 ASR 和音频问答功能,确认理解路径正常工作。验证生成:分别测试 Zero-shot TTS 和指令 TTS,确认生成路径正常工作。音频格式:生成任务中保持输入输出为 24 kHz 采样率,并记录 DiT 采样步数与显存峰值。TTS 设置:Zero-shot TTS 时,用参考语音的最后两个 audio step 初始化声学历史,其他生成任务使用零初始化。硬件评估:根据 9B 主干权重、KV cache 及 DiT 采样开销评估显存需求,长音频任务需额外预留上下文缓存空间。FireRedAudio的核心优势统一架构:一个 9B 自回归 LLM 同时承载音频理解与生成,避免多模块拼接带来的能力分散。解耦表征:理解与生成分别使用最适合自身的连续表征通道,既保留语义紧凑性又不丢失声学细节。性能领先:在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 六项指标上均取得表内最佳成绩。长音频支持:通过 200k 上下文扩展,可处理最长 1 小时录音并输出秒级精度结构化时间线。全栈覆盖:单模型支持 ASR、音频问答、Zero-shot TTS、指令 TTS、语义/声学语音编辑六大任务。FireRedAudio的项目地址GitHub仓库:https://github.com/FireRedTeam/FireRedAudioHuggingFace模型库:https://huggingface.co/FireRedTeam/FireRedAudioarXiv技术论文:https://arxiv.org/pdf/2608.24168FireRedAudio的同类竞品对比对比维度FireRedAudioQwen3.5-Omni-Plus定位专注音频领域的通用理解与生成模型覆盖文本/图像/音频/视频的全模态通用模型架构9B 自回归 LLM + 解耦连续表征(Audio Encoder / RedAE)更大规模端到端多模态架构,所有模态统一处理理解评测MMAU test 80.9、MMSU 83.3,均为表内最佳MMAU test 79.9、MMSU 80.7,略低于 FireRedAudio多语种 ASRFLEURS-102 平均 WER 14.94%,低资源语种优势显著FLEURS-102 平均 WER 23.66%,多语种覆盖稍弱生成能力支持 Zero-shot TTS、Instruct TTS、语音编辑,DiT 输出 24kHz 波形支持语音合成与理解,但不侧重语音编辑与细粒度声学控制长音频200k 上下文支持 1 小时录音,strict@0 通过率 73.6%具备长音频处理能力,但论文中未展示同量级 1 小时结构化评测FireRedAudio的应用场景智能会议助理:将 1 小时会议录音自动转写为带秒级时间戳的结构化纪要,并提取关键决策与待办事项。多语种内容本地化:输入中文视频,自动识别原声并生成英语、日语等多语种配音,保持原说话人音色与情感风格。播客/有声书后期制作:通过自然语言指令调整语速、音量或替换特定语句,无需重新录制即可完成语音编辑。智能客服语音交互:实时理解用户语音咨询(含环境噪音与口音),并以指定音色、语速生成回复语音,实现端到端语音对话。音频内容审核与检索:对长音频平台的海量内容做结构化理解,支持”找出所有提到价格欺诈的片段”等语义级检索与标注。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇MiniMax H3 Max - MiniMax 推出的实时视频生成模型下一篇WeMM-Embedding - 腾讯开源通用多模态Embedding模型相关文章MimicBrush – 阿里等开源的AI图像编辑融合框架AI小集3Youtu-GraphRAG – 腾讯优图开源的图检索增强生成框架AI小集2Livensa – AI视频生成应用,输入文本或图像自动创作AI小集2Fish Speech – 开源的高效文本到语音合成TTS工具AI小集15univerbal – AI语言学习应用,支持22种语言与AI导师实时对话AI小集3Chai – AI伴侣应用,可主导剧情走向AI小集3暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀Lovart绘蛙AI美图设计室updream办公小浣熊秒哒最新收录DeepSkillAlphaVowXCellMetaDigChatArtLexcat最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!2分钟前WeMM-Embedding – 腾讯开源通用多模态Embedding模型8小时前MiniMax H3 Max – MiniMax 推出的实时视频生成模型1天前Ling-3.0-flash-Fin – 蚂蚁百灵推出的首个金融增强模型1天前AI 技能成千上万怎么选?DeepSkill 精准搜索实战1天前Rome – 开源的智能体操作系统,自然语言生成完整应用2天前Headlong – Laude Institute 开源的 AI Agent 微框架2天前Miya – 时域科技推出的 AI 音乐应用,画面可随歌词律动3天前Zing-0.5 – Loopit 开源的实时交互视频世界模型3天前2026 年 AI 生成图文店门头效果图 – 7 款工具深度横评4天前Hy4 preview – 腾讯混元开源的新一代旗舰大模型4天前Gemini Omni 1.1 Flash – 谷歌推出的 AI 视频生成模型4天前Twoo – 双人共用 AI 伙伴应用,能同时听懂双方对话4天前Prime Agent – Prime Intellect开源的长周期AI Agent运行框架4天前shuohao-skills – 开源AI短剧制作Skill集合,包含完整工作流4天前