Muse Voice Transcribe – Meta 推出的首个实时音频感知模型AI工具4小时前发布AI小集02Muse Voice Transcribe是什么Muse Voice Transcribe 是 Meta 推出的首个实时音频感知模型,集流式自动语音识别、说话人分割与端点检测于一体。模型支持 70 多种语言及原生语码切换,可处理超 1 小时长音频与 20 人以上同时对话,在流式转写和语音分割基准测试中均排名第一。Muse Voice Transcribe 基于强化学习的自适应延迟技术,能动态权衡速度与准确率。Muse Voice Transcribe 已集成至 Meta AI 与 Muse Code,定位为 AI 系统的实时感知层。Muse Voice Transcribe的主要功能实时流式 ASR:模型以 80ms 为单位实时处理音频并输出文字,无需等待整段音频结束。说话人分割:自动识别并标记超过 20 位不同说话人,区分谁在何时发言。语音端点检测:精准判断语音开始与结束时刻,支持自然停顿与连续对话。多语言与语码切换:覆盖 70 多种语言,原生支持中英文夹杂等任意语码转换。长音频与多人会议:可连续处理超过 1 小时音频,无需后处理即可输出完整转写。Muse Voice Transcribe的技术原理自回归多模态架构:基于 Muse Spark 系列的自回归模型,将音频流逐帧转化为软 token 并与文本 token 统一建模,实现音频到文本的端到端生成。流式音频 token 机制:每 80ms 音频片段编码为软 token,模型通过预测<|next_audio|>决定是否继续监听下一段,收到<|empty_audio|>则立即输出剩余文本,实现真正的流式推理。任务扩展特殊 token:在 ASR 基础上引入<|start_of_turn|>与<|speaker_{A-Z}|>实现说话人切换识别,引入<|speech_onset|>与<|speech_endpoint|>实现端点检测,所有任务共享同一流式训练框架。强化学习自适应延迟:通过 RL 将词错误率奖励与延迟奖励以乘法方式组合,使模型根据每个单词的识别难度动态决定等待更多上下文还是立即输出,在速度与准确率间达到帕累托最优。如何使用Muse Voice Transcribe选择入口:通过 Meta Model API、Mac 版Meta AI或Muse Code三种方式接入服务。启动语音:在 Muse Code 中按下⌘ + v快捷键,或在 Mac 版 Meta AI 中点击语音按钮开始听写。跨应用使用:在任意 Mac 应用中按住 Fn 键,即可调用 Meta AI 完成语音转写。API 调用:通过 Meta Model API 按量计费(每 1000 分钟 3 美元),集成到自己的应用或工作流中。Muse Voice Transcribe的核心优势实时流式 ASR:用 80ms 为单位处理音频,实现真正的低延迟实时转写。多人说话人分割:原生支持超过 20 位说话人区分,无需后处理即可精准归属每句话。自适应延迟:通过强化学习动态调整每个单词的等待时间,在速度与准确率之间达到帕累托最优。无缝语码切换:原生支持句子内或句子间的任意语言切换,精准识别中英文夹杂等混合表达。超长音频处理:支持超过 1 小时的连续长音频输入,适用于长时间会议或访谈场景。语音端点检测:自动标记语音开始(<|speech_onset|>)与结束(<|speech_endpoint|>),精准判断用户何时说完。基准测试第一:在 Artificial Analysis 流式语音转文本和公开语音分割基准测试中均排名第一。Muse Voice Transcribe的项目地址项目官网:https://research.meta.ai/blog/introducing-muse-voice-transcribeMuse Voice Transcribe的同类竞品对比对比维度Muse Voice Transcribe(Meta)Gemini 3.1 Flash Live(Google)产品定位专门的实时音频感知与 ASR 模型通用实时多模态对话模型,ASR 只是其输入能力之一核心能力流式 ASR、说话人分割、语音端点检测实时双向语音对话(ASR + TTS)、多模态(音频/视频/图像/文本)、函数调用词错误率AA-WER Streaming Index3.1%,Artificial Analysis 排名第一未公布具体 ASR WER 数值,主打低延迟流式 ASR 与对话流畅度说话人分割原生支持20+ 位说话人,DER 仅17.5%未明确支持多人说话人分割,专注单轮/双轮实时对话延迟策略自适应延迟,通过强化学习为每个单词动态调整等待时间Sub-200ms固定首 token 延迟,追求极速响应长音频处理原生支持1 小时+连续音频,无需分段纯音频会话默认15 分钟限制,需接入 session 续接机制语码切换原生支持句子内/间任意语码转换,精准识别中英文夹杂支持 90+ 种语言,但未强调语码切换专项优化纯转写成本$0.18/小时音频输入$0.30/小时+ 文本输出约$0.07/小时,合计约$0.37/小时输出能力仅文本转写 + 说话人标签(<|speaker_A|>)文本 + 音频合成(TTS)+ 工具调用 + 结构化输出 + 实时搜索Muse Voice Transcribe的应用场景跨国会议实时纪要:支持20+人同时发言、超过1小时的长时间会议,自动区分说话人并精准转写中英文夹杂的讨论内容。AI语音助手/Agent:作为实时感知层,提供低延迟流式ASR与精准的语音端点检测,让AI助手知道用户何时开始和结束说话。播客与访谈字幕生成:处理长达数小时的音频素材,原生支持多人对话分割,无需后期手动标注说话人。多语言客服质检:实时转写客服与客户的混合语言对话,用上下文偏好提升专业术语识别准确率,并自动归档。开发者语音输入工具:通过Mac版Meta AI或Muse Code的Fn键全局调用,在任何应用中实现语音转写编程、写文档或发消息。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Atlas - World Labs 推出的全球首个多模态世界模型下一篇Hy4 preview 轻量版 - 腾讯混元开源的Hy4量化压缩模型相关文章Slax Note – 语音转文字的AI笔记应用,自动润色文本AI小集3Reel.AI – 井英科技推出的AI短剧应用AI小集3Learn Your Way – 谷歌推出的实验性AI学习工具AI小集3Mini-InternVL – 上海AI Lab联合清华等机构推出的轻量级多模态大模型AI小集3VideoCrafter2 – 腾讯推出的高质量视频生成模型AI小集4Yeri AI – AI 全能在线创作平台,覆盖完整内容生产流程AI小集2暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀Lovart美图设计室绘蛙AIupdream商汤小浣熊秒哒最新收录Agent.SpaceQwenWorkDeepSkillAlphaVowXCellMetaDig最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!2小时前Hy4 preview 轻量版 – 腾讯混元开源的Hy4量化压缩模型2小时前Atlas – World Labs 推出的全球首个多模态世界模型4小时前Claude Mythos 5.1 – Anthropic 推出的 Claude 系列旗舰模型4小时前Claude Fable 5.1 – Anthropic 推出的最新旗舰大模型4小时前WeMM-Embedding – 腾讯开源通用多模态Embedding模型1天前FireRedAudio – 小红书 FireRed 推出的通用音频语言模型1天前MiniMax H3 Max – MiniMax 推出的实时视频生成模型2天前Ling-3.0-flash-Fin – 蚂蚁百灵推出的首个金融增强模型2天前AI 技能成千上万怎么选?DeepSkill 精准搜索实战2天前Rome – 开源的智能体操作系统,自然语言生成完整应用3天前Headlong – Laude Institute 开源的 AI Agent 微框架3天前Miya – 时域科技推出的 AI 音乐应用,画面可随歌词律动4天前Zing-0.5 – Loopit 开源的实时交互视频世界模型4天前2026 年 AI 生成图文店门头效果图 – 7 款工具深度横评5天前