【AI前沿】Fun-ASR-Realtime

2026-07-08

Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型AI工具2天前发布AI小集02Fun-ASR-Realtime是什么Fun-ASR-Realtime 是阿里千问推出的流式实时语音识别大模型。模型通过 WebSocket 流式协议实现边说边出字,首字延迟百毫秒,尾字延迟同样极低。模型支持普通话、16 种方言及 30 种语言的实时识别,具备上下文理解、热词定制、情感识别、时间戳输出等能力。Fun-ASR-Realtime的主要功能实时流式识别:通过 WebSocket 双工通信实现低延迟音频到文本转换,支持边说边出字。多方言多语种支持:覆盖 16 种方言(含粤语、吴语、闽语、客家话等)和 30 种语言,适配出海客服、国际会议等场景。上下文纠错:基于历史对话上下文和实时热词进行自我纠正,如将”叶鹿”根据上下文修正为”夜鹭”。情感识别:Qwen-ASR 模型支持 7 类细粒度情绪识别;Paraformer 支持 3 类极性情感识别。时间戳输出:Fun-ASR 与 Paraformer 默认输出句级与字级时间戳,便于字幕对齐和关键词高亮。热词定制:支持通过热词提升品牌名、人名、专有术语的识别准确率。VAD 智能断句:服务端自动检测语音起点和终点,支持自定义静音阈值和灵敏度。非人声过滤:自动过滤非人声内容,提升识别纯度。Fun-ASR-Realtime的技术原理大模型流式架构:模型采用基于 Transformer 或 Conformer 的大模型作为骨干网络,通过流式推理机制实现音频边输入边输出,避免等待整段音频结束后再处理,将首字延迟压缩至百毫秒级。因果注意力与分块处理:模型在推理时采用因果注意力掩码,确保每个时间步的预测仅依赖当前及历史音频帧,不依赖未来信息;同时通过固定长度音频分块输入,平衡延迟与准确率。泛 Context 强化训练:在训练阶段引入历史对话上下文(Historical Context)和实时热词(Hotwords)作为辅助输入,通过上下文感知重打分(Context-aware Rescoring)机制,使模型能根据语境动态修正识别结果,如将叶鹿根据观鸟上下文纠正为夜鹭。多任务联合建模:模型在语音识别主任务基础上,联合训练情感识别和语音活动检测(VAD)任务,通过共享编码器提取通用声学表征,在单一前向传播中同步输出转写文本、情感标签和断句边界。时间戳对齐机制:基于连接时序分类(CTC)或注意力对齐路径,在解码过程中同步预测每个字/词在音频中的起止时间戳,输出句级和字级两种粒度,满足字幕对齐和关键词定位需求。如何使用Fun-ASR-Realtime获取凭证:在阿里云百炼控制台https://help.aliyun.com/zh/model-studio/real-time-speech-recognition-user-guide获取 API Key 并配置到环境变量。安装 SDK:通过 pip 或 Maven 安装最新版 DashScope SDK。配置参数:创建 Recognition 实例,设置模型名fun-asr-realtime、音频格式(如 pcm/wav)及采样率。建立连接:通过 WebSocket 与阿里云推理服务端建立双工连接。发送音频:按固定帧长循环读取麦克风或音频文件数据并发送。接收结果:在回调中处理实时返回的on_event事件,获取中间结果和句级最终结果。结束任务:音频发送完毕后调用stop()或发送finish-task指令关闭识别会话。Fun-ASR-Realtime的核心优势低延迟高准确:首字延迟百毫秒,准确率接近离线模型,实现又快又准。方言识别领先:在 16 种方言测试中 12 类领先火山与腾讯同类产品,吴语系准确率行业顶尖。上下文自纠错:具备语境理解能力,能根据后续信息自动修正前期误识别内容。工业场景鲁棒:在复杂背景、远场嘈杂及带口音场景下,中英文识别准确率均领先竞品。生态接入便捷:通过阿里云百炼平台统一提供,支持多语言 SDK 和 WebSocket 直连,提供完整高并发最佳实践方案。Fun-ASR-Realtime的同类竞品对比维度Fun-ASR-RealtimeGPT-4o-Transcribe / Realtime API产品定位专为流式实时语音识别设计的大模型基于 GPT-4o 的转录模型,支持通过 Realtime API 流式传输或 REST 批量转录首字延迟百毫秒级,原生流式架构流式模式下约 300–500ms,取决于网络与 VAD 配置;批量模式无实时性流式架构原生 WebSocket 双工流式,端到端优化通过 Realtime API WebSocket 支持流式输入,但 transcription 模式仅在 turn 结束时返回完整结果,delta 连续性有限方言支持16 种方言(吴语、闽语、客家话等),上海话 92.41% 准确率99+ 语言零样本覆盖,但方言/低资源语言准确率显著下降,无中文方言专项优化上下文纠错支持,可根据语境自动修正前期误识别(如”叶鹿”→”夜鹭”)基于 GPT-4o 语言理解能力,对歧义词(如 their/there/they’re)有上下文解析优势,但无实时跨句纠错机制Fun-ASR-Realtime的应用场景直播实时字幕:面向长时直播、多人互动场景提供毫秒级延迟的字幕输出,支持说话人频繁切换和复杂赛制环境,已在影视飓风「重返荒岛」100 小时直播中验证,累计输出 132 万字实时字幕。会议实时转写:在远程会议、线下论坛等场景中边说边出字,输出带句级与字级时间戳的结构化文本,便于会后快速回溯关键发言与定位时间节点。客服通话质检:实时识别客服与用户的双向对话内容,同步进行情感状态检测,支持热词定制以精准捕捉品牌名、产品名和投诉关键词,实现通话过程中的实时风险预警。语音输入法:为移动端、车载终端、IoT 设备提供低延迟方言输入能力,支持粤语、吴语、闽语等 16 种方言实时转写,提升非普通话用户的输入效率与体验。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Leanstral 1.5 - Mistral AI 开源的形式化验证大模型下一篇Hy3 - 腾讯混元开源的混合专家模型相关文章FLUX Tools – 黑森林实验室推出的模型工具套组AI小集3Loki.Build – AI网站构建工具,快速创建着陆页AI小集2ListenHub CLI – ListenHub 开源的AI内容创作命令行工具AI小集2HunyuanVideo-Foley – 腾讯混元开源的视频音效生成模型AI小集2MeDo – 百度推出的无代码AI应用开发平台,秒哒海外版AI小集3Browserfly – AI浏览器插件,支持多任务并行处理AI小集3暂无评论再想想发表评论暂无评论…热门工具豆包LibTVAiPPT秒哒秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录Laper莓图AI西米AITDreamSkildArtStreamLake最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝16小时前LingBot-Depth 2.0 – 蚂蚁灵波科技推出的深度补全模型16小时前SoundWise – 免费AI音视频转录工具,支持多格式音视频16小时前InternAgentS – 上海 AI Lab 开源的国产科研智能体工作台18小时前MemGUI-Agent – 浙大联合快手推出的长程手机GUI智能体18小时前支付宝AI开放平台 – 蚂蚁集团推出的企业级AI服务生态平台21小时前GPT-Realtime-2.1 – OpenAI推出的新一代实时语音模型21小时前GenEvolve – 美团等推出的自演进图像生成 Agent23小时前OpenScience – Synthetic Sciences 开源的 AI 科研工作台23小时前一点妙笔 – AI公文写作工具,一键生成合规材料2天前Hy3 – 腾讯混元开源的混合专家模型2天前Leanstral 1.5 – Mistral AI 开源的形式化验证大模型2天前Elements Claw – 阿里达摩院推出的超导材料发现 AI 智能体2天前FuckClaude – 开源的浏览器环境自测工具,是否会被CC标记2天前ComAct – 上海AI Lab等推出软件自动化操作的研究范式3天前