【AI前沿】阿里推出原生 Computer Use Agent「Qwen-CUA」

2026-08-06

Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use AgentAI工具10小时前发布AI小集02Qwen-CUA是什么Qwen-CUA 是 Qwen 团队与 XLang Lab 联合推出的原生 Computer Use Agent,基于 397B-A17B 混合专家架构,仅通过截图感知界面状态,无需依赖 DOM 树或辅助功能元数据,直接用键盘和鼠标事件操控浏览器、桌面应用及专业软件。在 OSWorld-Verified 基准上取得 86.2 分,更大版本 Qwen-CUA-Max 参数量超万亿,达到 87.6 分。Qwen-CUA的主要功能纯视觉感知:仅通过截图理解界面状态,不依赖 HTML 结构或无障碍元数据,跨平台通用性更强。原生输入模拟:直接输出键盘和鼠标事件,可在浏览器、桌面应用、专业软件中执行操作。MoE 架构底座:基于 397B-A17B 混合专家模型,平衡性能与推理成本;Max 版本超万亿参数,性能再提升。开放技术报告:GitHub 已发布技术报告与参考 Demo,便于研究者复现与二次开发。Qwen-CUA的技术原理底座架构:基于 Qwen3.5-397B-A17B 混合专家架构,总参数 397B、每次前向仅激活 17B,在保持强大表达能力的同时控制推理成本。混合注意力机制:采用 GatedDeltaNet 线性注意力与 Gated Full Attention 按 75:25 交替排列,将长序列计算复杂度从 O(n²) 降至接近线性,256K 上下文吞吐量较传统架构提升 19 倍。专家路由:每层配置 512 个细粒度路由专家,通过 Top-10 选择 + 权重重归一化激活,并配合 1 个共享专家与 sigmoid 门控自适应调节通用知识贡献,避免信息损失。纯视觉感知:仅通过屏幕截图感知界面状态,完全不依赖 HTML DOM 树、无障碍元数据或操作系统 API,实现对任意 GUI 应用的跨平台通用感知。视觉编码与定位:继承 Qwen-VL 系列的 ViT 架构支持动态分辨率输入,配合 MRoPE 多模态旋转位置编码同时编码时间、高度、宽度三维信息,精准定位界面元素坐标。如何使用Qwen-CUA访问仓库:访问 GitHub 搜索xlang-ai/Qwen-CUA进入项目主页。阅读技术报告:下载并阅读项目内的技术报告,了解模型架构与训练细节。运行参考 Demo:根据 README 配置环境,运行官方提供的参考 Demo 体验截图驱动的自动化操作。接入自有环境:将模型接入本地或云端的桌面/浏览器环境,通过截图输入与键盘鼠标输出闭环执行任务。Qwen-CUA的核心优势高基准得分:OSWorld-Verified 达 86.2 分,Max 版本 87.6 分,处于开源 CUA 领域领先水平。真正的原生 CUA:区别于依赖 API 或多 Agent 拼接的方案,Qwen-CUA 是端到端训练的视觉-动作模型,稳定性更高。跨平台兼容:不受操作系统或应用类型限制,任何有图形界面的软件均可操控。开源生态:Apache 2.0 协议,技术报告与 Demo 已公开,社区可自由扩展。Qwen-CUA的项目地址GitHub仓库:https://github.com/xlang-ai/Qwen-CUA技术论文:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdfQwen-CUA的同类竞品对比维度Qwen-CUAOpenAI CUA / Operator感知方式纯截图视觉感知,零 DOM 依赖截图 + 结构化辅助信息混合架构397B-A17B MoE,开源GPT-4o 特化版,闭源OSWorld-Verified86.2 分(Max 87.6)约 38.1% 成功率(历史数据)开放性技术报告 + Demo 开源(Apache 2.0)API 商用,模型闭源输入模拟原生键盘鼠标事件原生键盘鼠标事件适用平台浏览器 + 桌面 + 专业软件主要面向浏览器与桌面Qwen-CUA的应用场景自动化软件测试:通过截图识别界面元素并执行点击、输入、滚动等操作,无需编写特定脚本即可完成跨平台 UI 回归测试。RPA 流程自动化:替代人工完成数据录入、报表生成、ERP 操作等重复性桌面办公任务,无需改造企业原有 IT 系统。无障碍辅助工具:为视障用户或老年人自动识别软件界面元素并代为执行精确操作,降低专业软件使用门槛。科研与专业软件操控:自动操控 MATLAB、SPSS 等无 API 接口的专业软件,批量执行实验数据处理与图表生成等长周期任务。云端 Agent 托管服务:部署于云桌面环境 7×24 小时执行网站巡检、数据抓取、定时报表下载等后台任务。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇MemHarness - 上海 AI Lab 等推出的智能体记忆重构框架下一篇Hy ASR 3.0 preview - 腾讯混元推出的新一代语音识别模型相关文章通答 – AI标书助手,实时获取招标讯息智能编写标书AI小集4AnimateAnything – 浙江大学联合北航推出的统一可控视频生成技术AI小集3OpenVision – 加州大学开源的视觉编码器家族AI小集2Diffuse – AI视频编辑工具,提供个性化视频生成和编辑功能AI小集2FutureX – 字节联合复旦等高校推出的动态实时评估基准AI小集3rtrvr.ai – AI浏览器扩展工具,自然语言指令完成网页任务自动化AI小集2暂无评论再想想发表评论暂无评论…热门工具LoomyLibTV绘蛙AIAiPPT秘塔AI搜索蛙蛙写作堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录青虎AI妙呀纳逗Pro图改改AstraFlow星图不繁简历最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!1小时前Get3W – AI 模型聚合平台,统一接口自由切换模型1小时前Shieldstral – Mistral AI 开源的多模态内容安全分类模型2小时前MAGI-2-preview – Sand.ai 开源的多模态视频生成模型2小时前SeedRealtime – 字节跳动推出的原生音视频全双工大模型2小时前JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型2小时前Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型9小时前MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架10小时前ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统1天前Orchard – 微软研究院开源的 Agentic AI 建模框架1天前E-Bench – 腾讯混元等推出的智能体评测基准1天前SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型2天前Polar – AI 浏览器,自动跨站收集整合信息2天前GenOffice – Genspark 推出的本地 AI Office 客户端2天前Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型2天前