【AI前沿】Muse Spark

2026-07-09

Muse Spark – Meta 推出的原生多模态大模型AI工具3个月前发布AI小集02Muse Spark是什么Muse Spark是Meta超级智能实验室推出的首个原生多模态大模型。作为Meta AI重组后的旗舰产品,模型在Artificial Analysis基准测试中从18分跃升至52分,多模态理解与健康问答能力超越GPT-5.4。模型支持视觉思维链、多Agent协同及”沉思模式”,预训练效率较Llama 4提升10倍。模型已在Meta和Meta AI App上线,API预览版向部分用户开放。Muse Spark的主要功能原生多模态理解:支持视觉思维链与图像转代码,可直接分析复杂图表、定位屏幕元素,将 UI 设计图转换为可运行的 HTML/CSS/JS 应用。多智能体协同:通过”沉思模式”(Contemplating)调度多个子 Agent 并行思考与协同作业,实现复杂任务的分解规划与执行。垂直领域专精:在健康医疗领域提供基于 1000+ 临床医生数据的精准问答与影像分析,在购物场景结合社交图谱做个性化商品推荐。高效推理机制:采用思维自动压缩技术,在保持高性能的同时将 Token 消耗降低至同类模型的三分之一,显著提升推理效率。如何使用Muse Spark网页端直接使用:访问Meta官网,无需注册可免费体验基础功能。移动端 App:下载官方Meta AI App,已全面集成 Muse Spark 模型。API 接入:开发者可通过申请获取私密预览版 API 权限,目前仅向部分合作伙伴开放。社交平台集成:未来几周内将直接接入 Facebook、Instagram 和 WhatsApp,用户可在聊天界面中直接调用。Muse Spark的关键信息和使用要求产品定位:Meta Superintelligence Labs(MSL)成立9个月后的首个模型(代号”牛油果”),定位为”个人超级智能”,面向30亿用户生态。核心性能:Artificial Analysis综合得分52(Llama 4仅18分);多模态图表理解(86.4)、健康问答(42.8)超越GPT-5.4;编程类任务(ARC AGI 2、SWE-Bench)仍落后。技术亮点:原生多模态推理+视觉思维链;多Agent”沉思模式”(Contemplating)并行思考;预训练算力需求降至Llama 4的1/10,Token消耗仅Opus的1/3。团队背景:由前Scale AI创始人Alexandr Wang领衔,核心成员包括多位华人研究员(来自OpenAI、DeepMind)。访问渠道:meta.ai网页端(免注册)、Meta AI App(iOS/Android);API预览仅向合作伙伴开放。地域与费用:目前优先美国地区全面开放;个人用户免费、不限量使用。Muse Spark的核心优势原生多模态理解:在图表理解(CharXiv 86.4分)和截图定位(ScreenSpot Pro 84.1分)等视觉任务上表现卓越,显著超越GPT-5.4与Gemini 3.1 Pro。医疗健康专精:基于1000余名临床医生合作构建的专业数据体系,在开放式健康问答(HealthBench Hard 42.8分)与医学影像分析领域达到业界领先水平。多智能体协同推理:独创”沉思模式”(Contemplating)支持多Agent并行思考与任务分解,可调度子Agent分别处理研究、规划与执行等复杂环节。极致效率优化:通过重构预训练技术栈实现算力需求降至Llama 4的十分之一,采用思维自动压缩技术使Token消耗仅为同类顶尖模型的三分之一。Muse Spark的同类竞品对比对比维度Muse SparkGPT-5.4Gemini 3.1 ProArtificial Analysis 综合得分52约 51约 57CharXiv 图表理解86.482.880.2ScreenSpot Pro 截图定位84.185.484.4ARC AGI 2 抽象推理42.576.176.5LiveCodeBench Pro 编程80.087.582.9SWE-Bench Pro 代码修复52.457.754.2HealthBench Hard 健康问答42.840.120.6MedXpertQA 多模态医学78.477.181.3HLE(带工具)深度思考58.458.753.4预训练算力需求Llama 4 的 1/10标准水平标准水平Token 消耗效率Opus 的 1/3基准水平基准水平Muse Spark的应用场景视觉创作与开发:模型支持将应用截图直接转换为可运行的前端代码,能解析复杂学术图表与工程图纸,可将静态图像生成为可交互的网页游戏或故障排查工具。健康医疗咨询:基于千名临床医生专业数据提供开放式健康问答与医学影像解读,同时能根据用户饮食限制生成交互式营养标签和个性化健康管理方案。智能规划与协同:通过多Agent并行处理复杂任务,如协调文化路线、亲子活动与物流的家庭旅行规划,结合社交网络数据提供个性化购物推荐,自主搜索整合多源信息完成深度研究。办公与生产力:支持文档解析、表格分析和邮件撰写等办公任务,同时具备基于截图理解的屏幕自动化能力,可执行界面操作与表单填写。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇CutClaw - 湾大联合北交大开源的 AI 视频剪辑工具下一篇Claude Managed Agents - Anthropic 推出的全托管 Agent 平台相关文章PaliGemma 2 – 谷歌DeepMind推出的全新视觉语言模型AI小集2AI Companion – Zoom 推出的 AI 助手,具有记忆、推理、任务执行和协调能力AI小集2牛马AI – 本地AI个人工作台,自由接入多种模型AI小集6O1-CODER – 北交大推出的O1代码版开源项目,专注于编码任务AI小集2IQuest-Coder-V1 – IQuestLab推出的代码大模型系列AI小集2蓝藻AI智播 – 云知声推出的AI自动化直播系统AI小集5暂无评论再想想发表评论暂无评论…热门工具豆包LibTVAiPPT秒哒秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录MaxAEOLaper莓图AI西米AITDreamSkildArt最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝28分钟前GenMail – Genspark 推出的 AI 智能邮箱助手29分钟前MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型5小时前Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型5小时前悟界·RoboBrain Orca – 智源推出的多模态表征世界模型5小时前SayIt – 开源 AI 语音输入法,自动将口语转为书面表达8小时前Muse Image – Meta 超级智能实验室推出的AI图像生成模型8小时前motion-anything – Open Design 开源的本地优先动效引擎8小时前LingBot-Vision – 蚂蚁灵波科技开源的通用视觉基座模型8小时前LingBot-Depth 2.0 – 蚂蚁灵波科技推出的空间感知模型1天前SoundWise – 免费AI音视频转录工具,支持多格式音视频1天前InternAgentS – 上海 AI Lab 开源的国产科研智能体工作台1天前MemGUI-Agent – 浙大联合快手推出的长程手机GUI智能体1天前支付宝AI开放平台 – 蚂蚁集团推出的企业级AI服务生态平台1天前GPT-Realtime-2.1 – OpenAI推出的新一代实时语音模型1天前