Muse Spark – Meta 推出的原生多模态大模型AI工具3分钟前更新AI小集02Muse Spark是什么Muse Spark是Meta超级智能实验室推出的首个原生多模态大模型。作为Meta AI重组后的旗舰产品,模型在Artificial Analysis基准测试中从18分跃升至52分,多模态理解与健康问答能力超越GPT-5.4。模型支持视觉思维链、多Agent协同及”沉思模式”,预训练效率较Llama 4提升10倍。模型已在Meta和Meta AI App上线。Muse Spark 1.1 是 Meta 发布的迄今最强编程与智能体模型,支持代码编写、多模态理解及复杂任务自主执行,已正式开放 API 接入 Meta AI 应用。Muse Spark 1.2 是 Meta 专为编程场景优化的模型版本,与Muse Code同步训练开发,支持长时自主工具调用与复杂代码任务执行,在多项编程基准测试中表现领先。Muse Spark的主要功能原生多模态理解:支持视觉思维链与图像转代码,可直接分析复杂图表、定位屏幕元素,将 UI 设计图转换为可运行的 HTML/CSS/JS 应用。多智能体协同:通过”沉思模式”(Contemplating)调度多个子 Agent 并行思考与协同作业,实现复杂任务的分解规划与执行。垂直领域专精:在健康医疗领域提供基于 1000+ 临床医生数据的精准问答与影像分析,在购物场景结合社交图谱做个性化商品推荐。高效推理机制:采用思维自动压缩技术,在保持高性能的同时将 Token 消耗降低至同类模型的三分之一,显著提升推理效率。如何使用Muse Spark网页端直接使用:访问Meta官网,无需注册可免费体验基础功能。移动端 App:下载官方Meta AI App,已全面集成 Muse Spark 模型。API 接入:开发者可通过获取访问 API 权限。Muse Spark的关键信息和使用要求产品定位:Meta Superintelligence Labs(MSL)成立9个月后的首个模型(代号”牛油果”),定位为”个人超级智能”,面向30亿用户生态。核心性能:Artificial Analysis综合得分52(Llama 4仅18分);多模态图表理解(86.4)、健康问答(42.8)超越GPT-5.4;编程类任务(ARC AGI 2、SWE-Bench)仍落后。技术亮点:原生多模态推理+视觉思维链;多Agent”沉思模式”(Contemplating)并行思考;预训练算力需求降至Llama 4的1/10,Token消耗仅Opus的1/3。团队背景:由前Scale AI创始人Alexandr Wang领衔,核心成员包括多位华人研究员(来自OpenAI、DeepMind)。访问渠道:meta.ai网页端(免注册)、Meta AI App(iOS/Android);API预览仅向合作伙伴开放。地域与费用:目前优先美国地区全面开放;个人用户免费、不限量使用。Muse Spark的核心优势原生多模态理解:在图表理解(CharXiv 86.4分)和截图定位(ScreenSpot Pro 84.1分)等视觉任务上表现卓越,显著超越GPT-5.4与Gemini 3.1 Pro。医疗健康专精:基于1000余名临床医生合作构建的专业数据体系,在开放式健康问答(HealthBench Hard 42.8分)与医学影像分析领域达到业界领先水平。多智能体协同推理:独创”沉思模式”(Contemplating)支持多Agent并行思考与任务分解,可调度子Agent分别处理研究、规划与执行等复杂环节。极致效率优化:通过重构预训练技术栈实现算力需求降至Llama 4的十分之一,采用思维自动压缩技术使Token消耗仅为同类顶尖模型的三分之一。Muse Spark的同类竞品对比对比维度Muse SparkGPT-5.4Gemini 3.1 ProArtificial Analysis 综合得分52约 51约 57CharXiv 图表理解86.482.880.2ScreenSpot Pro 截图定位84.185.484.4ARC AGI 2 抽象推理42.576.176.5LiveCodeBench Pro 编程80.087.582.9SWE-Bench Pro 代码修复52.457.754.2HealthBench Hard 健康问答42.840.120.6MedXpertQA 多模态医学78.477.181.3HLE(带工具)深度思考58.458.753.4预训练算力需求Llama 4 的 1/10标准水平标准水平Token 消耗效率Opus 的 1/3基准水平基准水平Muse Spark的应用场景视觉创作与开发:模型支持将应用截图直接转换为可运行的前端代码,能解析复杂学术图表与工程图纸,可将静态图像生成为可交互的网页游戏或故障排查工具。健康医疗咨询:基于千名临床医生专业数据提供开放式健康问答与医学影像解读,同时能根据用户饮食限制生成交互式营养标签和个性化健康管理方案。智能规划与协同:通过多Agent并行处理复杂任务,如协调文化路线、亲子活动与物流的家庭旅行规划,结合社交网络数据提供个性化购物推荐,自主搜索整合多源信息完成深度研究。办公与生产力:支持文档解析、表格分析和邮件撰写等办公任务,同时具备基于截图理解的屏幕自动化能力,可执行界面操作与表单填写。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇CutClaw - 湾大联合北交大开源的 AI 视频剪辑工具下一篇Claude Managed Agents - Anthropic 推出的全托管 Agent 平台相关文章VeOmni – 字节跳动开源的全模态PyTorch原生训练框架AI小集3ReadPo – AI读写助手,支持内容聚合快速阅读并总结AI小集12万兴天幕 – 万兴科技推出AIGC视频创作平台AI小集11Manus – 蝴蝶效应公司推出的首款通用型 AI AgentAI小集153可灵2.6 – 快手可灵推出音画同出的AI视频生成模型AI小集3ColaMD – 开源 Markdown 编辑器,实时同步修改内容AI小集2暂无评论再想想发表评论暂无评论…热门工具LoomyLibTV绘蛙AIAiPPT秘塔AI搜索蛙蛙写作堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录青虎AI妙呀纳逗Pro图改改AstraFlow星图不繁简历最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!27分钟前Acti – AI 智能键盘,一键触发复杂任务28分钟前Muse Code – Meta 推出的终端编程 AI 智能体48分钟前RabbitVis – 兔展智能推出的一站式 AI 设计生产工具4小时前InstructAV2AV – 智源联合北大开源的音视频联合编辑模型5小时前Get3W – AI 模型聚合平台,统一接口自由切换模型20小时前Shieldstral – Mistral AI 开源的多模态内容安全分类模型21小时前MAGI-2-preview – Sand.ai 开源的多模态视频生成模型21小时前SeedRealtime – 字节跳动推出的原生音视频全双工大模型21小时前JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型21小时前Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型1天前Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent1天前MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架1天前ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统2天前Orchard – 微软研究院开源的 Agentic AI 建模框架2天前