MiniCPM-Robot – 面壁智能开源的具身智能 VLA 模型系列AI工具22小时前更新AI小集02MiniCPM-Robot是什么MiniCPM-Robot是面壁智能开源的轻量具身智能 VLA 模型系列,包含 1.5B 参数的 MiniCPM-RobotManip 通用操作模型与 0.9B 参数的 MiniCPM-RobotTrack 跟踪导航模型,配套 PhyAI 推理框架。模型采用视觉 Token 压缩与流式上下文记忆技术,支持机械臂长程精细操作与机器狗室内外目标跟踪,可在弱网环境下端侧本地运行,推理延迟低至 120ms,在主流评测中跻身第一梯队。MiniCPM-Robot的主要功能MiniCPM-RobotManip:控制机械臂完成长程操作任务(如做三明治),支持多摄像头输入,具备上下文记忆能力,可记住任务进度与历史动作。MiniCPM-RobotTrack:让机器狗根据自然语言指令持续跟踪指定目标,支持单目标跟踪、多人干扰跟踪和模糊目标跟踪,可在弱网/无网环境下本地运行。MiniCPM-Robot的技术原理视觉 Token 压缩:过滤与任务无关的冗余视觉信息,减少单次推理计算量。流式上下文记忆:复用已处理的历史信息,新画面只需增量计算,避免长任务计算量暴涨。自进化数据管线:在仿真与真实环境中主动暴露模型薄弱环节,收集错误场景进行专家纠偏与闭环训练。微信关注回复“开源”,加入AI开源项目交流群如何使用MiniCPM-Robot环境准备:克隆 GitHub 仓库并安装依赖。准备硬件:机械臂(RobotManip)或宇树 Go2 Edu 机器狗(RobotTrack)。模型加载:从 Hugging Face 下载对应模型权重。通过 PhyAI 框架加载模型,完成量化与算子优化。摄像头接入:配置腕部相机与主视角相机(RobotManip)或机器狗原装摄像头(RobotTrack)。指令输入:输入自然语言指令(如”跟着前面穿黑衣服的人”或”做三明治”)。一键启动:运行开源脚本,模型接收视觉与语言输入,输出机器人动作指令并执行。MiniCPM-Robot的核心优势极小参数,第一梯队性能:1.5B 参数在 LIBERO、Calvin、RoboTwin2 等评测中比肩 π0.5 等更大模型;RMBench 上下文记忆得分约 53 分,远超 π0.5 的约 10 分。推理延迟减半:H100 上单帧决策延迟约 120ms,接近 π0.5(234ms)的一半。纯端侧运行:机器狗本地算力即可稳定 5Hz 以上跟踪,断网仍能持续工作。MiniCPM-Robot的项目地址项目官网:https://github.com/OpenBMB/MiniCPM-RobotHuggingFace模型库:https://huggingface.co/openbmb/MiniCPM-RobotManiphttps://huggingface.co/openbmb/MiniCPM-RobotTrackMiniCPM-Robot的同类竞品对比维度MiniCPM-RobotManipπ0.5参数量1.5B3B开源✓✓LIBERO97.596.9Calvin4.14.1RMBench53.510单帧延迟120ms~234ms上下文记忆流式复用历史信息主要基于单帧判断端侧部署支持本地运行通常需云端算力MiniCPM-Robot的应用场景餐饮备餐:双臂机械臂按指令完成取面包、夹生菜火腿鸡蛋等长程三明治制作任务。展厅导览:机器人在无网环境下基于本地知识库完成离线讲解、自由问答与路线规划。园区巡检:机器狗识别车辆违停、路面异常与公共设施问题,敏感画面本地处理不上云。仓储物流:机器人执行货架取放、物料搬运等长程操作,失败时自动重试与恢复。室内外跟随:机器狗根据自然语言指令在电梯、地下停车场等弱网环境中持续跟踪目标人物。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇CloudBase - 腾讯云推出的全栈应用云开发平台下一篇Qwen-Audio-3.0-TTS - 阿里通义千问推出的语音合成模型相关文章Self-Taught Evaluators – Meta推出的新型模型评估方法AI小集5Ola – 清华联合腾讯等推出的全模态语言模型AI小集3Phi-3.5 – 微软推出的新一代AI模型,mini、MoE混合和视觉模型AI小集6元智启AI – 企业级AI应用配置平台,零代码操作AI小集6Webscrape AI – AI数据采集工具,提供目标URL自动化爬取数据AI小集2易我人声分离 – AI音频编辑工具,智能分离人声和背景音乐AI小集3暂无评论再想想发表评论暂无评论…热门工具豆包LibTV绘蛙AIAiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录排版小星立刻修相片Nile天工短剧工作台V2FunDuck.ai最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!2分钟前Qwen-Image-3.0 – 阿里通义推出第三代图像生成基础模型2分钟前MOGE AI 图像提示词 – 精选全球顶级图片Prompt,一键复制出图2小时前问小白 5 Pro – 元石科技推出的新一代长内容生成引擎2小时前Hyra – 腾讯混元推出的科学发现智能体4小时前Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型4小时前Matrix -Game3.5 – 昆仑万维开源的实时流式交互世界模型9小时前vivago R1- 智象未来推出的无限时长多模态创作智能体9小时前LoHoSearch – 美团推出的下一代搜索智能体评测基准22小时前Qwen-Audio-3.0-TTS – 阿里通义千问推出的语音合成模型22小时前CloudBase – 腾讯云推出的全栈应用云开发平台1天前Qwen3.8-Max-Preview – 阿里通义推出的最新一代基座模型1天前Tempolor v4.7 – 趣丸科技推出的旗舰级AI音乐生成大模型1天前Emochi AI – AI 虚拟陪伴聊天应用,海量 AI 角色沉浸式对话1天前MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型2天前