LingBot-Depth 2.0 – 蚂蚁灵波科技推出的空间感知模型AI工具22小时前更新AI小集02LingBot-Depth 2.0是什么LingBot-Depth 2.0 是蚂蚁灵波科技推出面向真实场景的空间感知模型,同步开源视觉基座模型 LingBot-Vision。训练数据从 300 万扩充至 1.5 亿,在 16 项深度补全基准测评中获 12 项第一,室内大面积深度缺失场景 RMSE 误差从 0.132 降至 0.062。模型在玻璃、镜面等透明物体场景表现突出,已通过奥比中光专业认证,构建机器人从”看懂”到”看准”的能力链路。LingBot-Depth 2.0的主要功能深度补全:基于 RGB 图像与稀疏深度输入,补全生成高精度稠密深度图。透明物体感知:针对玻璃、镜面、水龙头等透明/反光物体实现完整三维结构重建。边缘精细识别:具备亚像素级边界定位能力,精准识别物体轮廓与细小结构。时序稳定性:在视频流中保持深度估计的时域一致性与空间精度。跨场景泛化:覆盖室内、室外、复杂光照及多种材质的真实场景。LingBot-Depth 2.0的技术原理双模型协同架构:LingBot-Depth 2.0 并非单一网络采用”基座模型 + 任务头”的两级协同架构,底层的 LingBot-Vision 负责从 RGB 图像中提取边界与空间结构特征,上层的 LingBot-Depth 则基于这些特征完成从稀疏或噪声深度到稠密深度图的补全映射,解耦设计让视觉表征与深度估计各自专注于最擅长的环节,构建起机器人从”看懂”到”看准”的完整能力链路。LingBot-Vision:边界结构预训练:LingBot-Vision 是业内首个将”边界结构”作为显式预训练目标的视觉基础模型,采用几何建模方式学习”物体在哪里、边缘如何分布、空间如何组织”的结构性知识,使模型具备亚像素级的边界定位能力;在仅使用 1.6 亿张图像进行预训练的情况下,其对物体轮廓、表面交界及细小结构的识别清晰度与稳定性均优于依赖十亿级数据的通用视觉基础模型。深度补全机制:LingBot-Depth 2.0 的深度补全网络基于 LingBot-Vision 提供的边界感知特征,通过编码器识别深度不连续区域,再经由解码器进行多尺度特征融合,在保持物体边缘锐利的同时对平滑区域进行合理插值;关键在于模型利用显式的边界结构特征作为深度传播的约束条件,有效防止传统深度补全中常见的”深度溢出”问题,确保前景与背景在物体边界处实现正确截断,同时引入时序特征对齐机制以保障视频流输入下的帧间深度一致性。微信关注回复“开源”,加入AI开源项目交流群如何使用LingBot-Depth 2.0获取模型:从 HuggingFace 或 ModelScope 下载 LingBot-Vision 开源权重。克隆代码:通过 GitHub 仓库 https://github.com/robbyant/lingbot-vision 获取代码与技术报告。环境配置:根据文档配置依赖环境,准备 RGB-D 输入数据。调用推理:加载模型进行深度补全推理,或基于 LingBot-Vision 训练下游视觉任务。端侧集成:用奥比中光 Gemini 330 系列相机,通过 SDK 接入 LingBot-Depth 商业版能力。LingBot-Depth 2.0的核心优势数据规模领先:训练数据达 1.5 亿,较上一代扩充 50 倍,覆盖更丰富的真实场景。测评成绩优异:在 16 项深度补全基准测评中斩获 12 项第一。误差显著降低:室内大面积深度缺失场景 RMSE 误差较上一代减半。透明场景突破:在玻璃、镜面等传统深度相机失灵场景中表现尤为突出。硬件认证加持:通过奥比中光深度视觉实验室专业认证,边缘清晰度与鲁棒性显著提升。LingBot-Depth 2.0的项目地址项目官网:https://technology.robbyant.com/lingbot-visionGitHub仓库:https://github.com/robbyant/lingbot-visionHuggingFace模型库:https://huggingface.co/collections/robbyant/lingbot-visionLingBot-Depth 2.0的同类竞品对比对比维度LingBot-Depth 2.0Depth Anything V2技术路线基于边界结构预训练的视觉基座模型 + 深度补全基于 DINOv2 的判别模型 + 合成数据与伪标签训练数据规模1.5 亿真实场景训练数据59.5 万合成图像 + 6200 万伪标注真实图像核心优势透明/反光物体、边缘精细识别、机器人场景优化单目深度估计、多尺度模型、推理速度快开源情况LingBot-Vision 四版本(ViT-G/L/B/S)已开源四版本开源(Small 为 Apache 2.0,其余 CC-BY-NC-4.0)产业落地与奥比中光深度合作,推出 SDK 及一体化相机学术研究与通用场景为主LingBot-Depth 2.0的应用场景家庭服务机器人:在厨房、卫生间等存在玻璃、镜面、水龙头的环境中实现精准导航与操作。工业质检:对透明包装、反光金属件进行三维尺寸测量与缺陷检测。仓储物流:在复杂光照仓库中识别货物边缘与细小物体,辅助机械臂抓取。自动驾驶:补全道路场景深度信息,提升透明障碍物(如玻璃幕墙)感知能力。数采设备:集成于奥比中光 EGO 等 RGB-D 采集设备,为具身智能训练提供精准真实世界数据。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇SoundWise - 免费AI音视频转录工具,支持多格式音视频下一篇LingBot-Vision - 蚂蚁灵波科技开源的通用视觉基座模型相关文章NoteGen – 跨平台 AI 笔记应用,支持截图、插图和文本输入记录方式AI小集4OneRec – 快手推出的端到端生成式推荐系统AI小集2NVIDIA Nemotron Nano 2 – 英伟达推出的高效推理模型AI小集2ViMax – 港大开源的多智能体视频生成框架AI小集2FinRobot – 开源 AI Agent 平台,解决金融领域应用的综合解决方案AI小集2Mobius – 重庆邮电联合美团等推出的无缝循环视频生成技术AI小集4暂无评论再想想发表评论暂无评论…热门工具豆包LibTVAiPPT秒哒秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录MaxAEOLaper莓图AI西米AITDreamSkildArt最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝45秒前Seedream 5.0 Pro – 字节跳动推出的多模态图像创作模型3分钟前GenMail – Genspark 推出的 AI 智能邮箱助手14小时前MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型19小时前Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型19小时前悟界·RoboBrain Orca – 智源推出的多模态表征世界模型19小时前SayIt – 开源 AI 语音输入法,自动将口语转为书面表达22小时前Muse Image – Meta 超级智能实验室推出的AI图像生成模型22小时前motion-anything – Open Design 开源的本地优先动效引擎22小时前LingBot-Vision – 蚂蚁灵波科技开源的通用视觉基座模型22小时前SoundWise – 免费AI音视频转录工具,支持多格式音视频2天前InternAgentS – 上海 AI Lab 开源的国产科研智能体工作台2天前MemGUI-Agent – 浙大联合快手推出的长程手机GUI智能体2天前支付宝AI开放平台 – 蚂蚁集团推出的企业级AI服务生态平台2天前GPT-Realtime-2.1 – OpenAI推出的新一代实时语音模型2天前