【AI前沿】Step Edge

2026-07-15

Step Edge – 阶跃星辰推出的端侧模型全家桶AI工具2天前发布AI小集02Step Edge是什么Step Edge是阶跃星辰推出的端侧模型全家桶,包含基础模型、Audio、GUI、Gen 四大成员,面向手机与汽车等终端打造。模型通过端云协同架构,让 Agent 在本地实现 0.1 秒级响应,同时保障全模态数据隐私,在 29 项核心评测中取得第一,并配套自研 Step Inference NPU 引擎优化终端推理。Step Edge的主要功能Step Edge 基础模型:端侧多模态理解与推理,支持文本、图像、视频、OCR、空间理解与工具调用。Step Edge Audio:端侧音频理解与语音识别,覆盖中文、英文等多语种 ASR 与音频问答。Step Edge GUI:端侧 GUI Agent,支持手机与桌面应用的视觉感知、元素定位与自动化操作。Step Edge Gen:端侧图像生成与编辑,支持文生图、图生图及局部编辑,在 OneIG、DPG-Bench 等评测中领先。Step Edge的技术原理端云协同架构:简单高频任务由端侧本地处理,复杂长链路推理交由云端完成,实现速度、能力与成本的整体平衡。全模态本地推理:文本、视觉、语音等多模态数据在终端本地处理,敏感信息不出端,通过本地计算保障隐私安全。Step Inference NPU 引擎:自研终端推理引擎,针对手机、汽车等硬件进行算子与内存优化,降低文本、视觉、语音等输入形态的端到端延迟。低延迟 Toolcall 执行:端侧本地工具调用延迟低至 0.1 秒,支持高频交互场景下的实时响应,减少对云端链路的依赖。如何使用Step EdgeStep Edge 全家桶尚未明确开放公测或 API,目前处于发布亮相阶段。Step Edge的项目地址项目官网:https://static.stepfun.com/blog/step-edge/Step Edge的同类竞品对比对比维度Step EdgeQwen3-VL产品形态端侧模型全家桶(基础+Audio+GUI+Gen)开源多模态大模型系列端侧优化专为终端场景深度优化,配套自研 NPU 引擎支持端侧部署,但主要面向通用多模态任务GUI Agent端侧 GUI 模型,OSWorld 等评测领先需结合外部框架实现 GUI 自动化音频能力独立 Audio 模型,ASR 与音频理解一体化主要聚焦视觉与文本,音频非核心方向图像生成内置 Gen 模型,支持端侧文生图与编辑以理解为主,生成能力非主打隐私策略全模态本地处理,原生端云协同端侧可运行,但协同策略需自行搭建Step Edge的应用场景智能手机助手:端侧实时语音识别与 GUI 自动化操作,离线完成订外卖、发消息、查相册等高频任务。车载智能座舱:本地处理语音指令与车内视觉感知,保障驾驶数据隐私,实现导航、空调、娱乐的零延迟控制。端侧图像创作:手机本地文生图与修图,无需上传照片至云端,满足用户即时创作与隐私保护双重需求。工业终端巡检:在弱网工厂或户外场景,端侧模型本地识别设备故障图像与音频异常,实时上报关键信息。IoT 边缘设备:在智能家居、穿戴设备中部署,本地完成语音唤醒、视觉识别与简单决策,降低云端成本。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇DramaClaw - 工业级 AI 视频制作工具,提供一站式流水线下一篇SenseNova-Vision - 商汤开源的理解生成统一视觉大模型相关文章PartGen – 牛津大学联合 Meta AI 推出的3D对象生成和重建框架AI小集3百度学术 – 百度推出的AI学术搜索引擎AI小集3HuHu.ai – AI模特图生成平台,支持自定义模特AI小集3文佳AI – AI论文写作工具,根据论文主题和领域生成高质量写作参考AI小集3CWM – Meta开源的代码世界模型AI小集2炫图AI – AI修图软件,一站式满足全部修图需求AI小集6暂无评论再想想发表评论暂无评论…热门工具豆包LibTV秒哒AiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录AgnesCodeJobright表答ChatSPSSKroWorkQMuse最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝17小时前AnySearch – 专为 AI Agent 推出的实时结构化搜索引擎17小时前StepAmoo – 阶跃星辰推出的新一代个人智能体17小时前Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型17小时前LibTV Agent – LibTV 推出的专业级视频创作智能体22小时前PixVerse Game – 爱诗科技推出的首个实时视频游戏引擎1天前HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型2天前Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型2天前SenseNova-Vision – 商汤开源的理解生成统一视觉大模型2天前DramaClaw – 工业级 AI 视频制作工具,提供一站式流水线3天前SeFi-Image – 开源的文本到图像模型,基于语义优先扩散3天前CodeMote – AI 原生跨端终端工具,支持远程操控编码环境3天前Agents-A1 – 上海 AI Lab开源的混合专家智能体模型4天前KAT-Coder-Pro V2.5 – 快手推出的 Agentic Coding 模型5天前LingBot-VA 2.0 – 蚂蚁灵波推出的具身原生世界动作模型5天前