Step Edge – 阶跃星辰推出的端侧模型全家桶AI工具1天前发布AI小集02Step Edge是什么Step Edge是阶跃星辰推出的端侧模型全家桶,包含基础模型、Audio、GUI、Gen 四大成员,面向手机与汽车等终端打造。模型通过端云协同架构,让 Agent 在本地实现 0.1 秒级响应,同时保障全模态数据隐私,在 29 项核心评测中取得第一,并配套自研 Step Inference NPU 引擎优化终端推理。Step Edge的主要功能Step Edge 基础模型:端侧多模态理解与推理,支持文本、图像、视频、OCR、空间理解与工具调用。Step Edge Audio:端侧音频理解与语音识别,覆盖中文、英文等多语种 ASR 与音频问答。Step Edge GUI:端侧 GUI Agent,支持手机与桌面应用的视觉感知、元素定位与自动化操作。Step Edge Gen:端侧图像生成与编辑,支持文生图、图生图及局部编辑,在 OneIG、DPG-Bench 等评测中领先。Step Edge的技术原理端云协同架构:简单高频任务由端侧本地处理,复杂长链路推理交由云端完成,实现速度、能力与成本的整体平衡。全模态本地推理:文本、视觉、语音等多模态数据在终端本地处理,敏感信息不出端,通过本地计算保障隐私安全。Step Inference NPU 引擎:自研终端推理引擎,针对手机、汽车等硬件进行算子与内存优化,降低文本、视觉、语音等输入形态的端到端延迟。低延迟 Toolcall 执行:端侧本地工具调用延迟低至 0.1 秒,支持高频交互场景下的实时响应,减少对云端链路的依赖。如何使用Step EdgeStep Edge 全家桶尚未明确开放公测或 API,目前处于发布亮相阶段。Step Edge的项目地址项目官网:https://static.stepfun.com/blog/step-edge/Step Edge的同类竞品对比对比维度Step EdgeQwen3-VL产品形态端侧模型全家桶(基础+Audio+GUI+Gen)开源多模态大模型系列端侧优化专为终端场景深度优化,配套自研 NPU 引擎支持端侧部署,但主要面向通用多模态任务GUI Agent端侧 GUI 模型,OSWorld 等评测领先需结合外部框架实现 GUI 自动化音频能力独立 Audio 模型,ASR 与音频理解一体化主要聚焦视觉与文本,音频非核心方向图像生成内置 Gen 模型,支持端侧文生图与编辑以理解为主,生成能力非主打隐私策略全模态本地处理,原生端云协同端侧可运行,但协同策略需自行搭建Step Edge的应用场景智能手机助手:端侧实时语音识别与 GUI 自动化操作,离线完成订外卖、发消息、查相册等高频任务。车载智能座舱:本地处理语音指令与车内视觉感知,保障驾驶数据隐私,实现导航、空调、娱乐的零延迟控制。端侧图像创作:手机本地文生图与修图,无需上传照片至云端,满足用户即时创作与隐私保护双重需求。工业终端巡检:在弱网工厂或户外场景,端侧模型本地识别设备故障图像与音频异常,实时上报关键信息。IoT 边缘设备:在智能家居、穿戴设备中部署,本地完成语音唤醒、视觉识别与简单决策,降低云端成本。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇DramaClaw - 工业级 AI 视频制作工具,提供一站式流水线下一篇SenseNova-Vision - 商汤开源的理解生成统一视觉大模型相关文章Sky-T1 – NovaSky 开源的推理 AI 模型,可从零开始复现该模型AI小集3笔墨写作 – AI写作创作平台,快速生成各类文章AI小集3CogVLM2 – 智谱AI推出的新一代多模态大模型AI小集4Seedream 5.0 – 字节跳动推出的AI图像生成模型AI小集3Stable Diffusion 3 – Stability AI推出的新一代图像生成模型AI小集3novelistAI – AI小说创作平台,自动生成封面图和插图AI小集3暂无评论再想想发表评论暂无评论…热门工具豆包LibTV秒哒AiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录AgnesCodeJobright表答ChatSPSSKroWorkQMuse最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝刚刚AnySearch – 专为 AI Agent 推出的实时结构化搜索引擎7分钟前StepAmoo – 阶跃星辰推出的新一代个人智能体8分钟前Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型9分钟前LibTV Agent – LibTV 推出的专业级视频创作智能体5小时前PixVerse Game – 爱诗科技推出的首个实时视频游戏引擎8小时前HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型20小时前Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型1天前SenseNova-Vision – 商汤开源的理解生成统一视觉大模型1天前DramaClaw – 工业级 AI 视频制作工具,提供一站式流水线2天前SeFi-Image – 开源的文本到图像模型,基于语义优先扩散2天前CodeMote – AI 原生跨端终端工具,支持远程操控编码环境2天前Agents-A1 – 上海 AI Lab开源的混合专家智能体模型3天前KAT-Coder-Pro V2.5 – 快手推出的 Agentic Coding 模型4天前LingBot-VA 2.0 – 蚂蚁灵波推出的具身原生世界动作模型4天前