【AI前沿】ForgeStencil

2026-08-05

ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统AI工具19小时前发布AI小集02ForgeStencil是什么ForgeStencil 是面壁智能联合 OpenBMB 开源社区推出的全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统,基于 Kernel Agent 与 App Agent 双智能体闭环,实现从优化策略发现到真实生产软件集成的全流程零人工介入。系统在一周内完成 100 余个工业与科学计算软件的端到端优化,中位加速 1.41 倍,覆盖油气勘探、电磁仿真、医学影像等 8 大工业领域与 5 大科学领域。ForgeStencil的主要功能双 Agent 闭环优化:Kernel Agent 自主研究并合成高性能 CUDA Kernel,App Agent 完成热点定位、算子锻造、正确性验证与应用集成。自动策略发现:Agent 自主探索分块、融合、布局、占用率及主机端重构等优化策略,而非在固定空间内搜索。真实应用部署:直接面向生产级软件优化,以应用自身 GPU 代码为基线进行端到端验证,非简化 Benchmark。可审计测量协议:通过单一环境开关在原始路径与优化路径间交错切换,使用程序自带检查与计时器,确保加速比真实可信。跨代 GPU 适配:支持 A100/H100/B200 运行时架构分发,同一代码库按架构自动选择最优 Kernel 路径。ForgeStencil的技术原理双 Agent 协同架构:系统由 Kernel Agent 与 App Agent 组成闭环。Kernel Agent 负责理论发现,通过 Plan→Code→Profile 循环自主研究并合成逼近硬件物理极限的 Stencil 算子;App Agent 负责工程落地,定位应用性能热点、建立 GPU 基线、调用 Kernel Agent 构建的算子矩阵知识库锻造应用专属优化,完成正确性验证与原应用集成。算子矩阵与知识库进化:Kernel Agent 在优化过程中持续构建专用算子矩阵作为知识库,后续 App Agent 可复用已有技术;多并行 Agent 共享该知识库,实现经验的实时共享与集体同步进化,突破人类专家经验难以规模化传递的瓶颈。可审计端到端协议:测量以应用自身的生产级 GPU 实现为唯一基线,原始路径与优化路径仅通过单一USE_OURS开关区分,且原始路径与上游字节一致;使用程序内置的正确性检查和计时器,在多轮交错运行后取中位数,最终报告所有标准用例的几何平均加速比,从系统层面杜绝造假空间。Patch 模式与零源码捆绑:不捆绑任何第三方源码,每个应用仅提供上游出处记录、获取脚本和集成补丁,通过vendor.sh自动拉取指定版本上游代码,确保许可证清洁与结果可复现。微信关注回复“开源”,加入AI开源项目交流群如何使用ForgeStencil环境准备:克隆仓库并确保具备 NVIDIA GPU(A100 验证)、CUDA 12.x、C++17 编译器及 Python 3.9+ 环境。快速体验算子:运行python tools/run.py –stencil star_1 –shape 256 –gpu 0即可在 1 分钟内测量单算子性能并与 Halide 基线对比。端到端复现:进入目标应用目录执行./vendor.sh拉取上游源码,应用集成补丁后运行python ../../harness/run_e2e.py –app –gpu auto完成真实应用验证。驱动 Agent 工作:参考agents/README.md配置并启动 Kernel Agent 与 App Agent 的自主优化循环。查阅结果注册表:通过results/integration_registry.json查看 100 个已验证应用的审计加速比数据。ForgeStencil的核心优势零人工介入:从应用分析、热点定位、Kernel 锻造到集成验证全流程自动化,无需 HPC 专家参与决策。真实场景导向:直接优化生产级工业软件,42% 为真实工业生产软件,基线为应用自身 GPU 代码。研发效率飞跃:单应用优化从数月缩短至一天内,一周完成 100+ 应用,等效节省约 20–30 人年研发投入。性能表现强劲:端到端中位加速 1.41 倍,43% 应用 ≥1.5 倍,算子级几何平均 2.16 倍领先最优开源基线。跨架构可持续:支持多代 NVIDIA GPU 运行时分发,架构升级时可自动重锻 Kernel 以捕获新硬件特性。ForgeStencil的项目地址GitHub仓库:https://github.com/OpenBMB/ForgeStencilForgeStencil的同类竞品对比维度ForgeStencilHalide优化策略来源Agent 自主发现新策略,非固定空间搜索人类设计 DSL 与调度策略,自动化受限于预设规则部署范围支持真实应用端到端集成与验证主要面向单算子/图像处理管线,缺乏应用级自动部署基线对比以应用自身生产 GPU 代码为基准通常以简化参考实现或 CPU 版本为基准正确性验证使用程序自带检查,交错测量确保可信依赖框架内置测试,无系统级防造假协议知识积累多 Agent 共享算子矩阵知识库,经验可复用优化经验分散于各专家,难以规模化传递ForgeStencil的应用场景油气地震勘探:优化 RTM 逆时偏移、道达尔 mini-app 等核心算法,加速石油勘探数据处理流程。电磁仿真设计:提升 gprMax/FDTD 等 Yee 网格 Maxwell 方程求解效率,服务于雷达与芯片电磁分析。医学影像重建:加速非笛卡尔 MRI 重建、数字乳腺断层成像反投影等医疗影像计算负载。气候与天体物理:优化大气动力学、宇宙学模拟等 Stencil 密集型科学计算应用。量化金融计算:为 QuantLib 等金融机构定价库提供 Stencil 热点自动优化,降低交易计算时延。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Orchard - 微软研究院开源的 Agentic AI 建模框架下一篇MemHarness - 上海 AI Lab 等推出的智能体记忆重构框架相关文章GPT-5.5-Cyber – OpenAI 推出的网络安全专用模型AI小集3Whisk – 谷歌推出的 AI 图像生成工具AI小集10Bolt․new – AI全栈 Web 编程工具,自动写代码、运行、部署AI小集1211个免费AI食谱与健康管理应用,量身定制食谱、实时监测健康AI小集6olmOCR – Ai2 开源的 PDF 转结构化文档工具AI小集3buffett-skills – 开源Claude Code Skill合集,复现巴菲特决策AI小集2暂无评论再想想发表评论暂无评论…热门工具LoomyLibTV绘蛙AIAiPPT秘塔AI搜索蛙蛙写作堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录纳逗Pro图改改AstraFlow星图不繁简历Lumina纳米Work最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!35秒前Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent3分钟前MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架6分钟前Orchard – 微软研究院开源的 Agentic AI 建模框架19小时前E-Bench – 腾讯混元等推出的智能体评测基准24小时前SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型1天前Polar – AI 浏览器,自动跨站收集整合信息1天前GenOffice – Genspark 推出的本地 AI Office 客户端2天前Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型2天前MindMemOS – 华为诺亚方舟开源的 AI Agent 记忆操作系统2天前万有无界 – 阿里云推出的多角色 Agent 协作工作台2天前PicsetAI – 电商 AI 视觉设计工具,完成输出整套详情图2天前悟帆AI – 企业级 AI Agent 搭建平台,多 Agent 并行调度4天前FeyNoBg – Feyn Labs 开源的自动背景去除模型4天前Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型5天前