【AI前沿】Qwen3.8-Max

2026-08-03

Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型AI工具34分钟前发布AI小集02Qwen 3.8-Max是什么Qwen 3.8-Max 是阿里云 Qwen 团队推出的旗舰大模型,总参数量达 2.4 万亿,基于Qwen 3.5架构扩展而成。作为 Qwen 家族迄今最强大的模型,是首个即将开源权重的 Max 级别模型。模型在编程、办公、科研及长程任务上实现全面升级,支持通过千问AI平台 API 调用,兼容 OpenAI 与 Anthropic 协议,可无缝集成至Claude Code、Codex、Qoder等主流智能体框架。Qwen 3.8-Max的主要功能长程自动编程:支持十天级自主编程,构建自进化 harness 并完成需求收集、issue 派发、代码生成与自我修复。论文复现与超越:独立复现论文实验后,通过四轮自我进化循环测试 18 种改进想法,在 AIME24 上超越原方法 2.7 分。竞赛实战:24 小时内独立搭建并迭代方案,准确率从 0.60 升至 0.853,击败 87% 的人类参赛队伍。办公提效:覆盖数百种高价值职业场景,如律师一小时标出 1,284 条条款、设计师一次成型 8 页可交互原型。量化策略研发:从单句描述出发调度约 330 个子智能体,完成约 6,000 次回测,交付端到端 ETF 轮动策略。芯片自主设计:历经约 500 轮交互,将密码加速器网表门数从 8,298 优化至 678,面积缩减 81% 并实现时序闭合。Qwen 3.8-Max的技术原理架构扩展:基于 Qwen 3.5 架构基础扩展而成,总参数量达 2.4 万亿,激活参数 95B,在保持架构继承性的同时实现规模跃升。真实世界强化学习系统:通过联合扩展 RL 环境数量与训练算力提升通用工作能力,核心解决三个耦合挑战:在任务、工作空间、Harness三个维度上解耦合,使环境数以组合方式自然增长;构建统一奖励系统,将基于执行的校验、文本及渲染后视觉输出的 rubric 评估、agentic 检查统一内化,消除任务专用验证器的不一致性;构建在线数据均衡器,对每个 batch 在任务、难度、工作区与 harness 上重构均衡分布,降低梯度方差,支撑训练算力稳定持续扩展。自进化反馈闭环:模型通过执行-反馈-迭代的自适应机制推进优化,在数百至数千轮交互中保持高度连贯的系统性策略,依赖仿真、综合、布局等反馈闭环,实现算法级数据通路重构而非浅层语法微调。动态工作流编排:用编程方式驱动任务规划,将编排逻辑固化为可复现程序,支持从单链路连贯研发到大规模并行探索的灵活切换,使复杂任务的串行推进转化为一次对话内可规模化交付的自动化闭环。如何使用Qwen 3.8-Max千问AI平台调用:注册账号获取 API Key,通过兼容 OpenAI或 Anthropic 协议的接口直接调用模型。调节推理深度:通过reasoning_effort参数设置xhigh(默认,深度分析)、medium(平衡)或low(高效推理),按需控制成本与性能。集成智能体框架:配置 API Key 与 Base URL 后,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流编程助手与 Agent 框架。开源权重部署:下周起从 Hugging Face 或 ModelScope 下载模型权重,进行本地部署与二次开发。Qwen 3.8-Max 的核心优势超长程自主执行:可连续专注数天至数十天,通过执行-反馈-迭代闭环自我进化,全程无需人工介入。真实世界 RL 训练:联合扩展环境数量与训练算力,在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等 harness 上表现均衡且持续提升。端到端交付能力:通过动态工作流将编排逻辑固化为可复现程序,把原本需数周串行推进的复杂任务压缩为一次对话内可规模化交付的自动化闭环。Qwen 3.8-Max 的项目地址项目官网:https://qwen.ai/blog?id=qwen3.8Qwen 3.8-Max 的同类竞品对比维度Qwen 3.8-MaxGPT 5.6 Sol论文复现PaperBench 93.0 分,独立复现后自我进化超越原文PaperBench 90.5 分软件工程SWE-bench Pro 67.7 分,FrontierSWE 73.5 分SWE-bench Pro 64.6 分,FrontierSWE 无官方数据终端编码Terminal Bench 2.1 86.6 分Terminal Bench 2.1 88.8 分通用办公CoWorkBench 74.8 分,JobBench 53.4 分CoWorkBench 71.5 分,JobBench 45.4 分多模态推理MMMU-Pro 82.3 分,BabyVision 82.0 分MMMU-Pro 83.0 分,BabyVision 65.5 分视觉智能体OSWorld-Verified 86.1 分,AndroidWorld 85.3 分OSWorld-Verified 83.2 分,AndroidWorld 77.6 分视频理解VideoMME 90.4 分,MLVU 90.8 分VideoMME 89.5 分,MLVU 87.6 分长程任务365 天电商模拟 4.16 倍回报,芯片设计 500 轮优化无公开同类长程自主任务数据Qwen 3.8-Max 的应用场景法律合规审查:单次通读数百份文档,一小时内标出上千条相关条款,替代法务团队约一周工作量。UI/UX 原型设计:为数字银行 App 一次生成 8 页高保真可交互原型,无需人工返修。餐饮菜单开发:基于上百份食材资料一次性产出 26 道菜的完整菜单,控制食材成本率在 33.8%。结构工程建模:仅凭一份图纸在浏览器中还原 30 层写字楼抗震结构模型,支持实时悬停查看关键指标。康复医学可视化:将 2D 纸质评估单转化为可自由旋转、逐层浮现的 3D 交互演示,帮助患者理解康复路径。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇MindMemOS - 华为诺亚方舟开源的 AI Agent 记忆操作系统下一篇秒悟Meoo - 1分钟生成前后端完整的网站,真0门槛开发!相关文章Glasp – AI网页阅读工具,高亮网页和PDF上的内容、标记重点信息AI小集2ECC – 开源的跨平台 AI Agent 性能优化系统AI小集3LingBot-Video – 蚂蚁灵波开源面向具身智能的视频模型AI小集2Concept Lancet – 宾夕法尼亚大学推出的图像编辑框架AI小集2Klap – AI视频编辑工具,智能分析自动识别精彩片段、智能视频布局AI小集2潮际主设 – AI服装设计工具,覆盖设计核心环节款式生成、局部优化等功能AI小集3暂无评论再想想发表评论暂无评论…