文 | 李炤锋编辑 | 张雨忻“长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。”过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。刚刚过去的7月,月之暗面发布Kimi K3。这款总参数2.8万亿、支持100万token上下文的MoE(混合专家模型),在Coding和长程Agent能力之外,出色的原生多模态能力是K3的另一个标签。所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与Agent