【AI前沿】腾讯开源通用多模态Embedding模型 WeMM-Embedding

2026-09-02

WeMM-Embedding – 腾讯开源通用多模态Embedding模型AI工具8小时前发布AI小集02WeMM-Embedding是什么WeMM-Embedding 是腾讯微信视觉团队开源的通用多模态 Embedding 模型家族,提供 2B/4B/9B 三种规格。模型将文本、图像、视频、视觉文档及交错多模态输入统一编码到共享向量空间,在 MMEB-v2 基准排行榜位列第一,并已在微信视频号、公众号、搜索等推荐与检索业务中大规模落地。WeMM-Embedding的主要功能多模态统一编码:支持文本、图像、视频、视觉文档及任意交错的多模态输入,统一映射到共享稠密向量空间。灵活维度输出:基于 Matryoshka 表示学习,单次推理可输出 64 至 4096 维的嵌套向量,256 维即可保留近 99% 的全维性能。多任务适配:覆盖检索、分类、问答、视觉定位、跨域匹配、Agent 工具/GUI/记忆检索等场景。高效推理部署:支持 Transformers、Sentence Transformers、vLLM 和 SGLang 等多种框架,便于生产环境集成。WeMM-Embedding的技术原理架构设计:以 Qwen3.5 多模态大语言模型为骨干,通过在输入序列末尾追加特殊 token,取其最终层隐藏状态并经 L2 归一化得到输出表示,天然支持因果注意力下的任意交错多模态输入。两阶段训练策略:第一阶段用数亿对异构数据建立通用多模态对齐空间;第二阶段在精选数据上结合硬负样本、重排序器监督和跨尺度 Embedding 蒸馏进行细粒度精炼,实现从广覆盖到高精度的渐进提升。数据构建与精选:采用统一 Pair-Based 格式整合六大类监督数据;通过 Semantic-ID 引导的重采样平衡语义分布,利用多模态大模型自动过滤低质量样本并修正文本错误,同时针对文本、图像和视频分别构建显式硬负样本以增强判别能力。训练目标体系:标准配对数据采用 InfoNCE 对比学习并引入重复感知掩码避免假负样本;分级相关性数据采用评分差距加权的 CoSENT 排序损失;Stage 2 中引入重排序器分数提供任务级细粒度监督,以 9B 模型为教师通过双向 KL 散度向小模型蒸馏软相似度分布。微信关注回复“开源”,加入AI开源项目交流群如何使用WeMM-Embedding环境准备:克隆 GitHub 仓库并执行pip install -r requirements.txt安装依赖,推荐使用transformers==5.2.0以保证结果可复现。获取模型:从 Hugging Face 下载WeMM-Embedding-2B/4B/9B的模型权重到本地。Transformers 推理:运行examples/transformers_inference.py,传入模型路径及文本/图像/视频路径,指定–dimension获取对应维度的 Embedding。Sentence Transformers 推理:运行examples/sentence_transformers_inference.py,可直接使用 Hugging Face 模型 ID,通过encode()统一编码多模态输入。Matryoshka 降维:对全维向量取前d维后,使用torch.nn.functional.normalize重新 L2 归一化,即可得到低维表示。服务化部署:生产环境使用 vLLM(–runner pooling)或 SGLang(–is-embedding)启动推理服务,支持高并发调用。WeMM-Embedding的核心优势极致参数效率:2B 模型即超越此前领先的 8B 开源基线,重新定义了多模态 Embedding 的性能-效率边界。真正统一的多模态表示:原生支持文本、图像、视频、视觉文档及任意交错组合输入,无需为不同模态设计独立编码通路。灵活的 Matryoshka 维度:单次推理即可输出 64 至 4096 维向量,256 维仍能保留近 99% 的全维性能,显著降低存储与检索成本。经过大规模业务验证:已在微信视频号、公众号、搜索等核心业务的 14 项 A/B 测试中取得一致提升,并全量上线生产环境。先进的渐进式训练:通过”大规模对齐+精选蒸馏”两阶段策略,结合 Semantic-ID 数据精选与跨尺度知识蒸馏,实现广覆盖与高精度的兼顾。WeMM-Embedding的项目地址GitHub仓库:https://github.com/Tencent/WeMM-EmbeddingHuggingFace模型库:https://huggingface.co/collections/tencent/wemm-embeddingarXiv技术论文:https://arxiv.org/pdf/2608.24053WeMM-Embedding的同类竞品对比对比维度WeMM-EmbeddingQwen3-VL-Embedding开发方腾讯微信视觉团队阿里巴巴通义千问团队开源协议Apache 2.0Apache 2.0模型规格2B / 4B / 9B2B / 8B支持模态文本、图像、视频、视觉文档、交错多模态文本、图像、视频、视觉文档、交错多模态音频支持暂不支持暂不支持MMEB-v2 均分77.9 / 79.2 / 80.673.2 / 77.8MMEB-v3 均分56.0 / 58.2 / 59.550.9 / 53.5维度灵活性Matryoshka(64~4096 维,单次推理多维度输出)固定维度输出核心架构Qwen3.5 + 两阶段训练(对齐+精选蒸馏)Qwen3-VL + 对比学习生产验证已大规模部署于微信视频号、公众号、搜索、电商主要面向研究/开发者社区WeMM-Embedding的应用场景跨模态语义检索:模型支持以文搜图、以图搜文、以文搜视频等任意方向的跨模态检索,适用内容平台的海量素材库查找与版权监测。个性化推荐系统:将图文、视频内容编码为统一向量,用于候选召回、用户兴趣序列建模与跨域内容匹配,已落地于微信视频号、公众号及电商推荐场景。视觉文档理解与检索:对 PDF、图表、发票、截图等视觉文档进行向量化,支撑智能文档问答、票据归档检索及企业知识库构建。AI Agent 工具与记忆检索:为 Agent 提供工具调用检索、GUI 界面元素定位及长程记忆检索能力,支持复杂任务规划与多步骤交互。多模态内容分类与审核:将图像、视频内容映射到语义空间,实现物体识别、场景分类、动作检测及违规内容相似度比对与聚类分析。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇FireRedAudio - 小红书 FireRed 推出的通用音频语言模型下一篇秒悟Meoo - 1分钟生成前后端完整的网站,真0门槛开发!相关文章EmoLLM – 专注于心理健康支持的大语言模型AI小集3Mini DALL·E 3 – 北京理工联合上海 AI Lab等高校推出的交互式文生图框架AI小集2面试猫 – AI面试辅助工具,实时语音识别面试官问题AI小集6Julius – AI数据分析工具,自然语言互动分析获取可视化结果AI小集3HumanOmni – 阿里通义等推出专注人类中心场景的多模态大模型AI小集4Stable Diffusion 3 – Stability AI推出的新一代图像生成模型AI小集3暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀Lovart绘蛙AI美图设计室updream办公小浣熊秒哒最新收录DeepSkillAlphaVowXCellMetaDigChatArtLexcat最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!2分钟前FireRedAudio – 小红书 FireRed 推出的通用音频语言模型8小时前MiniMax H3 Max – MiniMax 推出的实时视频生成模型1天前Ling-3.0-flash-Fin – 蚂蚁百灵推出的首个金融增强模型1天前AI 技能成千上万怎么选?DeepSkill 精准搜索实战1天前Rome – 开源的智能体操作系统,自然语言生成完整应用2天前Headlong – Laude Institute 开源的 AI Agent 微框架2天前Miya – 时域科技推出的 AI 音乐应用,画面可随歌词律动3天前Zing-0.5 – Loopit 开源的实时交互视频世界模型3天前2026 年 AI 生成图文店门头效果图 – 7 款工具深度横评4天前Hy4 preview – 腾讯混元开源的新一代旗舰大模型4天前Gemini Omni 1.1 Flash – 谷歌推出的 AI 视频生成模型4天前Twoo – 双人共用 AI 伙伴应用,能同时听懂双方对话4天前Prime Agent – Prime Intellect开源的长周期AI Agent运行框架4天前shuohao-skills – 开源AI短剧制作Skill集合,包含完整工作流4天前