#AI
微信开源 WeMM 多模态嵌入登顶 MMEB-v2
腾讯微信视觉团队开源了 WeMM-Embedding,一组通用多模态嵌入模型,代码和权重同时挂上 GitHub 与 Hugging Face,代码部分采用 Apache 2.0 协议。覆盖文本、图像、视频、视觉文档及任意交错混排输入,音频暂不支持。
系列给了 2B、4B、9B 三个规格。在 MMEB-v2 的 78 个数据集上,**2B 综合拿到 77.9 分**,比同规格的 Qwen3-VL-Embedding-2B 高 4.7 分,同时略微超过参数量四倍的 Qwen3-VL-Embedding-8B(77.8 分);9B 则以 80.6 分登顶榜单。训练靠两段走:先大规模多模态对齐,再用精选数据精修,加入细粒度监督与跨尺度知识迁移,把大模型学到的往小模型上导。
💡 为什么值得看2B 超越 8B 参数,降维输出利好国产多模态 RAG 成本。
查证
来源档案
CocoLoop
二线中文科技媒体,报道转述自官方 GitHub 仓库与 arXiv 技术报告
内核榜单分数、模型规格与协议信息与 arXiv 技术报告 2608.24053 及 GitHub 仓库一致,可信;线上 A/B 与内部任务数字为单方声明,外部无法复现,需保留
延伸阅读
官方给出 98.7% 效果保持,索引体积降八分之一,对国内跑多模态 RAG 的团队是能直接拿去算账的数字