WeMM-Embedding输入类型完全指南:文本、图像、视频、文档与交错多模态的5种用法

发布时间:2026/10/11 14:18:32
WeMM-Embedding输入类型完全指南:文本、图像、视频、文档与交错多模态的5种用法
人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载WeMM-Embedding 是微信视觉团队WeChat Vision开源的通用多模态 Embedding 模型家族能把文本、图像、视频、视觉文档、交错多模态这 5 种输入统一编码成同一个向量空间里的嵌入向量Embedding一个模型就能完成跨模态的语义检索。本文带你从零看懂这 5 种输入类型分别怎么用以及它们各自的典型场景。一、5种输入类型总览一张表看懂无论输入是什么模态WeMM-Embedding 的输出都是同一个维度的向量——不同模态的向量可以直接做相似度计算余弦相似度这就是统一表示的意义。输入类型典型场景示例 文本文搜图、文搜视频、语义搜索用一段描述从图库中找照片️ 图像以图搜图、图文跨模态检索找同款商品、以图搜描述 视频文搜视频、视频推荐湖心船上看山景定位视频片段 视觉文档图表/票据/页面截图检索问题定位到相关图表 交错多模态图文混排内容理解与检索商品页图标题价格卖点整体编码 全系列 3 个模型2B / 4B / 9B都支持以上全部 5 种输入音频输入暂不支持。模型规模与维度一览模型支持的 Matryoshka 维度WeMM-Embedding-2B64 / 128 / 256 / 512 / 1024 / 2048WeMM-Embedding-4B64 / 128 / 256 / 512 / 1024 / 2560WeMM-Embedding-9B64 / 128 / 256 / 512 / 1024 / 2048 / 4096二、文本嵌入从一句话到检索结果最基础的用法把一段自然语言编码成向量。WeMM-Embedding 的文本嵌入特别强的一点是细粒度语义区分——连图片里包含的文字招牌、水印都能理解。比如用文字一家转角建筑门上方写着 Red Corner Cafe 的招牌去检索模型能精确命中带这块招牌的店面而不是其他长得像的转角咖啡馆。下面这张就是模型用来做干扰项的相似店面在 TextCaps 等图中文字检索基准上WeMM-Embedding 都能把正确目标排到 Top-1。三、图像嵌入以图搜图与图文跨模态图像输入走的是视觉语言模型VLM预处理管线图片被切分成视觉 token与文本 token 在同一个 Transformer 里融合编码。这意味着图像嵌入天然理解图像里的语义而不只是像素相似度。看一个真实案例输入一段很长的描述——一只龟坐在长满青苔的漂浮树干上水面漂着泡沫远处有枯草——模型在 5000 张候选图里精准找到了下面这张图Top-1 命中两个近似干扰项只有龟木头但缺少青苔、泡沫等细节的图都被正确排在了后面。这就是细粒度描述检索的威力。四、视频嵌入把整段视频压成一个向量视频输入会被均匀采样成帧序列官方评测使用 64 帧按帧包frame bundle约定展开后与文本一起编码输出和文本/图像完全同构的向量。典型场景是文搜视频在 MSR-VTT 基准中用文本 the mountain views are from a boat on the center of a lake湖中心船上的山景视角检索WeMM-Embedding-9B 能在一千个候选视频中把从船上拍摄湖面山景的那段排到第一并把陆上旅行视角等干扰视频排到后面。五、视觉文档嵌入检索图表、票据与页面截图视觉文档VisDoc任务处理的是以图像形式存在的文档内容图表、表格、票据、合同页、网页截图。模型需要理解图中的数字、单位和类别标签而不只是版式。看一个图表检索案例问题是按每 100 千卡热量计的羊肉与山羊肉生产的土地利用是多少模型要在 500 张图表里找到单位是每 100 千卡而不是相近的每 100 克蛋白质的那张单位、指标、类别三个条件全部对上才能命中这也是 VisDoc 任务得分最高的关键。六、交错多模态图文混排在同一个 Prompt 里第 5 种输入是前四种的组合体一段 Prompt 里文本和图片按顺序穿插排列。输入消息中的内容列表content list可以包含多个text、image、video项模型会把它们按占位符位置交错插入后一起编码。典型应用是商品信息理解与检索MCMR 任务候选商品 商品主图 Title / Description / Price / Features字段整体作为一个图文混合样本编码查询则是一条文字描述。相关解析逻辑见 mmeb_v3_eval/src/data/eval_dataset/mcmr_dataset.py交错插入的处理在 mmeb_v3_eval/src/model/processor.py。在 MMEB-v3 的 47 个 Agent 任务上交错多模态理解能力让 WeMM-Embedding 拿到同规模第一9B 达 50.1 分。七、快速上手三步跑通第一种输入依赖非常轻核心就是transformerssentence-transformerspip install -r requirements.txt仓库自带两个最小推理示例官方推荐transformers5.2.0以保证预处理行为一致python examples/transformers_inference.py \ --model /path/to/WeMM-Embedding-2B \ --image /path/to/image.jpg \ --video /path/to/video.mp4 \ --dimension 2048它会对同一条消息里的文本、图像、视频分别输出独立嵌入向量省略--dimension则使用完整维度。另外 examples/sentence_transformers_inference.py 展示了用SentenceTransformer.encode()的更简洁写法——文本、图像、视频都可以直接encode()。生产环境部署可用 vLLM 或 SGLang 起推理服务一键脚本在 scripts/serve_vllm.sh 与 scripts/serve_sglang.shSGLang 需先跑 scripts/patch_sglang_video.py 打视频补丁。八、Matryoshka 维度一个模型输出多种向量长度所有模型都支持MatryoshkaMRL嵌入截取完整向量前 d 维再 L2 归一化即可得到 d 维表示无需重新训练。维度越短向量库存储和检索越快性能损失很小——以 2B 模型为例256 维时仍保留完整维度图像/视频性能的98.7%九、性能表现与评测代码WeMM-Embedding 在 MMEB-v278 个数据集与 MMEB-v3190 个任务上全面领先同规模模型模型MMEB-v2 AVG图像视频视觉文档WeMM-Embedding-2B77.979.670.880.7WeMM-Embedding-4B79.280.872.182.0WeMM-Embedding-9B80.681.974.383.3MMEB-v3 上 9B 模型更是拿下 Agent 任务 50.1 分的全场最高分。完整对比见 README.md 的评测章节与技术报告 assets/WeMM_Embedding_tech_report.pdf。评测代码在 mmeb_v3_eval/mmeb_v3_eval/README.md 有数据下载、单机/多机多卡的完整命令如scripts/run_eval.sh。另外docs/ 是一个交互式项目页内置 6 个真实检索案例数据见 docs/data/cases.json可以在线查看每个查询的 Top-1 命中与干扰项分析。十、总结选哪种输入只有文字→ 直接传文本消息覆盖文搜图/文搜视频/语义搜索有一张图→ 图像消息适合以图搜图、同款识别有一段视频→ 视频消息采样 64 帧编码适合视频检索图表/票据/截图→ 视觉文档消息适合 RAG 图表问答、单据归档检索图文混排内容→ 交错多模态消息商品理解、GUI 轨迹、多截图对话都可以整体编码。无论哪种输入输出的都是同一个空间里的向量——这就是 WeMM-Embedding 作为多模态 Embedding 统一底座的核心价值5 种输入1 个向量空间。赞分享人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载相关推荐WeMM-Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间WeMM Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间 WeMM Embedding 是微信视觉团队WeCh人工智能大模型Embedding多模态模型评测模型推理服务Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入 本文围绕 Xinference 的 Embedding模型推理服务人工智能大模型本地部署多模态语音vLLM-Omni多模态输入处理文本、图像、音频、视频全支持vLLM Omni多模态输入处理文本、图像、音频、视频全支持 vLLM Omni是一个高效的 多模态推理框架 专门设计用于处理文本、图像、音频和视频等多种模人工智能大模型模型推理服务多模态语音音频媒体生成本地部署创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考