【环球网科技综合报道】9月5日消息,微信于官方平台宣布,微信视觉团队把微信线上每天调用十亿量级的通用多模态嵌入模型 WeMM-Embedding开源,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。
WeMM-Embedding 从统一多模态架构出发,通过两阶段训练提升内容区分能力,再用知识蒸馏与套娃表示兼顾小模型效果和大规模部署效率。
微信方面表示,“如今这套能力已经服务于微信多个推荐与搜索场景。我们也将模型权重、推理代码与评测工具全部开放,希望它能帮助更多研究者和开发者构建多模态检索、推荐与智能体应用。”(思瀚)