精选深读Hugging Face21:13
NeoMME:一种高效的多模态原生和多语言编码器
NeoMME: an efficient Multimodal-native and Multilingual Encoder
新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。
判断
跨语言视觉文档检索团队应把 NeoMME-Retriever 260M 列为首选候选,而不是默认沿用生成式 VLM 检索堆栈;代价是放弃因果解码器的生成能力,并接受多语言长尾与 800M 收益未在材料中量化。
依据
Hugging Face 团队 Tony Wu 与 Hcompany 的 Aurélien Lac 在 9月3日文章中称,NeoMME 是不带独立预训练视觉塔(vision tower,专门抽取图像特征的视觉编码器)和因果语言模型(causal language model,逐词生成文本的解码器)的多语言多模态编码器。机制上,单一双向 Transformer 同时处理文本 token 与 32×32 图像 patch;预训练用 masked discrete-diffusion(掩码离散扩散,遮住文本 token 后让模型重建),高掩码率迫使模型依赖可见图像证据,而不是语言先验。Retriever 双头一次前向返回 dense(稠密向量)与 late-interaction(后交互,多向量匹配)嵌入。数字上,260M 模型在 NVIDIA L40S、2048×2048 输入下约 51 页/秒,约两倍 ColModernVBERT;分层 token pooling 与非对称量化把后交互索引从约 1.5 MB/页压到 6 kB/页(255× 更小),同时保留 >95% baseline nDCG@10。取舍在于:这适合索引成本敏感的跨语言检索,但材料没有证明 800M 相对 260M 在多语言长尾上的 nDCG@10 增益,不能把吞吐与压缩直接当成检索质量提升。
- 260M 编码吞吐约 51 页/秒
- 单页索引存储约 1.5 MB → 6 kB
- 存储缩减255× 更小
- nDCG@10 保留>95%
没写清 材料没给 800M 相对 260M 在跨语言或低资源语言上的 nDCG@10 差值,也没说明 6 kB/页精度保留对应哪个模型尺寸。
下一步 下一步核对官方 ViDoRe v3 排行榜或技术报告,确认 260M 与 800M 在跨语言子集上的 nDCG@10 和索引大小是否同时公开。