精选深读Hugging Face21:13
NeoMME:高效的多模态原生和多语言编码器
NeoMME: an efficient Multimodal-native and Multilingual Encoder
新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。
判断
跨语言视觉文档检索团队原来要在“上生成式 VLM 换多模态能力”和“保留分离编码器省算力”之间选;NeoMME 让 260M 直接进候选,但代价是索引栈要改成晚交互加量化,否则拿不到 6 kB/页的存储收益。
依据
Hugging Face 团队说,NeoMME 是 260M 和 800M 的多语言多模态编码器,不用单独预训练视觉塔,也不用因果语言模型;它把文本 token 和 32×32 图像 patch 送进同一个双向 Transformer,从头用 masked discrete-diffusion(离散掩码扩散:遮住部分文本再让模型重建)训练。检索、分类和 token 标注不靠自回归生成文本,所以团队砍掉 causal decoder(因果解码器:逐词生成文本的模块)的参数和算力,并用动态分辨率让高分辨率文档页占更多 token。对做 visual document retrieval(视觉文档检索:用页面图像找文档)的人,NeoMME-Retriever 一次前向同时返回 dense 和 late-interaction embedding(密集向量与晚交互向量:后者保留多向量做细粒度匹配)。可对照的是:在 NVIDIA L40S GPU、2048×2048 输入下,260M 每秒约 51 页,约为 ColModernVBERT 的两倍;分层 token pooling(分层 token 池化:把多个 token 向量合并成更少向量)和非对称量化把晚交互索引从约 1.5 MB/页压到 6 kB/页,缩小 255×,同时保留 >95% baseline nDCG@10(前 10 条排序质量指标)。取舍在于省掉视觉塔和生成解码器降低基础模型开销,但晚交互索引仍需单独存储和量化;若团队已押注单向量索引或生成式 VLM 后处理,迁移成本不在编码器本身。
- 260M 编码吞吐约 51 页/秒
- 对比 ColModernVBERT约 2 倍
- 晚交互索引每页约 1.5 MB → 6 kB
- 索引压缩后 nDCG@10>95% 基线
没写清 材料没给 NeoMME 在非英语、非拉丁语系查询上的单独 nDCG@10,也没说 260M 与 800M 在同样索引压缩下的检索质量差,因此不能替它判断哪一档该优先。
下一步 下一步看 Hugging Face 的 NeoMME collection 或技术报告是否放出 ViDoRe v3 上 260M/800M 的逐语言 nDCG@10 和 6 kB/页配置的复现脚本。