精选深读Hugging Face21:13
NeoMME:一个高效的多模态原生和多语言编码器
NeoMME: an efficient Multimodal-native and Multilingual Encoder
多模态原生加多语言,编码器效率之争有新选手,想省算力的团队可对比测试。
判断
正在给视觉文档检索选编码器的团队,应把 NeoMME-260M 放进与 ColModernVBERT 同分辨率、同 GPU 的对比清单,而不是只看它是否来自生成式 VLM 路线。
依据
Hugging Face 团队 Tony Wu、Aurélien Lac 在 2026年9月3日文章称,NeoMME 是 260M 和 800M 的多语言多模态编码器,不用独立预训练视觉塔或因果语言模型。机制上,它把图像切成 32×32 非重叠 patch(图像块),用小型 MLP 投影后与文本 token(词元)进入同一个双向 Transformer,并以掩码离散扩散目标从零预训练;检索任务则按 ColPali 的页面图像方案微调。对照数字:在 2048×2048 图像输入、NVIDIA L40S 上,260M 模型每秒约编码 51 页,约为 ColModernVBERT 的两倍;分层 token pooling(词元池化)和非对称量化把 late-interaction(后期交互)索引存储从每页约 1.5 MB 压到 6 kB,缩小 255×,同时保留超过 95% 基线 nDCG@10。
- NeoMME-260M 吞吐约 51 页/秒
- 对 ColModernVBERT约 2 倍
- 每页索引存储约 1.5 MB 到 6 kB
- 存储缩减255× 更小
没写清 材料没有给出 NeoMME 在中文、多语言检索上的分项 nDCG@10,也没有 800M 的吞吐、显存和长上下文成本,因此不能替它补出全场景省算力结论。
下一步 在 Hugging Face Transformers 加载 NeoMME-260M,用 ViDoRe v3 同页图像复测 nDCG@10 与 L40S 每页延迟,再与 ColModernVBERT 对比。