精选深读Hugging Face21:13
NeoMME:高效的多模态原生和多语言编码器
NeoMME: an efficient Multimodal-native and Multilingual Encoder
新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。
判断
给做跨语言视觉文档检索的团队:若瓶颈是每页索引存储和 GPU 吞吐,应把 NeoMME-Retriever 列为候选,而不是先套生成式视觉语言模型;260M 版在 L40S 上约 51 页/秒,但材料只公布到 800M,更大规模是否继续划算要自测。
依据
Hugging Face 文章由 Tony Wu 和 Aurélien Lac 在 9月3日发布,称 NeoMME 是 260M 与 800M 的多语言多模态编码器。机制上,它不接预训练视觉塔,也不用因果语言模型;视觉语言模型(VLM)通常先由独立视觉编码器出特征,再经投影器送进因果解码器,而 NeoMME 让文本 token 和 32×32 图像 patch 进入同一个双向 Transformer,用离散掩码扩散目标(masked discrete-diffusion objective)从零训练。检索端 NeoMME-Retriever 按 ColPali 的页面图像方法微调,一次前向同时返回 dense(稠密向量)和 late-interaction(后期交互)嵌入。对照数字:在 NVIDIA L40S 上以 2048×2048 输入,260M 版约 51 页/秒,约为 ColModernVBERT 吞吐的两倍;层次 token pooling 与非对称量化把 late-interaction 索引从约 1.5 MB/页压到 6 kB/页,缩小 255 倍,并保留超过 95% 的基线(baseline)nDCG@10(排序质量指标)。
- 260M 编码吞吐约 51 页/秒
- 对比 ColModernVBERT约 2 倍
- 索引存储/页1.5 MB → 6 kB
- nDCG@10 保留>95%
没写清 材料没有给跨语言检索的逐语言 nDCG@10,也没有 800M 版的吞吐和索引压缩数字,因此不能替它补上多语言增益与大规模成本结论。
下一步 下一步核对技术报告是否公布 800M 版在 ViDoRe v3 各语言子集的 nDCG@10,以及同 L40S 设置下的吞吐。