跳到正文

精选深读Hugging Face21:13

NeoMME:高效的多模态原生和多语言编码器

NeoMME: an efficient Multimodal-native and Multilingual Encoder

新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。

判断

给做跨语言视觉文档检索的团队:若瓶颈是每页索引存储和 GPU 吞吐,应把 NeoMME-Retriever 列为候选,而不是先套生成式视觉语言模型;260M 版在 L40S 上约 51 页/秒,但材料只公布到 800M,更大规模是否继续划算要自测。

依据

Hugging Face 文章由 Tony Wu 和 Aurélien Lac 在 9月3日发布,称 NeoMME 是 260M 与 800M 的多语言多模态编码器。机制上,它不接预训练视觉塔,也不用因果语言模型;视觉语言模型(VLM)通常先由独立视觉编码器出特征,再经投影器送进因果解码器,而 NeoMME 让文本 token 和 32×32 图像 patch 进入同一个双向 Transformer,用离散掩码扩散目标(masked discrete-diffusion objective)从零训练。检索端 NeoMME-Retriever 按 ColPali 的页面图像方法微调,一次前向同时返回 dense(稠密向量)和 late-interaction(后期交互)嵌入。对照数字:在 NVIDIA L40S 上以 2048×2048 输入,260M 版约 51 页/秒,约为 ColModernVBERT 吞吐的两倍;层次 token pooling 与非对称量化把 late-interaction 索引从约 1.5 MB/页压到 6 kB/页,缩小 255 倍,并保留超过 95% 的基线(baseline)nDCG@10(排序质量指标)。

  • 260M 编码吞吐约 51 页/秒
  • 对比 ColModernVBERT约 2 倍
  • 索引存储/页1.5 MB → 6 kB
  • nDCG@10 保留>95%
NeoMME-Retriever 的吞吐、索引存储与精度保留对照

没写清 材料没有给跨语言检索的逐语言 nDCG@10,也没有 800M 版的吞吐和索引压缩数字,因此不能替它补上多语言增益与大规模成本结论。

下一步 下一步核对技术报告是否公布 800M 版在 ViDoRe v3 各语言子集的 nDCG@10,以及同 L40S 设置下的吞吐。

本期其他新闻

  1. 行业动态

    OpenAI 的恶意代理被发现通过公共维基进行通信

    Simon Willison

  2. 行业动态

    八月通讯已发布

    Simon Willison

  3. 行业动态

    前线防御者的黎明:10亿美元保护关键服务

    OpenAI

  4. 精选深读

    推出 WeatherNext 3,我们最先进、最准确的全球天气 AI 模型

    Google DeepMind