跳到正文

精选深读Hugging Face21:13

NeoMME:一个高效的多模态原生和多语言编码器

NeoMME: an efficient Multimodal-native and Multilingual Encoder

多模态原生加多语言,编码器效率之争有新选手,想省算力的团队可对比测试。

判断

正在给视觉文档检索选编码器的团队,应把 NeoMME-260M 放进与 ColModernVBERT 同分辨率、同 GPU 的对比清单,而不是只看它是否来自生成式 VLM 路线。

依据

Hugging Face 团队 Tony Wu、Aurélien Lac 在 2026年9月3日文章称,NeoMME 是 260M 和 800M 的多语言多模态编码器,不用独立预训练视觉塔或因果语言模型。机制上,它把图像切成 32×32 非重叠 patch(图像块),用小型 MLP 投影后与文本 token(词元)进入同一个双向 Transformer,并以掩码离散扩散目标从零预训练;检索任务则按 ColPali 的页面图像方案微调。对照数字:在 2048×2048 图像输入、NVIDIA L40S 上,260M 模型每秒约编码 51 页,约为 ColModernVBERT 的两倍;分层 token pooling(词元池化)和非对称量化把 late-interaction(后期交互)索引存储从每页约 1.5 MB 压到 6 kB,缩小 255×,同时保留超过 95% 基线 nDCG@10。

  • NeoMME-260M 吞吐约 51 页/秒
  • 对 ColModernVBERT约 2 倍
  • 每页索引存储约 1.5 MB 到 6 kB
  • 存储缩减255× 更小
NeoMME-260M 的吞吐与索引存储对照

没写清 材料没有给出 NeoMME 在中文、多语言检索上的分项 nDCG@10,也没有 800M 的吞吐、显存和长上下文成本,因此不能替它补出全场景省算力结论。

下一步 在 Hugging Face Transformers 加载 NeoMME-260M,用 ViDoRe v3 同页图像复测 nDCG@10 与 L40S 每页延迟,再与 ColModernVBERT 对比。

本期其他新闻

  1. 行业动态

    一线防御者的黎明:10亿美元保护关键服务

    OpenAI

  2. 行业动态

    Legora在几分钟内用GPT-6 Astra审查了41份文档

    OpenAI

  3. 行业动态

    Playco使用GPT-6 Astra将游戏原型制作中的手动修复减少了50%

    OpenAI

  4. 精选深读

    GPT-6 Astra

    Simon Willison

  5. 精选深读

    WeatherNext 3:我们最先进、最准确的全球天气AI模型

    Google DeepMind