跳到正文

精选深读Hugging Face21:13

NeoMME:一种高效的多模态原生和多语言编码器

NeoMME: an efficient Multimodal-native and Multilingual Encoder

新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。

判断

跨语言视觉文档检索团队应把 NeoMME-Retriever 260M 列为首选候选,而不是默认沿用生成式 VLM 检索堆栈;代价是放弃因果解码器的生成能力,并接受多语言长尾与 800M 收益未在材料中量化。

依据

Hugging Face 团队 Tony Wu 与 Hcompany 的 Aurélien Lac 在 9月3日文章中称,NeoMME 是不带独立预训练视觉塔(vision tower,专门抽取图像特征的视觉编码器)和因果语言模型(causal language model,逐词生成文本的解码器)的多语言多模态编码器。机制上,单一双向 Transformer 同时处理文本 token 与 32×32 图像 patch;预训练用 masked discrete-diffusion(掩码离散扩散,遮住文本 token 后让模型重建),高掩码率迫使模型依赖可见图像证据,而不是语言先验。Retriever 双头一次前向返回 dense(稠密向量)与 late-interaction(后交互,多向量匹配)嵌入。数字上,260M 模型在 NVIDIA L40S、2048×2048 输入下约 51 页/秒,约两倍 ColModernVBERT;分层 token pooling 与非对称量化把后交互索引从约 1.5 MB/页压到 6 kB/页(255× 更小),同时保留 >95% baseline nDCG@10。取舍在于:这适合索引成本敏感的跨语言检索,但材料没有证明 800M 相对 260M 在多语言长尾上的 nDCG@10 增益,不能把吞吐与压缩直接当成检索质量提升。

  • 260M 编码吞吐约 51 页/秒
  • 单页索引存储约 1.5 MB → 6 kB
  • 存储缩减255× 更小
  • nDCG@10 保留>95%
NeoMME 的吞吐、索引存储与精度保留数字对照。

没写清 材料没给 800M 相对 260M 在跨语言或低资源语言上的 nDCG@10 差值,也没说明 6 kB/页精度保留对应哪个模型尺寸。

下一步 下一步核对官方 ViDoRe v3 排行榜或技术报告,确认 260M 与 800M 在跨语言子集上的 nDCG@10 和索引大小是否同时公开。

本期其他新闻

  1. 行业动态

    前线防御者的黎明:10亿美元保护关键服务

    OpenAI

  2. 行业动态

    Legora使用GPT-6 Astra在几分钟内审阅了41份文档

    OpenAI

  3. 行业动态

    Playco使用GPT-6 Astra将游戏原型制作中的手动修复减少50%

    OpenAI

  4. 精选深读

    推出WeatherNext 3,我们最先进、最准确的全球天气AI模型

    Google DeepMind

  5. 精选深读

    推出Gemini 3.8 Flash和3.8 Flash Cyber

    Google DeepMind

  6. 精选深读

    在100个GRPO步骤中微调350M模型以获得更好的结构化输出

    Hugging Face