跳到正文

精选深读Hugging Face22:00

LFM2.5-VL-3B:为边缘端提供更好、更快的视觉能力

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

3B视觉模型抢边缘市场,但实测精度与端侧算力平衡待验证。

判断

做端侧读屏、读文档的团队,可以把视觉处理从默认云端调用改为设备内本地推理,选型清单里多出一个 3.1B 候选;但计数类任务先保留云端兜底。

依据

LiquidAI 在 Hugging Face 发文称 LFM2.5-VL-3B 是可在自有硬件上运行的最强视觉语言模型(vision-language model,同时处理图像和文字的模型)。它把 SigLIP2 400M NaFlex 视觉编码器接在与 LFM2.5-2.6B 文本模型相同的预训练骨干上,预训练约 34T tokens,视觉数据是上一代的 4 倍,并用原位扩展分词器把词表翻倍到 128K,以覆盖非拉丁文字。对照表把变化写得比宣称更清楚:屏幕理解 ScreenSpot-v2 Mobile 从上一代 LFM2-VL-3B 的 7.6 升到 81.2,指代定位 RefCOCO-avg 从 57.1 升到 87.9,工具调用 ToolSandbox 从 26.4 升到 59.5,平均分从 57.2 升到 69.4。代价同样在表里:计数 CountBenchQA 从 92.2 降到 87.3,指令遵循 IFBench 只有 25.8,低于 gemma-4-E4B-it 的 39.2。

  • ScreenSpot-v2 Mobile(前代7.6)81.2
  • RefCOCO-avg(前代57.1)87.9
  • ToolSandbox(前代26.4)59.5
  • 综合平均(前代57.2)69.4
LFM2.5-VL-3B 与前代 LFM2-VL-3B 的四项可对照分数,0–100 归一化

没写清 文章只列出「Inference speed on CPU and GPU」这一节,正文在「ships w」处截断,没有给出延迟、显存占用和测试机型,所以端侧算力是否真的够用无法从材料判断。

下一步 上线前在自家目标机型上实测首字延迟与显存占用,并复跑 CountBenchQA 和 ScreenSpot-v2 Mobile 两项。

本期其他新闻

  1. 行业动态

    引用 Florian Herrengt

    Simon Willison

  2. 行业动态

    我写了一本AI教科书——还要多久AI能写得更好?

    Interconnects

  3. 行业动态

    从辅助到执行:企业如何让AI落地应用

    OpenAI

  4. 行业动态

    RingCentral如何从工程到运维构建AI原生工作

    OpenAI

  5. 精选深读

    将手语AI交到用户手中

    Google DeepMind

  6. 精选深读

    从专有LLM API中窃取推理轨迹

    Simon Willison

  7. 精选深读

    自然语言文本不存在无损变换

    Simon Willison