跳到正文

精选深读Hugging Face22:00

LFM2.5-VL-3B:为边缘端提供更好、更快的视觉能力

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

3B视觉模型抢边缘市场,但实测精度与端侧算力平衡待验证。

判断

选端侧视觉方案的团队,在 3B 档位该把 ScreenSpot-v2 这类屏幕理解与定位指标列为硬门槛,而不是只比总体平均分。

依据

LiquidAI 的 Samuel Stevens 等在 Hugging Face 发布 LFM2.5-VL-3B:它用 SigLIP2 400M NaFlex 视觉编码器,搭配与 LFM2.5-2.6B 文本模型相同的预训练主干,预训练约 34T tokens,视觉数据是之前的 4 倍,词表以就地扩展方式翻倍到 128K。机制在于它直接作答、不走推理链,所以实时和端上应用里响应更快。对着数字看:总体平均分 69.4,高于上一代 LFM2-VL-3B 的 57.2,与 InternVL 3.5 4B 的 69.4 持平,仍低于 Qwen3.5-4B 的 70.1;拉开差距的是 ScreenSpot-v2 Desktop 从 6.0 升到 78.7、RefCOCO-avg 从 57.1 升到 87.9。也就是说,赢面集中在屏幕理解和指代定位,不是全项领先。

  • 总体平均分 LFM2.5-VL-3B69.4
  • 总体平均分 上一代 LFM2-VL-3B57.2
  • 总体平均分 Qwen3.5-4B70.1
  • ScreenSpot-v2 桌面 上一代6.0
3.1B 模型与同档及更大模型的总体平均分对照,外加屏幕理解一项的代际落差

没写清 材料在「Inference speed on CPU and GPU」一节被截断,没有显存占用、延迟或吞吐数字,端侧算力与精度的平衡无法核对。

下一步 等 Hugging Face 页面补全推理速度章节后,核对 CPU 与 GPU 上的实测延迟或吞吐数字。

本期其他新闻

  1. 行业动态

    引用 Florian Herrengt

    Simon Willison

  2. 行业动态

    我写了一本AI教科书——还要多久AI能写得更好?

    Interconnects

  3. AI工具

    推出 OlmoEarth embeddings:从 OlmoEarth Studio 导出定制嵌入以供下游分析

    Hugging Face

  4. 精选深读

    DeepSeek V4 Pro 0813(在 OpenRouter 上)

    Simon Willison

  5. 精选深读

    将手语AI交到用户手中

    Google DeepMind