精选深读Hugging Face22:00
LFM2.5-VL-3B:为边缘端提供更好、更快的视觉能力
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
3B视觉模型抢边缘市场,但实测精度与端侧算力平衡待验证。
判断
选端侧视觉方案的团队,在 3B 档位该把 ScreenSpot-v2 这类屏幕理解与定位指标列为硬门槛,而不是只比总体平均分。
依据
LiquidAI 的 Samuel Stevens 等在 Hugging Face 发布 LFM2.5-VL-3B:它用 SigLIP2 400M NaFlex 视觉编码器,搭配与 LFM2.5-2.6B 文本模型相同的预训练主干,预训练约 34T tokens,视觉数据是之前的 4 倍,词表以就地扩展方式翻倍到 128K。机制在于它直接作答、不走推理链,所以实时和端上应用里响应更快。对着数字看:总体平均分 69.4,高于上一代 LFM2-VL-3B 的 57.2,与 InternVL 3.5 4B 的 69.4 持平,仍低于 Qwen3.5-4B 的 70.1;拉开差距的是 ScreenSpot-v2 Desktop 从 6.0 升到 78.7、RefCOCO-avg 从 57.1 升到 87.9。也就是说,赢面集中在屏幕理解和指代定位,不是全项领先。
- 总体平均分 LFM2.5-VL-3B69.4
- 总体平均分 上一代 LFM2-VL-3B57.2
- 总体平均分 Qwen3.5-4B70.1
- ScreenSpot-v2 桌面 上一代6.0
没写清 材料在「Inference speed on CPU and GPU」一节被截断,没有显存占用、延迟或吞吐数字,端侧算力与精度的平衡无法核对。
下一步 等 Hugging Face 页面补全推理速度章节后,核对 CPU 与 GPU 上的实测延迟或吞吐数字。