精选深读Hugging Face22:00
LFM2.5-VL-3B:为边缘端提供更好、更快的视觉能力
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
3B视觉模型抢边缘市场,但实测精度与端侧算力平衡待验证。
判断
做端侧读屏、读文档的团队,可以把视觉处理从默认云端调用改为设备内本地推理,选型清单里多出一个 3.1B 候选;但计数类任务先保留云端兜底。
依据
LiquidAI 在 Hugging Face 发文称 LFM2.5-VL-3B 是可在自有硬件上运行的最强视觉语言模型(vision-language model,同时处理图像和文字的模型)。它把 SigLIP2 400M NaFlex 视觉编码器接在与 LFM2.5-2.6B 文本模型相同的预训练骨干上,预训练约 34T tokens,视觉数据是上一代的 4 倍,并用原位扩展分词器把词表翻倍到 128K,以覆盖非拉丁文字。对照表把变化写得比宣称更清楚:屏幕理解 ScreenSpot-v2 Mobile 从上一代 LFM2-VL-3B 的 7.6 升到 81.2,指代定位 RefCOCO-avg 从 57.1 升到 87.9,工具调用 ToolSandbox 从 26.4 升到 59.5,平均分从 57.2 升到 69.4。代价同样在表里:计数 CountBenchQA 从 92.2 降到 87.3,指令遵循 IFBench 只有 25.8,低于 gemma-4-E4B-it 的 39.2。
- ScreenSpot-v2 Mobile(前代7.6)81.2
- RefCOCO-avg(前代57.1)87.9
- ToolSandbox(前代26.4)59.5
- 综合平均(前代57.2)69.4
没写清 文章只列出「Inference speed on CPU and GPU」这一节,正文在「ships w」处截断,没有给出延迟、显存占用和测试机型,所以端侧算力是否真的够用无法从材料判断。
下一步 上线前在自家目标机型上实测首字延迟与显存占用,并复跑 CountBenchQA 和 ScreenSpot-v2 Mobile 两项。