精选深读Hugging Face
来源时间 本站刊期
面向边缘的多模态开放 d1 决策模型
Multimodal open d1 decision models for the edge
边缘端跑多模态决策模型,带宽和算力受限,落地价值得看具体场景。
判断
客服分诊、工单紧急度这类判定原本要回传云端或上 4B–9B 模型,现在可以改放 Jetson Orin Nano 本地跑 d1-3B;选型门槛从「有没有网」换成「50 ms 够不够」。
依据
LiquidAI 的 Aurelien Lac、Fernando Fernandes Neto、Edoardo Mosca、Maxime Labonne、Leonie Monigatti 在 Hugging Face 发文(2026年10月7日),发布 d1-3B 与实验性的 d1-omni-600M。机制上,决策模型(decision model)不逐 token 生成文字,而是在单次前向(single forward pass)里直接给出结构化答案,所以省掉了自回归解码那一段耗时。d1-3B 从 LFM2.5-VL-3B 这个视觉语言模型(VLM,decoder-only)训练,吃文本和图像;d1-omni-600M 从 LFM2.5-Encoder-350M 这个双向编码器训练,另加视觉与音频编码器,只吃文本+图像或文本+音频。对照数字:d1-3B 在 Decision Index 0.2.1 上得 48.57,高于 Decider 35B-A3B 的 47.11;七个公开数据集均值 82.9,d1-omni-600M 得 78.4,超过 Decider 2B 的 77.1,而参数量只有其四分之一。延迟上 d1-3B 单问 16 ms(Jetson AGX Thor)、26 ms(Jetson AGX Orin 64 GB)、50 ms(Jetson Orin Nano),三问只花一问的 1.3 倍,Thor 从 16 ms 到 20 ms。
- Decision Index 0.2.148.57
- 七数据集均值82.9
- Jetson AGX Thor 单问16 ms
- Jetson Orin Nano 单问50 ms
没写清 d1-3B 的视觉准确率和 d1-omni-600M 的音频决策基准都没公开,Decision Index v0.3 只有私有视觉分片,所以无法替材料断言多模态判定在真实工单里够用。
下一步 等官方补上 d1-omni-600M 的速度数字与音频决策基准,再决定要不要把它放进语音工单通道。