精选深读Latent Space13:56
[AINews] DeepSeek v4.1-Flash:763B-P8B-D16B新型因果编码器–解码器架构配备视觉能力,标志着鲸鱼归来
[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale
DeepSeek新模型配视觉回归,参数稀疏度设定是取舍关键
判断
要迁移长上下文 agent 的队伍,该把最多 1/8 的 KV 缓存当迁移理由,而不是版本号:DeepSeek 用 8B 预填充、16B 解码的拆分换来 1-2% 稀疏度,代价是基准分数暂时落后,且 V4 Pro 已退役、没有同名后继可接。
依据
Sebastian Raschka 用一张梗图点出命名问题:同一个模型名,涨幅连 0.1 都不到;Jasper Lu 则记下 DeepSeek 自己的判断——现在提升数据质量的回报,远高于再发明后训练算法。真正被名字盖住的是机制:DeepSeek 把 MoE(混合专家,每次只激活一部分参数)的记法扩展成 763B-P8B-D16B,即总参数 763B,预填充(处理输入 token)激活 8B,解码(逐字生成输出)激活 16B,稀疏度落在 1-2%;配合 Sliding-Window Attention Bounded Replay(滑动窗口注意力加有界重放),KV 缓存(推理时为每个 token 保留的键值状态)压到 V4 Flash 的最多 1/8。取舍很直接:省下的显存和单次推理成本,付给长时间运行的 agent;换来的是它在部分基准上落后于其他开源模型,因为现有基准还量不出上下文效率。
- 总参数763B
- 预填充激活(输入)8B
- 解码激活(输出)16B
- KV 缓存对比 V4 Flash1/8
没写清 材料没给 v4.1 Flash 在任一基准上的具体分数,也没有吞吐或价格数字,所以无法判断它对其他开源模型的相对位置。
下一步 核对第三方在长上下文 agent 任务上实测的 KV 缓存占用,确认是否真能压到 V4 Flash 的 1/8。