跳到正文

精选深读Latent Space13:56

[AINews] DeepSeek v4.1-Flash:763B-P8B-D16B新型因果编码器–解码器架构配备视觉能力,标志着鲸鱼归来

[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale

DeepSeek新模型配视觉回归,参数稀疏度设定是取舍关键

判断

要迁移长上下文 agent 的队伍,该把最多 1/8 的 KV 缓存当迁移理由,而不是版本号:DeepSeek 用 8B 预填充、16B 解码的拆分换来 1-2% 稀疏度,代价是基准分数暂时落后,且 V4 Pro 已退役、没有同名后继可接。

依据

Sebastian Raschka 用一张梗图点出命名问题:同一个模型名,涨幅连 0.1 都不到;Jasper Lu 则记下 DeepSeek 自己的判断——现在提升数据质量的回报,远高于再发明后训练算法。真正被名字盖住的是机制:DeepSeek 把 MoE(混合专家,每次只激活一部分参数)的记法扩展成 763B-P8B-D16B,即总参数 763B,预填充(处理输入 token)激活 8B,解码(逐字生成输出)激活 16B,稀疏度落在 1-2%;配合 Sliding-Window Attention Bounded Replay(滑动窗口注意力加有界重放),KV 缓存(推理时为每个 token 保留的键值状态)压到 V4 Flash 的最多 1/8。取舍很直接:省下的显存和单次推理成本,付给长时间运行的 agent;换来的是它在部分基准上落后于其他开源模型,因为现有基准还量不出上下文效率。

  • 总参数763B
  • 预填充激活(输入)8B
  • 解码激活(输出)16B
  • KV 缓存对比 V4 Flash1/8
DeepSeek v4.1-Flash 的总参数与预填充/解码激活量,附 KV 缓存相对 V4 Flash 的倍数

没写清 材料没给 v4.1 Flash 在任一基准上的具体分数,也没有吞吐或价格数字,所以无法判断它对其他开源模型的相对位置。

下一步 核对第三方在长上下文 agent 任务上实测的 KV 缓存占用,确认是否真能压到 V4 Flash 的 1/8。

本期其他新闻

  1. 行业动态

    OpenAI的失控AI在5月试图入侵另一家公司

    The Verge AI

  2. 行业动态

    Sam Altman称OpenAI在2026年上市将“不明智”

    The Verge AI

  3. 行业动态

    加州褐鹈鹕

    Simon Willison

  4. 行业动态

    引用Paul Ford

    Simon Willison

  5. 行业动态

    Anthropic CEO表示是时候给AI踩刹车了

    The Verge AI

  6. 行业动态

    从黑客攻击到生物武器,Claude滥用如今无处不在

    Wired AI

  7. 行业动态

    OpenAI agents在5月攻击了RubyGems

    Simon Willison

  8. 行业动态

    使用AWS DevOps Agent和AgentCore Evaluations监控生产环境agent生命周期

    AWS Machine Learning Blog