跳到正文

AI工具Hugging Face02:09

你的Agent实际需要多少内存?

How Much Memory Does Your Agent Actually Need?

内存需求因场景而异,量化评估才能避免资源浪费。

判断

给自建记忆层的 agent 团队:先按模型能力档标定注入剂量,别默认全量灌入——同一套 guideline,投喂方式选错会让模型多花约 50% token 却涨得更少。

依据

Hugging Face 与 IBM Research 团队(Vatche Isahagian 等)在 AppWorld 的 585 个多步任务(168 test_normal + 417 test_challenge,9 个模拟应用)上测了八个模型,对同一套自蒸馏 guideline(从 agent 自己的过往轨迹里抽出的可复用策略,不更新权重)用两种投喂方式对照。结果分三档:有余量的强模型吃全套,DeepSeek-V3.2(671B MoE)全量注入涨 +9.5pp 任务完成率;较弱模型会被整套淹没,gpt-oss-120b(117B MoE)用「高置信核心 + 逐任务检索」涨 +16.1pp,只多 5% token,而全量注入涨得更少、还多花约 50% token;GLM-5(745B MoE)落在饱和档,没有可测增益。机制上学习发生在模型之外:改的是 agent 上下文里放什么,不是权重,所以同一套 guideline 能搬到八个模型上。作者也提示,分档不只由参数量决定,还要看 benchmark 余量、上下文窗口和 guideline 质量。

  • DeepSeek-V3.2 全量注入+9.5pp
  • gpt-oss-120b 逐任务检索+16.1pp
  • gpt-oss-120b 检索派 token+5% tokens
  • gpt-oss-120b 全量派 token~50% more tokens
同一条 guideline 集,两种投喂方式在完成率与 token 代价上的对照

没写清 材料没给分档阈值:多强的模型算「有余量」、多弱算会被淹没,只能各自实测,不能替别人判定。

下一步 在自家模型上跑一次全量注入与逐任务检索的 A/B,同时记录任务完成率与 token 消耗。

本期其他新闻

  1. 行业动态

    Mojo🔥现已开源

    Simon Willison

  2. 行业动态

    网络关键能力时代下的模型开发节奏

    OpenAI

  3. 行业动态

    面向青少年的ChatGPT:为学习而建,受保护支持

    OpenAI

  4. 精选深读

    加强国家安全中的民主监督

    OpenAI

  5. 精选深读

    使用Sentence Transformers的多向量(后期交互)嵌入模型

    Hugging Face