跳到正文

精选深读Hugging Face21:37

考虑 ACE?我们可以用更少的令牌完成

Thinking of ACE? We Can Do It with Fewer Tokens

论文提出减少ACE令牌数的新方法,但需关注实际效果与基准。

判断

这条对比改变了多步工具调用 agent 团队的选型:是否把记忆交付从每步注入完整策略手册,改为按任务检索少量指南。若照 ACE 默认交付,DeepSeek-V3.2 上每任务 634K 令牌;ALTK-Evolve 的按需交付在同基座同基准降到 263K,并同时提高任务与子目标完成率。

依据

IBM Research 的 Vatche Isahagian 等作者在 Hugging Face 文章里比较 ACE(Agentic Context Engineering,智能体上下文工程)与 ALTK-Evolve。两者都从 agent 自身轨迹提取教训,不更新权重、不靠人工标签;ACE 把教训放进一个持续演化的 playbook(完整策略手册),每步都注入;ALTK-Evolve 把交付当旋钮:固定一小撮高支持度 guideline(指南),再按任务检索少量补充。材料给出的 AppWorld(智能体应用基准)同基座 ReAct(推理-行动循环)agent 对照:DeepSeek-V3.2 上 ACE 的 TGC/SGC(任务/子目标完成率)为 80.4/73.2、tokens/task(每任务令牌数)634K,ALTK-Evolve 为 89.3/80.4、263K;gpt-oss-120b 上 ACE 为 54.8/35.7、777K,ALTK-Evolve 为 56.0/37.5、116K。作者称强模型上两项指标都更好且约花 ACE 四成推理成本,弱模型上约七分之一成本、精度算打平。

  • DeepSeek-V3.2 ACE634K
  • DeepSeek-V3.2 ALTK-Evolve263K
  • gpt-oss-120b ACE777K
  • gpt-oss-120b ALTK-Evolve116K
同基座同基准下,两模型每任务推理令牌数对比。

没写清 材料没给按任务选择 guideline 的检索延迟、选择器成本,以及不同任务分布或最坏情况下的 token 与准确率方差,所以不能替它补上生产端总账。

下一步 下一步可核对:在 AppWorld 同一 ReAct 基座与相同运行次数下,复现 DeepSeek-V3.2 和 gpt-oss-120b 的 TGC/SGC 与 tokens/task,尤其看 634K 对 263K、777K 对 116K 是否可重复。

本期其他新闻

  1. 行业动态

    在ChatGPT中测试广告

    OpenAI

  2. 行业动态

    Daybreak 模型现已在 AWS 上可用

    OpenAI

  3. 行业动态

    构建AI原生财务职能教会了我什么

    OpenAI

  4. AI工具

    推出 Muse Glimmer

    Simon Willison

  5. AI工具

    构建低延迟多语言语音代理:使用 NVIDIA Magpie TTS 实现开放权重与完全部署控制

    Hugging Face