精选深读Hugging Face21:37
考虑 ACE?我们可以用更少的令牌完成
Thinking of ACE? We Can Do It with Fewer Tokens
论文提出减少ACE令牌数的新方法,但需关注实际效果与基准。
判断
这条对比改变了多步工具调用 agent 团队的选型:是否把记忆交付从每步注入完整策略手册,改为按任务检索少量指南。若照 ACE 默认交付,DeepSeek-V3.2 上每任务 634K 令牌;ALTK-Evolve 的按需交付在同基座同基准降到 263K,并同时提高任务与子目标完成率。
依据
IBM Research 的 Vatche Isahagian 等作者在 Hugging Face 文章里比较 ACE(Agentic Context Engineering,智能体上下文工程)与 ALTK-Evolve。两者都从 agent 自身轨迹提取教训,不更新权重、不靠人工标签;ACE 把教训放进一个持续演化的 playbook(完整策略手册),每步都注入;ALTK-Evolve 把交付当旋钮:固定一小撮高支持度 guideline(指南),再按任务检索少量补充。材料给出的 AppWorld(智能体应用基准)同基座 ReAct(推理-行动循环)agent 对照:DeepSeek-V3.2 上 ACE 的 TGC/SGC(任务/子目标完成率)为 80.4/73.2、tokens/task(每任务令牌数)634K,ALTK-Evolve 为 89.3/80.4、263K;gpt-oss-120b 上 ACE 为 54.8/35.7、777K,ALTK-Evolve 为 56.0/37.5、116K。作者称强模型上两项指标都更好且约花 ACE 四成推理成本,弱模型上约七分之一成本、精度算打平。
- DeepSeek-V3.2 ACE634K
- DeepSeek-V3.2 ALTK-Evolve263K
- gpt-oss-120b ACE777K
- gpt-oss-120b ALTK-Evolve116K
没写清 材料没给按任务选择 guideline 的检索延迟、选择器成本,以及不同任务分布或最坏情况下的 token 与准确率方差,所以不能替它补上生产端总账。
下一步 下一步可核对:在 AppWorld 同一 ReAct 基座与相同运行次数下,复现 DeepSeek-V3.2 和 gpt-oss-120b 的 TGC/SGC 与 tokens/task,尤其看 634K 对 263K、777K 对 116K 是否可重复。