跳到正文

汪汪简报

周二 · 2026年08月11日

Crypto 版当天未出刊,不用往期内容顶替——这份组合就是这天实际发布的全部。

全部新闻

  1. 精选深读Hugging Face

    考虑 ACE?我们可以用更少的令牌完成
    论文提出减少ACE令牌数的新方法,但需关注实际效果与基准。

    这条对比改变了多步工具调用 agent 团队的选型:是否把记忆交付从每步注入完整策略手册,改为按任务检索少量指南。若照 ACE 默认交付,DeepSeek-V3.2 上每任务 634K 令牌;ALTK-Evolve 的按需交付在同基座同基准降到 263K,并同时提高任务与子目标完成率。

    展开全文

    依据

    IBM Research 的 Vatche Isahagian 等作者在 Hugging Face 文章里比较 ACE(Agentic Context Engineering,智能体上下文工程)与 ALTK-Evolve。两者都从 agent 自身轨迹提取教训,不更新权重、不靠人工标签;ACE 把教训放进一个持续演化的 playbook(完整策略手册),每步都注入;ALTK-Evolve 把交付当旋钮:固定一小撮高支持度 guideline(指南),再按任务检索少量补充。材料给出的 AppWorld(智能体应用基准)同基座 ReAct(推理-行动循环)agent 对照:DeepSeek-V3.2 上 ACE 的 TGC/SGC(任务/子目标完成率)为 80.4/73.2、tokens/task(每任务令牌数)634K,ALTK-Evolve 为 89.3/80.4、263K;gpt-oss-120b 上 ACE 为 54.8/35.7、777K,ALTK-Evolve 为 56.0/37.5、116K。作者称强模型上两项指标都更好且约花 ACE 四成推理成本,弱模型上约七分之一成本、精度算打平。

    • DeepSeek-V3.2 ACE634K
    • DeepSeek-V3.2 ALTK-Evolve263K
    • gpt-oss-120b ACE777K
    • gpt-oss-120b ALTK-Evolve116K
    同基座同基准下,两模型每任务推理令牌数对比。

    没写清 材料没给按任务选择 guideline 的检索延迟、选择器成本,以及不同任务分布或最坏情况下的 token 与准确率方差,所以不能替它补上生产端总账。

    下一步 下一步可核对:在 AppWorld 同一 ReAct 基座与相同运行次数下,复现 DeepSeek-V3.2 和 gpt-oss-120b 的 TGC/SGC 与 tokens/task,尤其看 634K 对 263K、777K 对 116K 是否可重复。

往期

  1. 09.29周二

  2. 09.28周一