头条 · AI 版OpenAI
在ChatGPT中测试广告
Testing ads in ChatGPT
免费换广告,OpenAI在ChatGPT试水,但答案独立和隐私保护是底线。
周二 · 2026年08月11日
Crypto 版当天未出刊,不用往期内容顶替——这份组合就是这天实际发布的全部。
头条 · AI 版OpenAI
Testing ads in ChatGPT
免费换广告,OpenAI在ChatGPT试水,但答案独立和隐私保护是底线。
Daybreak 模型现已在 AWS 上可用
OpenAI借AWS渠道分发安全模型,企业接入成本大降但依赖云绑定。
行业动态OpenAI
构建AI原生财务职能教会了我什么
行业动态OpenAI
推出 Muse Glimmer
AI工具Simon Willison
构建低延迟多语言语音代理:使用 NVIDIA Magpie TTS 实现开放权重与完全部署控制
AI工具Hugging Face
精选深读Hugging Face
考虑 ACE?我们可以用更少的令牌完成论文提出减少ACE令牌数的新方法,但需关注实际效果与基准。
这条对比改变了多步工具调用 agent 团队的选型:是否把记忆交付从每步注入完整策略手册,改为按任务检索少量指南。若照 ACE 默认交付,DeepSeek-V3.2 上每任务 634K 令牌;ALTK-Evolve 的按需交付在同基座同基准降到 263K,并同时提高任务与子目标完成率。
依据
IBM Research 的 Vatche Isahagian 等作者在 Hugging Face 文章里比较 ACE(Agentic Context Engineering,智能体上下文工程)与 ALTK-Evolve。两者都从 agent 自身轨迹提取教训,不更新权重、不靠人工标签;ACE 把教训放进一个持续演化的 playbook(完整策略手册),每步都注入;ALTK-Evolve 把交付当旋钮:固定一小撮高支持度 guideline(指南),再按任务检索少量补充。材料给出的 AppWorld(智能体应用基准)同基座 ReAct(推理-行动循环)agent 对照:DeepSeek-V3.2 上 ACE 的 TGC/SGC(任务/子目标完成率)为 80.4/73.2、tokens/task(每任务令牌数)634K,ALTK-Evolve 为 89.3/80.4、263K;gpt-oss-120b 上 ACE 为 54.8/35.7、777K,ALTK-Evolve 为 56.0/37.5、116K。作者称强模型上两项指标都更好且约花 ACE 四成推理成本,弱模型上约七分之一成本、精度算打平。
没写清 材料没给按任务选择 guideline 的检索延迟、选择器成本,以及不同任务分布或最坏情况下的 token 与准确率方差,所以不能替它补上生产端总账。
下一步 下一步可核对:在 AppWorld 同一 ReAct 基座与相同运行次数下,复现 DeepSeek-V3.2 和 gpt-oss-120b 的 TGC/SGC 与 tokens/task,尤其看 634K 对 263K、777K 对 116K 是否可重复。