跳到正文

行业动态Hugging Face00:00

你的 Agent 完成了任务。它还能再做一次吗?

Your Agent Aced the Task. Will It Do It Again?

单次跑通不算数,可复现性才是智能体落地的真实门槛。

判断

决定把 ReAct 智能体接进对账、合同核查这类流水线的人,验收口径要从平均成功率改成同一任务连跑五次全对的比例,否则按 77.4% 签下的上线时间表仍会随时反悔。

依据

IBM Research 的 Evelyn Duesterwald、Lilian Ngweta 等作者在 Hugging Face 发文给出对照:在 AppWorld 的 test_normal 上,用 GPT-4.1 的 ReAct(推理与调用工具交替进行的智能体框架)五次运行的平均成功率 Mean@5 是 77.4%,而同一任务五次全部成功的比例 Pass^5 只有 53.0%,相差 24.4 个百分点,作者称之为 consistency gap,难任务上这一差距到 30 点。机制是每一步决策都从下一个 token 的概率分布里抽:分布峰越尖,GPU 浮点非结合性、请求批处理这类扰动越改不动结果;峰越平,几个概率接近的候选会被扰动重新排序,而一条轨迹串起几十步,单步翻车的小概率会累积成大差距。Consistency Analyzer 只取一条已录轨迹、不需要标准答案,对每个决策点重采样 k=5 次,定位易翻车的那几步,再蒸馏成 consistency guidelines;同一批评测里差距从 24.4 个百分点压到 12.0,同任务 Pass⁵ 升 16.0 个百分点、相似任务升 13.0,平均准确率没有代价。

  • Mean@5 平均成功率77.4%
  • Pass^5 五次全对53.0%
  • 一致性差距24.4 个百分点
  • 加入指南后差距12.0 个百分点
同一 ReAct 智能体在 AppWorld 上平均成功率与五次全对率的落差

没写清 材料只给了 k=5、单套基准、单一模型的结果,没写换 k 值、换模型或换基准后差距是否照旧,所以不能替它断定这套指南在别处同样有效。

下一步 翻 arXiv 上那份技术报告的评测表,确认 Pass⁵ 提升 16.0 个百分点是否在第二套基准上复现。

本期其他新闻

  1. 行业动态

    AI“演员”Tilly Norwood 告诉我“所有生命都重要”

    Wired AI

  2. 行业动态

    圆桌讨论:AI 真的会杀死我们所有人吗?

    MIT Technology Review AI

  3. 行业动态

    宣布推出 Amazon SageMaker AI 训练任务的实例偏好列表

    AWS Machine Learning Blog

  4. AI工具

    Gemini Live 音频

    Simon Willison

  5. AI工具

    使用 Amazon Bedrock 提示缓存优化成本与延迟

    AWS Machine Learning Blog

  6. 精选深读

    推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind

  7. 精选深读

    游戏中习得的技能能迁移到现实工作吗?

    Latent Space