行业动态Hugging Face00:00
你的 Agent 完成了任务。它还能再做一次吗?
Your Agent Aced the Task. Will It Do It Again?
单次跑通不算数,可复现性才是智能体落地的真实门槛。
判断
决定把 ReAct 智能体接进对账、合同核查这类流水线的人,验收口径要从平均成功率改成同一任务连跑五次全对的比例,否则按 77.4% 签下的上线时间表仍会随时反悔。
依据
IBM Research 的 Evelyn Duesterwald、Lilian Ngweta 等作者在 Hugging Face 发文给出对照:在 AppWorld 的 test_normal 上,用 GPT-4.1 的 ReAct(推理与调用工具交替进行的智能体框架)五次运行的平均成功率 Mean@5 是 77.4%,而同一任务五次全部成功的比例 Pass^5 只有 53.0%,相差 24.4 个百分点,作者称之为 consistency gap,难任务上这一差距到 30 点。机制是每一步决策都从下一个 token 的概率分布里抽:分布峰越尖,GPU 浮点非结合性、请求批处理这类扰动越改不动结果;峰越平,几个概率接近的候选会被扰动重新排序,而一条轨迹串起几十步,单步翻车的小概率会累积成大差距。Consistency Analyzer 只取一条已录轨迹、不需要标准答案,对每个决策点重采样 k=5 次,定位易翻车的那几步,再蒸馏成 consistency guidelines;同一批评测里差距从 24.4 个百分点压到 12.0,同任务 Pass⁵ 升 16.0 个百分点、相似任务升 13.0,平均准确率没有代价。
- Mean@5 平均成功率77.4%
- Pass^5 五次全对53.0%
- 一致性差距24.4 个百分点
- 加入指南后差距12.0 个百分点
没写清 材料只给了 k=5、单套基准、单一模型的结果,没写换 k 值、换模型或换基准后差距是否照旧,所以不能替它断定这套指南在别处同样有效。
下一步 翻 arXiv 上那份技术报告的评测表,确认 Pass⁵ 提升 16.0 个百分点是否在第二套基准上复现。