跳到正文

行业动态Hugging Face

来源时间 本站刊期

Agent 说它做完了。数据库不同意。

The Agent Said It Was Done. The Database Disagreed.

Agent自报完工却与数据库不符,暴露验收只看对话的盲区。

判断

负责 agent 上线的团队应把验收标准从对话是否收尾、工具调用是否合法,改到终端后端状态与副作用是否符合要求;否则工单该留 hold 却被标 solved 的 agent 会照样通过。

依据

微软与 Hugging Face 的 ThinkingBox 博文称,他们不看 agent 生成的句子,而是看它留在数据库里的记录,并让它对同一任务重复 20 次。文中案例是:一台 $745 的厨房电器在 Nashville 配送中心卡在 courier exception,已超预计送达日 fifteen days;agent 做了 nine tool calls,把工单状态写成 solved 并回复已解决,但承运商异常仍未关闭,要求的终止状态是 hold,客户也没得到真正答案。机制上,ThinkingBox 跨 507 个有状态业务流程、每项跑 20 次,按终端后端状态和副作用打分。共同集消融含 121,680 个有效试验、12 个 LLM(大语言模型),其中 79,853 次未通过可执行检查;这些失败里 67.24% 仍干净终止、调用过改状态工具且未报最终工具错误,可执行检查却发现 77.61% 有错误字段值、43.30% 有非预期额外效果、25.36% 缺少必需效果。

  • 有效试验121,680
  • 未通过可执行检查79,853
  • 失败中干净收尾67.24%
  • 失败中字段值错误77.61%
ThinkingBox 用 121,680 个有效试验对照失败样本的收尾表现与字段错误。

没写清 材料没说这套终端状态检查接到生产系统后,遇到并发写、部分回滚或人工接管时该怎么判,也没给真实流量下的误判率。

下一步 下一步可复跑 sandbox_external_retail_group1.py:test_case_ST003_006,核对工单 status 是否从 solved 被标成 hold。

本期其他新闻

  1. 行业动态

    我们几乎需要对所有东西设置默认硬性预算上限

    Simon Willison

  2. 行业动态

    Nvidia Shield TV 已上市7年。它刚刚涨价100美元

    Wired AI

  3. 行业动态

    Splice CEO Kakul Srivastava 认为 AI 邮件正在扼杀对话

    The Verge AI

  4. 行业动态

    一位 OpenAI 安全员工已离职并发出警告

    The Verge AI

  5. 行业动态

    [AINews] 今天没发生多少事

    Latent Space

  6. 行业动态

    Rex 的恐龙商店

    Simon Willison

  7. AI工具

    Muse 为你所有朋友和家人创建详细档案

    Wired AI