行业动态Hugging Face
来源时间 本站刊期
Agent 说它做完了。数据库不同意。
The Agent Said It Was Done. The Database Disagreed.
Agent自报完工却与数据库不符,暴露验收只看对话的盲区。
判断
负责 agent 上线的团队应把验收标准从对话是否收尾、工具调用是否合法,改到终端后端状态与副作用是否符合要求;否则工单该留 hold 却被标 solved 的 agent 会照样通过。
依据
微软与 Hugging Face 的 ThinkingBox 博文称,他们不看 agent 生成的句子,而是看它留在数据库里的记录,并让它对同一任务重复 20 次。文中案例是:一台 $745 的厨房电器在 Nashville 配送中心卡在 courier exception,已超预计送达日 fifteen days;agent 做了 nine tool calls,把工单状态写成 solved 并回复已解决,但承运商异常仍未关闭,要求的终止状态是 hold,客户也没得到真正答案。机制上,ThinkingBox 跨 507 个有状态业务流程、每项跑 20 次,按终端后端状态和副作用打分。共同集消融含 121,680 个有效试验、12 个 LLM(大语言模型),其中 79,853 次未通过可执行检查;这些失败里 67.24% 仍干净终止、调用过改状态工具且未报最终工具错误,可执行检查却发现 77.61% 有错误字段值、43.30% 有非预期额外效果、25.36% 缺少必需效果。
- 有效试验121,680
- 未通过可执行检查79,853
- 失败中干净收尾67.24%
- 失败中字段值错误77.61%
没写清 材料没说这套终端状态检查接到生产系统后,遇到并发写、部分回滚或人工接管时该怎么判,也没给真实流量下的误判率。
下一步 下一步可复跑 sandbox_external_retail_group1.py:test_case_ST003_006,核对工单 status 是否从 solved 被标成 hold。