终态优先
Agent 可以调用正确的 Tool,也可以生成看似合理的回复,但真正决定任务是否完成的是数据库、工单、订单、文件或其他业务记录最终处于什么状态。
不要因为 Agent 最后说“完成了”就判成功。把期望终态、真实终态和副作用记录交给确定性判定器,检查它是否真的完成了业务任务,而且没有少做、多做或重复做。
Agent 可以调用正确的 Tool,也可以生成看似合理的回复,但真正决定任务是否完成的是数据库、工单、订单、文件或其他业务记录最终处于什么状态。
正确终态之外,还要确认退款、付款、邮件、发布、删除等副作用没有缺失、重复或越权发生。Exactly-once 不能靠模型口头承诺。
一次成功不代表可靠。多次 Trial 可以暴露偶发 False Success、重复 Tool、副作用漂移和终态不稳定。
Microsoft / Hugging Face 的 ThinkingBox / ThinkingBox-Bench 提供了一个重要公开参照:v1.0 包含 507 个 stateful business workflow,每个任务重复运行 20 次;其中 477 个任务只靠终态/副作用状态判定,30 个任务再补充窄范围响应 rubric。官方博客还报告,在一组 121,680 次有效 Trial 的共同集实验里,失败尝试中有 67.24% 仍然正常结束、执行过状态改变 Tool 且没有最终 Tool Error——这正是“Agent 看起来完成了,但真实系统没有完成”的 False Success 风险。XBSTACK 不复制 ThinkingBox-Bench 的任务、golden state 或轨迹,而是提供可直接套到你自己 Agent 记录上的独立浏览器检查器和公开 CLI Benchmark。
它不根据“回答看起来像不像成功”评分,而是确定性比较期望终态、真实终态以及必需、重复和禁止副作用。文本语义评分只适合无法用状态表达的少量要求。
因为 Agent 可能在最终回复里声称“已完成”,但数据库、工单、支付、邮件、文件或其他真实系统并没有达到正确状态。False Success 专门统计这种“说成功但实际失败”的运行。
不是。XBSTACK 这个工具是独立实现,只借鉴“以 terminal backend state 和 side effects 为主要判据”的公开方法。它不会运行或复制 ThinkingBox-Bench 的 507 个任务。
不会。JSON 解析和评分全部在浏览器本地完成,不需要账号,也不会把业务状态、Tool 调用结果或测试数据发送到 XBSTACK Server。