Agent Reliability / Stateful Evaluation

Agent Side-Effect Evaluator:按终态与真实副作用评估 AI Agent

不要因为 Agent 最后说“完成了”就判成功。把期望终态、真实终态和副作用记录交给确定性判定器,检查它是否真的完成了业务任务,而且没有少做、多做或重复做。

浏览器本地Terminal StateSide EffectsFalse Success多次运行一致性

工具操作

Methodology

为什么要从“回答评分”走到“终态评分”

终态优先

Agent 可以调用正确的 Tool,也可以生成看似合理的回复,但真正决定任务是否完成的是数据库、工单、订单、文件或其他业务记录最终处于什么状态。

副作用必须精确

正确终态之外,还要确认退款、付款、邮件、发布、删除等副作用没有缺失、重复或越权发生。Exactly-once 不能靠模型口头承诺。

重复运行看一致性

一次成功不代表可靠。多次 Trial 可以暴露偶发 False Success、重复 Tool、副作用漂移和终态不稳定。

Microsoft / Hugging Face 的 ThinkingBox / ThinkingBox-Bench 提供了一个重要公开参照:v1.0 包含 507 个 stateful business workflow,每个任务重复运行 20 次;其中 477 个任务只靠终态/副作用状态判定,30 个任务再补充窄范围响应 rubric。官方博客还报告,在一组 121,680 次有效 Trial 的共同集实验里,失败尝试中有 67.24% 仍然正常结束、执行过状态改变 Tool 且没有最终 Tool Error——这正是“Agent 看起来完成了,但真实系统没有完成”的 False Success 风险。XBSTACK 不复制 ThinkingBox-Bench 的任务、golden state 或轨迹,而是提供可直接套到你自己 Agent 记录上的独立浏览器检查器和公开 CLI Benchmark。

FAQ

常见问题

这个工具和普通 LLM-as-a-Judge 有什么不同?

它不根据“回答看起来像不像成功”评分,而是确定性比较期望终态、真实终态以及必需、重复和禁止副作用。文本语义评分只适合无法用状态表达的少量要求。

为什么需要 False Success 指标?

因为 Agent 可能在最终回复里声称“已完成”,但数据库、工单、支付、邮件、文件或其他真实系统并没有达到正确状态。False Success 专门统计这种“说成功但实际失败”的运行。

它是不是 ThinkingBox 的在线版本?

不是。XBSTACK 这个工具是独立实现,只借鉴“以 terminal backend state 和 side effects 为主要判据”的公开方法。它不会运行或复制 ThinkingBox-Bench 的 507 个任务。

数据会上传吗?

不会。JSON 解析和评分全部在浏览器本地完成,不需要账号,也不会把业务状态、Tool 调用结果或测试数据发送到 XBSTACK Server。