返回探索

Agent 能不能办成事,要看任务结果

从一次精彩演示,到可以反复验证的工作能力。

评估正在走向完整任务

Anthropic 在 2026 年的 Agent 评估文章中讨论了任务、运行过程和评分方式。对使用者而言,一个直观结论是:回答听起来合理与任务真正完成,需要分别判断。

为应用原型建立小型验收表

例如一个项目管理界面,不能只检查页面是否生成。还要验证创建项目、填写内容、取消编辑、提交空表单和返回列表。为每一步写下预期结果,就能把抽象的“好不好用”变成可复查的问题。这里是实践建议,不是已发布的 UBAI 自动评测功能。

同时观察失败时的表现

断网、缺失图片、长文本和重复点击都值得测试。失败并不一定意味着整个方案不可用,关键是能否保留已有输入、说明下一步并恢复操作。评估应包含正常路径,也包含这些容易被演示忽略的边界。

参考资料

官方资料核对于 2026 年 9 月 18 日。文中的产品建议为 UBAI 编辑观点。

带着想法,开始对话