Agent 能不能办成事,要看任务结果
从一次精彩演示,到可以反复验证的工作能力。
评估正在走向完整任务
Anthropic 在 2026 年的 Agent 评估文章中讨论了任务、运行过程和评分方式。对使用者而言,一个直观结论是:回答听起来合理与任务真正完成,需要分别判断。
为应用原型建立小型验收表
例如一个项目管理界面,不能只检查页面是否生成。还要验证创建项目、填写内容、取消编辑、提交空表单和返回列表。为每一步写下预期结果,就能把抽象的“好不好用”变成可复查的问题。这里是实践建议,不是已发布的 UBAI 自动评测功能。
同时观察失败时的表现
断网、缺失图片、长文本和重复点击都值得测试。失败并不一定意味着整个方案不可用,关键是能否保留已有输入、说明下一步并恢复操作。评估应包含正常路径,也包含这些容易被演示忽略的边界。
参考资料
官方资料核对于 2026 年 9 月 18 日。文中的产品建议为 UBAI 编辑观点。