AndroidWorld 评估报告与失败分析(T3A Agent)¶
本书对 T3A Agent(
t3a_claude4_sonnet)在 AndroidWorld 基准上一次完整运行的评估报告与失败案例分析笔记,是实验 6-10「AndroidWorld 的评估和改进」的阅读材料。
这是什么 / 不是什么¶
- 这是:一次真实 AndroidWorld 评估运行的原始轨迹 + 报告解读 + 失败根因分析(阅读材料,无可运行代码)。
- 这不是:AndroidWorld 基准本身。基准代码见同章的
android_world/(下划线命名,需自行git clone的外部仓库)。本目录采用连字符命名android-world/,正是为了与基准仓库区分。
运行元信息(见 t3a.md 末尾):Agent 为 t3a_claude4_sonnet,运行于 2025-07-02,覆盖 AndroidWorld 全部 116 个任务,总体成功率 88%,成功任务平均 13.45 步。
文件说明¶
| 文件 | 内容 |
|---|---|
t3a.md |
完整运行日志(约 8.8k 行):110 个任务的逐步执行轨迹(每步记录 Action / Reason / Summary),末尾附逐任务性能表与能力标签 × 难度矩阵 |
t3a_failed.md |
失败任务轨迹(约 4.6k 行):53 个失败任务段的完整执行日志,从 t3a.md 中筛出,便于集中复盘 |
t3a_summary.md |
报告解读:逐任务性能表的列释义与失败群定位,能力标签矩阵的阅读方法,Agent 的核心优势(multi_app、memorization、search)与关键短板(transcription、math_counting、complex_ui_understanding、information_retrieval、requires_setup) |
t3a_failed_analysis.md |
失败根因分析:将失败归为五类——转录失败、复杂 UI 理解失败、应用初始化消耗步数、数学/计数失败、信息检索与复杂逻辑失败;并对 28 个「步数耗尽」案例归纳出四种低效模式(无效循环、非标 UI 交互受困、信息处理停滞、简单导航失败) |
推荐阅读顺序¶
t3a_summary.md—— 先学会读报告:逐任务表格 + 能力标签矩阵,建立「88% 成功率背后的结构性短板」这一全局认识。t3a_failed_analysis.md—— 再看根因分类:理解每类失败的「症状 → 过程 → 根本原因」链条。t3a_failed.md—— 带着分类框架回放失败轨迹,逐条验证(或推翻)分析结论。t3a.md—— 需要对照成功任务或查阅原始数据时的完整底稿。
与正文的对应关系¶
正文「从 Benchmark 报告到系统改进」一节的示教案例(H1–H8 假设、三层改进框架、成本收益决策)以本目录材料为原型;实验 6-10 要求以这里的评估报告为起点,走完「诊断 → 构建假设 → 分阶段实验 → 数据驱动决策 → 迭代」的完整闭环。
几个值得留意的细节:
- 能力标签矩阵中
transcription全难度 0.00、math_countingeasy 档 0.00、complex_ui_understanding0.17/0.50/0.14——总体成功率很高,但短板维度几乎是「全军覆没」,这正是「总体数字掩盖结构性短板」的实例。 - 失败分析的核心结论:「步数耗尽」是症状而非病因——28 个超时案例背后是高效执行路径规划能力的缺失,而非步数限制过于苛刻。
- 部分失败(如
ExpenseAddMultipleFromGallery)中 Agent 在拿不到真实信息时会「编造」合理数据完成流程——评估时只看最终状态验证才能识破,这是设计验证器时的重要教训。