docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 - #1028
Merged
Merged
Conversation
原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX
原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX
三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 `requestor` 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 `role` 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX
上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX
bojieli
added a commit
that referenced
this pull request
Aug 28, 2026
#1028 已把第九章的实验 9-2 从 GAIA 经验文档迁移换成 τ²-bench 转接边界规则 提炼,并重写了例子一。本次将该改动同步到 ar/en/es/he/hu/id/ja/ko/ru/ta/tr/ vi/zh-TW 十三个译本。 每个译本两处改动: - 删除原实验 9-2(从 GAIA 轨迹提炼经验知识文档)的实验框,保留正文中关于 GAIA 与 AWorld 的方法叙述及其脚注 - 例子一整节替换为 τ²-bench telecom 版本:转接边界的规则化、三点发现(提炼 材料决定归纳结果、模型会把观察到的行为当作应然行为、被修复的往往是极朴素 的缺陷)、新的实验 9-2 框,以及航空客服作为同一做法另一领域的一段 实验 9-1~9-9 编号在各译本中保持不变。译文按各版既有惯例处理编号与标点: he 沿用 U+2011 连字符的「ניסוי 9‑2」,hu 沿用「9-2. ★★ kísérlet」,zh-TW 在 s2twp 转换基础上套用该版既有的后编辑规则。项目级 README 无译本,章节 README 已在 #1028 中更新。 校验:14 个版本实验编号 9-1~9-9 连号、GAIA 仅剩方法叙述与脚注两行、例子一 新标题就位、代码围栏成对;scripts/check_i18n_consistency.py 通过。 Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
起因
第九章原来的实验 9-2(从 GAIA 轨迹提炼经验知识文档)实现有缺陷:生成的经验文档只有 1094 字节,「推荐策略」一条常识、「例外条件」写着「暂无可靠结论」、「常见误区」里还漏了个 Python dict 没序列化。据此做的三基线迁移对照得出知识文档组 25%、两个对照组各 50% 的负结果。
GAIA 上的经验学习本身是有效做法(榜单上不少成绩正是这么做出来的),这个负结果反映的是实验实现问题,不是方法失效。因此整体替换,不保留为负面案例。
新的实验 9-2
复用第七章已经解剖过的 τ²-bench telecom 环境,把第七章的「怎么评」接到第九章的「评完之后怎么改」。
设计
telecom_small(20 条)与迁移集telecom(114 条)在上游仓库中互不相交,划分非事后选取doubao-seed-1-6-flash-250615(提炼集基线 1/20),用户模拟器doubao-seed-1-6-250615三臂固定main_policy.md,每臂记录 sha256,运行后恢复原文件迁移集 114 条结果
配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。
v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错文本时提炼器学到「不要重试」;看到工具清单后学到「设备侧工具属于用户,应引导用户执行」。
正文改动
例子一从航空假设例子换成 τ²-bench telecom,与第七章现在的解剖对象一致。正文只在原则层面陈述,保留三点发现:提炼器学到什么取决于给它看什么;模型总结的第一版规则可能把错误固化(v1 里两条是「卡住就转人工」,而转人工必然判失败);被修好的往往是「该问用户却把话说给了工具」这类朴素问题。
实验 9-1~9-9 编号不变,航空客服作为同一做法的另一个领域保留。13 个译本的章节 README 同步更新,
scripts/check_i18n_consistency.py通过。一处 bug 修正
统计脚本原先用
requestor字段区分工具调用来自 Agent 还是用户,但 τ²-bench 的消息里该字段恒为None,导致用户在自己设备上的合法调用被计成 Agent 越界。改用role判定后 C 臂由 293 修正为 163——它成功委派给用户的次数最多,受影响也最大。修正后 v2 在该指标上明显优于 v1,与它学到了工具归属这一点一致;通过率与配对结论不受影响。analyze.py的工具清单改为与build_evidence.py共用tool_inventory.txt,避免两份硬编码分叉。删除
chapter9/gaia-experience/(919 个文件、46 MB,含 vendored 的 AWorld)整体删除,正文与所有 README 已无引用。已知局限(记在 evidence.json,未写入正文)
单次运行未做多种子重复;改进集中在
service_issue一族(14/29 → 21/29),mms_issue三臂均为 0/49;样本量百余条,只够判断是否值得扩大测试。🤖 Generated with Claude Code
https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX