Skip to content

docs(i18n,ch7): 13 个译本同步第七章重构 - #1026

Merged
bojieli merged 1 commit into
mainfrom
docs/i18n-ch7-parity-main
Aug 27, 2026
Merged

docs(i18n,ch7): 13 个译本同步第七章重构#1026
bojieli merged 1 commit into
mainfrom
docs/i18n-ch7-parity-main

Conversation

@bojieli

@bojieli bojieli commented Aug 27, 2026

Copy link
Copy Markdown
Owner

第七章中文版已随 #1021 合入 main,13 个译本尚未同步。本 PR 直接对 main,把 ar / en / es / he / hu / id / ja / ko / ru / ta / vi / tr / zh-TW 全部对齐到中文版当前形态。

此前的 #1025 误合到了功能分支 docs/ch7-restructure 而非 main,那部分改动没有进入主干。本 PR 基于当前 main 重建,只包含 book-*/ 下的译本文件,与 main 上已有的 #1017(译本去浓缩修复)逐字节兼容,不覆盖任何他人改动。

背景

译本此前落后中文版两代:既缺本次结构重构,也仍保留着中文版早已删除的五节。

每个译本的改动

结构重排,与中文版逐节对应:

一条评估任务的解剖(τ²-bench telecom)
  ├ 任务定义的四个组成部分(真实任务 JSON 逐字段)
  └ 一次真实运行的轨迹(真实轨迹 + 实验 7-1)
评估指标:成功的定义     ← 移到解剖之后,承接 4/5 这个真实结果
评估环境                 ← 独立成节
  ├ 五个组成要素
  └ 人机交互型与工具调用型评估环境
评估数据集的设计
  ├ 基准设计的横向对照(新表)
  ├ 验证器 / 任务的难度划分 / 数据泄漏防范
  ├ 质量控制与长期维护(τ→τ² 五处改进并入)
  └ 评估集的三个来源(新增)
自动化评估方法           ← 开头重写

移除中文版已删除的五节:本章导读、一个具体的评估示例、过程指标、安全鲁棒性与轨迹覆盖、人工抽检和对抗式评审。「设计手法的迁移」表与「一条自建用例的完整定义」未译入(中文版已删)。

:新增 fig7-4(验证方式谱系),原 fig7-4~7-9 顺延为 7-5~7-10;fig7-1 与 fig7-3 按中文版重画。每个译本的三张新图都做了本地化文本,并按语种调整字号以避免溢出。阿拉伯语与希伯来语的图另加 direction:rtl; unicode-bidi:plaintext(阿语并指定 Noto Sans Arabic),代码标识符保持 LTR。

术语:各语种把「判分器/评分器」类说法统一为「验证器」(verifier / 検証器 / 검증기 / верификатор / verificador / doğrulayıcı / bộ kiểm chứng / مدقق / מאמת / சரிபார்ப்பான் / ellenőrző)。Rubric 的既有译名保持不变。

编号样式沿用各版惯例:hu 用「7-N. ábra / 7-N. táblázat / 7-N. kísérlet」,he 用 U+2011 连字符的「איור 7‑N」,ja 用「表 7-N」,ru 用「Таблица 7-N」。

zh-TW 不是整章重新 s2twp,而是只转换变动段落并套用该版既有的后编辑规则(「」引号、前綴、影像、回饋、參數、通過 等),保留 PR #944 手工修正过的部分。

校验

项目 结果
14 个版本图号 7-1~7-10 连号
每个译本 images/fig7-*.svg 各 10 个且 XML 合法
表号 7-1~7-5、实验 7-1~7-14 连号
代码围栏成对
五节旧内容无残留
scripts/check_i18n_consistency.py ✅ 全部通过(118 项目对齐)
改动范围 ✅ 仅 book-*/,130 个文件,未触及 book/ 或站点配置

🤖 Generated with Claude Code

https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX

第七章中文版已在 #1021 中重构,13 个译本尚未同步。本次把 ar/en/es/he/hu/
id/ja/ko/ru/ta/tr/vi/zh-TW 全部对齐到中文版当前形态。

结构重排,与中文版逐节对应:

- 新增「一条评估任务的解剖:τ²-bench 的 telecom 领域」作为开篇,含真实任务
  定义的逐字段说明与一次真实运行轨迹(实验 7-1)
- 「评估指标」移到解剖之后,开头承接四通过五这一真实结果
- 「评估环境」独立成节,五要素改为从解剖的任务中指认
- 「评估数据集的设计」按横向对照、验证器、难度划分、泄漏防范、质量控制
  与长期维护重组,τ-bench 到 τ²-bench 的五处改进并入质量控制一节
- 新增「评估集的三个来源」,「自动化评估方法」开头重写
- 移除中文版已删除的五节:本章导读、一个具体的评估示例、过程指标、安全
  鲁棒性与轨迹覆盖、人工抽检和对抗式评审

图:新增 fig7-4(验证方式谱系),原 fig7-4~7-9 顺延为 7-5~7-10,fig7-1
与 fig7-3 按中文版重画。三张新图逐语种本地化,并按语种调整字号避免溢出;
ar/he 的图加 direction:rtl 与 unicode-bidi:plaintext(ar 另指定 Noto Sans
Arabic),代码标识符保持 LTR。

术语:各语种把「判分器/评分器」类说法统一为「验证器」,Rubric 既有译名
保持不变。编号样式沿用各版惯例:hu 用 7-N. ábra / táblázat / kísérlet,
he 用 U+2011 连字符的 איור 7‑N,ja 用「表 7-N」,ru 用 Таблица 7-N。

zh-TW 不做整章重新转换,只转换变动段落并套用该版既有的后编辑规则,保留
PR #944 手工修正过的部分。

校验:14 个版本图号 7-1~7-10 连号、每版 fig7-*.svg 各 10 个且 XML 合法、
表号 7-1~7-5 与实验 7-1~7-14 连号、代码围栏成对、五节旧内容无残留、
scripts/check_i18n_consistency.py 全部通过。

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX
@bojieli
bojieli merged commit 70f57f1 into main Aug 27, 2026
2 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant