面向英译中译后校对的 Claude Code / Codex 技能包:把“机械检查 + 视觉验证 + 分批审查 + 严重度分级 + 批注回写”固化为可重复执行的流水线。
人工校对长篇译文时,最耗时且最容易遗漏的是:
- 数值、单位、标点、术语不一致等机械错误;
- 表格与扫描件内容需要视觉核对;
- 大批量章节难以保证 100% 覆盖;
- 校对意见格式不统一,难以写回 DOCX。
本技能用脚本把上述环节全部固化,Agent 按阶段执行,阻断任何“跳步”行为。
Phase 0 客户术语加载(可选)
Phase 1 配对源文件与译文(pair_files)
Phase 2 章节对齐(split_docx / align_by_section)
Phase 3 机械检查(check_mechanical / check_terms / detect_missing_tables)
Phase 4 分批派发审查(build_batches / run_phase4 / dispatch_phase4)
Phase 5 视觉验证(vision_extract_*,扫描件/表格)
Phase 6 跨文件术语一致性
Phase 7 批注写回 DOCX(write_comments_v3)
Phase 8 校对报告(write_report)
- 脚本先行:能用脚本检查的绝不让 Agent 手工判断,
validate_pipeline.py阻断非标准输出。 - 视觉门槛:扫描件/表格必须经过视觉提取验证,禁止跳过;历史教训是跳过视觉必然返工。
- 全量覆盖:覆盖率不足 100% 直接阻断,不允许“看起来没问题”的借口。
- 精确引用:每条 issue 必须携带逐字 source/target 引用,批注落点可回溯。
- 严重度分级:critical / major / minor / info 由统一规则表校准,跨批次一致。
# 1. 准备:源 PDF/DOCX 与译后 DOCX
python scripts/pair_files.py --source 源文件.pdf --target 译文.docx --out pair_info.json
# 2. 章节对齐并构建批次
python scripts/split_docx.py --input pair_info.json
python scripts/build_batches.py --pair pair_info.json --target 20
# 3. 跑机械检查
python scripts/check_mechanical.py --source ... --target ... --out issues_mechanical.json
# 4. 派发 Phase 4 审查(需要模型 API 环境变量)
python scripts/dispatch_phase4.py --batches phase4_batches.json --out phase4_results/
# 5. 视觉验证 + 写回批注
python scripts/vision_extract_target.py --docx 译文.docx --pages ...
python scripts/write_comments_v3.py -i phase4_results.json -j issues_mechanical.json -b 批注.docx -o 校对稿.docx每个阶段的具体参数见 references/data-contract.md 与 references/checklist.md。
SKILL.md 主流程与铁律
references/ 检查清单、数据契约、故障排查、版本历史
scripts/ 各阶段脚本(约 60 个)
workflows/ Claude Code workflow 定义
glossaries/ 用户自己的术语库目录(示例见 glossaries/README.md)
glossaries/ 与 cache/ 默认不提交:术语库和中间产物包含客户语料,公开仓库只保留通用代码与流程。