自对弈强化学习成为强 AI 的硬约束——物化 D4 对称增强的不可替代性
自对弈强化学习成为强 AI 的硬约束——物化 D4 对称增强的不可替代性
适用范围声明:本文讨论的约束可能仅适用于五子棋、围棋等具有 棋盘对称性的棋类游戏(D4 对称群:4 次旋转 × 2 次翻转 = 8 种 等价方位)。非对称博弈(如扑克)的自对弈闭环不会产生 同类方位偏置问题,以下结论不直接适用。
与 sims 数无关:本文结论覆盖所有 sims 配置。高 sims 管线 的标签质量更高、闭环偏置被暂时掩盖,但一旦逼近强 AI(标签干净), 闭环偏置同样会成为瓶颈。低 sims 只是让这个问题更尖锐(标签噪声大 时 Online D4 的去噪收益不够),机制相同。
1. 核心论点
自对弈强化学习要突破"强 AI"瓶颈,全量 D4 物化增强是硬约束—— Online D4 + 经验回放无法替代。
这不是"效果更好"的优化项,是信息论上的天花板:自对弈闭环 (模型生成数据 → 数据训练模型 → 模型变了 → 生成新数据)的 对称性破缺是正反馈的,不强制物化 D4 的话,方位偏置会被闭环 永久固化,盲点永远存在,模型永远有学不到的战术方位。
这个约束与 sims 数无关:高 sims 管线标签质量更高,闭环偏置 被暂时掩盖,但一旦逼近强 AI(标签干净),闭环偏置同样会成为瓶颈。 低 sims 只是让这个问题更尖锐(标签噪声大时 Online D4 的去噪收益 不够),但机制相同。
2. 自对弈闭环的对称性破缺
自对弈是个闭环,数据分布由模型自己产生:
▼text复制代码模型下棋(有微小方位偏置:例,左上角着法略多) ↓ 自对弈生成局面 → 左上角相关战术出现频次更高 ↓ 训练后偏置被巩固,甚至放大 ↓ 下次自对弈继续生成偏置数据 ↓ 闭环正反馈:偏置 → 数据偏置 → 训练偏置 → 偏置更大
这个闭环的破缺机制:数据生成端的不对称——模型按偏置下棋, 生成的数据天然偏,训练端的 Online D4 补不齐,因为它只翻已有的 偏置数据,不改变模型下次下棋的偏置。
3. 物化 D4 vs Online D4:硬约束 vs 软约束
3.1 物化 D4
在数据生成之后、训练之前,立刻为每个原始局面物化 8 份不同 方位的副本,强制训练集瞬间完全对称:
▼text复制代码模型有偏置 → 自对弈生成偏置数据 ↓ 物化 D4(硬约束点) 每个原始局面同时生成 8 个方位副本 → 训练集完全对称 ↓ 同一次 forward/backward 里 8 个方位的梯度一起反传 ↓ 模型的方位偏置在每个训练步都被 8 倍信号强制纠正 ↓ 下次自对弈偏置被削弱 → 生成的数据更均衡 → 正循环(正确方向)
关键:物化 D4 是硬约束——8 个方位的梯度在同一次训练步里 直接竞争,模型没有任何机会"选择性忽略"某个方位。
3.2 Online D4
训练时每个样本随机抽 1 种 D4 变换,不物化 8 份副本:
▼text复制代码模型有偏置 → 自对弈生成偏置数据 ↓ Online D4(软约束点) 每个原始样本在当前 epoch 被随机变换 1 个方位 ↓ 梯度反传时只有 1 个方位的信号 ↓ 模型的方位偏置在这个训练步没有被 8 倍纠正 ↓ 闭环正反馈继续 → 偏置累积
关键:Online D4 是软约束——8 个方位分散在不同 epoch 里, 每次训练步的模型权重不同,梯度不直接竞争,偏置有充分的生存空间。
3.3 核心差异图示
▼text复制代码物化 D4 的梯度竞争(同一步): 方位 0 ─┐ 方位 1 ─┤ 方位 2 ─┼─→ 模型权重(同一次 backward) 方位 3 ─┤ 方位 4 ─┤ 方位 5 ─┼─→ 模型偏置被 8 倍信号强制拉向方位无关 方位 6 ─┤ 方位 7 ─┘ Online D4 的梯度竞争(跨 epoch): epoch 0: 方位 3 ──→ 模型权重 v0 epoch 1: 方位 7 ──→ 模型权重 v1(变了) epoch 2: 方位 1 ──→ 模型权重 v2(又变了) ... 8 个方位的梯度永远不直接竞争,偏置可在间隔中生存
4. replay_rounds 能不能替代物化 D4?
短答:数字上 7 等效,效果上不等效。
4.1 数字等效计算
基于 run_1 配置:每轮 100 局 × 15 手 ≈ 1500 原始样本、num_epochs=3。
样本量等效:
- 物化 D4:每轮训练样本 = 1500 × 8 = 12000(同时约束)
- Online D4 + replay_rounds=N:每轮训练样本 = (N+1) × 1500 × 3
- 令两者相等 → N+1 ≥ 8 → replay_rounds ≥ 7
方位覆盖等效(Coupon Collector 问题):
- 物化 D4:每个原始样本 100% 覆盖 8 个方位(同时)
- Online D4 + replay_rounds=7:每个原始样本被训练 (7+1) × 3 = 24 次 → 期望覆盖 8 × (1 - (7/8)^24) ≈ 7.7/8 方位 ≈ 96%
- replay_rounds ≥ 7 时方位覆盖 ≥ 95%
4.2 为什么数字等效但效果不等效
核心差异回到硬/软约束:
▼text复制代码物化 D4,replay_rounds=0: 同一训练步,同一原始局面的 8 个方位同时过模型 → 梯度直接竞争 → 硬约束 → 偏置在每个训练步被强制纠正 Online D4,replay_rounds=7: 某训练步,局面 A 在方位 3;另一训练步(可能是另一 epoch、另一轮), 同一局面 A 在方位 7;两次训练步的模型权重不同 → 梯度不直接竞争 → 软约束 → 偏置有生存空间
此外,replay 的旧数据还有一个隐藏问题:标签过时——层次重分配 标签的质量依赖当前 value 头的精度。replay 里保留的是历史轮次的 重分配标签,当时 value 头还不准,标签质量差。 物化 D4 用的是当前轮次的新鲜重分配标签,没有过时问题。
结论:replay_rounds 最多缓解数据多样性不足,无法替代物化 D4 的"同一局面 8 方位同时约束"功能。
5. 分阶段收益分析
物化 D4 在训练的不同阶段收益截然不同,这解释了为什么 run_1 (低 sims)用 Online D4 也能逃出双盲期但到不了强 AI,也解释了 为什么高 sims 管线逼近强 AI 时同样会被闭环偏置卡住。
5.1 冷启动期(run_1 r0~r1049,高 sims 同等阶段):D4 收益有限
冷启动期核心瓶颈:policy 标签全是噪声(低 sims:30 sims 每节点 1-3 visits,层次重分配的 Q 也不准;高 sims:搜索深但战术序列少, 早期对局同样单调)。
- 物化 D4:8 份噪声平均,信噪比提升 √8 ≈ 2.8 倍。虽然还是噪声, 但有方向性信号开始浮现。run_1 估算可把逃逸点从 r1200 压缩到 r800。
- 但代价是每轮训练样本量 × 8,每轮耗时从 ~22s 涨到 ~150s+。
- 性价比差:逃逸点缩短 400 轮,但每轮变慢 7 倍,总耗时反而增加。
run_1 实测验证:Online D4 + 30 sims + 小网络 + 层次重分配, 8.4 小时、1200 轮自然逃逸——这是冷启动期管线的合理表现。高 sims 管线的冷启动期同样受益有限,只是高 sims 标签噪声小、逃逸点更早。
5.2 逃出冷启动后(run_1 r1050+,高 sims 同等强度阶段):D4 是刚需
逃出后标签信号已经干净(Q 变准 → 重分配标签变准),瓶颈从 "标签噪声"变成了自对弈闭环的对称性破缺——这是所有 sims 配置 下都存在的普适瓶颈。
- run_1 用 Online D4 逃出后继续训练到 r1379,已经摸到了强 AI 的 门槛(用户实测"模型强度已经非常接近于强 AI")。
- 但这个门槛就是不对称性的天花板——某些方位的战术永远学不到, 或学到了但精度差一截。
- 高 sims 管线到这个阶段同样会被卡住:标签干净了,但闭环偏置的 正反馈开始主导,模型学不到方位无关的特征。
- run_2/run_3 如果继续用 Online D4 + 同一套管线,预测永远过不去: 不是训练时间不够,是自对弈闭环的正反馈会把偏置永久固化, 盲点永远存在。
5.3 分阶段收益总结
| 阶段 | 核心瓶颈 | 物化 D4 收益 | 性价比 |
|---|---|---|---|
| 冷启动期 | 标签全是噪声 | 加速逃逸(估算 r1200→r800),但每轮 ×8 样本 | 差:总耗时增加 |
| 逃出冷启动后 | 闭环对称性破缺 | 打破偏置正反馈,消除盲点,继续爬强度 | 极高:信息论天花板问题 |
6. run_2/run_3 的建议
- run_1 best.pth 已逃出双盲期且接近强 AI,作为 run_2 的 base
- run_2 开启
augment_full=True(物化 D4)——此时标签是干净的, 硬约束收益最大,这是从"接近强 AI"到"强 AI"的关键一步 - 双盲期已过,不用再担心物化 D4 的"标签噪声 × 8"问题
- 训练时间会增加(每轮训练段 × 8),但换来的是打破信息论天花板
如果还没准备好开物化 D4 测试,可以先设 replay_rounds=7 作为
过渡(数字等效下界),但要接受效果永远不如物化 D4。
7. 一句话总结
自对弈闭环的对称性破缺是正反馈的、不可逆的——Online D4 只能软约束、 约束不了闭环本身,物化 D4 是唯一能打破这个正反馈的硬手段。 冷启动期标签是噪声,D4 的收益被稀释;一旦标签干净、模型逼近强 AI, 闭环偏置立刻成为信息论天花板——这道坎,只有物化 D4 能过。
