← 返回资料站  /  Recursive Self-Improvement
论文 自博弈训练

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

SPIRAL:零和游戏自博弈激发可迁移推理能力
一句话让 LLM 在 TicTacToe、Kuhn Poker、Simple Negotiation 三个零和文字游戏上跟自己对弈做 RL,不用任何数学题和人工标注,Qwen3-4B-Base 在 8 个推理基准上平均提升 10.5 个百分点,且超过在 2.5 万条专家对局轨迹上做 SFT 的效果。

这是什么

RLVR(可验证奖励 RL)训练推理模型依赖人工整理的题目-答案对和领域特定的奖励工程,扩展性受限。SPIRAL 的思路是把监督信号换成零和游戏的输赢:同一个模型扮演对局双方,随着自己变强、对手也同步变强,形成一个不需要人管的自动课程(automatic curriculum)。这正是 AlphaZero 式 self-play 的老思路,但这里的对象是通用 LLM,且关心的不是游戏本身的棋力,而是推理能力能否迁移到数学、科学问答等完全无关的领域。

论文来自 NUS、Sea AI Lab、Northeastern、UW(Natasha Jaques 组)等,2025 年 6 月放出,S2 引用已 82 次。工程上他们基于 Oat + vLLM + TextArena 实现了一套全在线(fully online)的多智能体多轮 RL 系统,并提出 RAE(Role-conditioned Advantage Estimation)解决共享策略自博弈的训练不稳定问题。代码、模型、对局数据全部开源(MIT),后来还加了基于 Thinking Machines Tinker 的简化训练入口,支持到 GPT-OSS-120B。

SPIRAL 系统架构:左边并行 actor 在向量化游戏环境(TicTacToe / Kuhn Poker / Simple Negotiation)里用同一个策略 πi 扮演双方做多轮 rollout,过程奖励全为 0、终局才给 ±1;右边 learner 用 RAE 给两个角色分别算优势后做 RL 更新,再把权重同步回 actor。注意双方共用一套参数——自动课程是这个设计的直接结果。
SPIRAL 系统架构:左边并行 actor 在向量化游戏环境(TicTacToe / Kuhn Poker / Simple Negotiation)里用同一个策略 πi 扮演双方做多轮 rollout,过程奖励全为 0、终局才给 ±1;右边 learner 用 RAE 给两个角色分别算优势后做 RL 更新,再把权重同步回 actor。注意双方共用一套参数——自动课程是这个设计的直接结果。

机制与做法

训练框架:单策略双角色的在线自博弈

游戏建模为 turn-level 的两人零和 Markov game:状态是完整对局上下文,动作是一整段多 token 回复(推理 + \boxed{action}),奖励极稀疏——只在终局给 ±1/0。双方不训练两套参数,而是共用一个策略 πθ,靠 system prompt 做角色条件化。这样显存省一半,而且保证'我变强对手就变强',自动课程是结构性保证而不是调度出来的。

系统采用 actor-learner 架构:并行 actor 用 vLLM 在向量化的 TextArena 环境里采样对局轨迹,中心 learner 用 REINFORCE 做 on-policy 更新。训练配置:400 步、每步 128 条样本、lr 1e-6、temperature 1.0,8×H100 跑约 25 小时。

本文最关键的对照实验:自博弈(橙)vs 三种固定对手。左图对局胜率、中图数学、右图通用推理。随机对手(灰)让训练彻底崩溃;固定 Mistral/Gemini 对手能学但平台;自博弈在数学和通用推理上持续领先——说明涨分来自'对手不断变强'的自适应课程,而不是学会了游戏机制本身。
本文最关键的对照实验:自博弈(橙)vs 三种固定对手。左图对局胜率、中图数学、右图通用推理。随机对手(灰)让训练彻底崩溃;固定 Mistral/Gemini 对手能学但平台;自博弈在数学和通用推理上持续领先——说明涨分来自'对手不断变强'的自适应课程,而不是学会了游戏机制本身。

RAE:防止 thinking collapse 的关键

零和自博弈意味着同一个模型同时在优化两个互为相反数的目标(R1 = -R0),朴素 REINFORCE 方差极大且环境非平稳。RAE 的做法很简单:给每个(游戏 G, 角色 p)组合维护一个独立的 EMA baseline b_{G,p},优势 A = R - b_{G,p},把先手优势、信息不对称这类角色固有收益差从梯度里扣掉。

消融显示这不是锦上添花:去掉 RAE 后 100 步内推理长度从约 2000 字符崩到接近零,模型退化成直接输出 \boxed{bet} 不带任何思考,通用推理成绩从 44% 掉到 40%;带 RAE 则稳定在 1300-1500 字符并从 40% 涨到 47%。

为什么会迁移:自动课程 + 认知模式分析

对照实验是这篇最有价值的部分:同样的游戏,把对手换成固定的 Random / Mistral-Small-3 / Gemini-2.0-Flash-Lite。随机对手直接导致训练崩溃;固定模型对手初期能学但很快平台——对 Gemini 的胜率从 0% 一路涨到 62.5%,说明模型在学习'剥削'(exploit)这个静态对手的固定漏洞;而自博弈的对局胜率始终维持在 50-52%(对手同步变强),数学和通用推理成绩却持续领先所有固定对手基线。这基本排除了'涨分只是学会了游戏机制或 spurious reward'的解释,把功劳干净地归到自适应课程上。

机制层面,他们用 GPT-4.1 给 290 条对局轨迹和 46,792 条数学解答打认知模式标签:Case-by-Case Analysis 从游戏到数学几乎无损迁移(72%→71%),Pattern Recognition 反而放大(35%→45%),Expected Value Calculation 选择性迁移(78%→28%)。不同游戏练出互补技能——TicTacToe 特长生在空间类 OOD 游戏 Snake 上 56.0%,Poker 特长生在概率类 Pig Dice 上 91.7%,三游戏混训平均 59.5%,好于任何单游戏特长生(最高 52.9%)。

关键结果

实证核查

扎实代码、模型、数据全开源且与论文声称一致,固定对手对照实验设计干净,repo 有真实社区使用并持续维护;主要保留意见是一个未回应的 baseline 复现疑问,以及增益集中在弱基座模型上。
论文声称 Qwen3-4B-Base 在 MATH500 上 baseline 为 73.4%,SPIRAL 后 78.2%,平均提升 10.5 个百分点。
GitHub issue #13(open,截至 2026-08 无作者回复)有人按论文声称的配置(temp=0.6、top-p=0.95、4-shot CoT)在 4×A40 + vLLM 0.20.2 上只复现出 53.6% 的 baseline,与 73.4% 差距很大。注意方向性:baseline 偏低只会让 SPIRAL 的相对增益显得更大而非更小,更可能是 Qwen3 base 模型对 few-shot 模板极度敏感的评测配置问题,但这确实说明表格数字对 eval 设置的依赖没交代干净。
README 声称开源了自博弈训练代码、模型和对局数据集,训练脚本在 8×H100 上验证过。
属实且超出:repo(spiral-rl/spiral,MIT,204 stars)含完整 Oat-based 训练管线 run.sh、游戏与基准评测脚本,HF collection 里有模型和 game-play 数据集;2026 年 3 月仍在更新(新增 Tinker 训练路径,支持 Qwen3/Llama/GPT-OSS-120B)。issues 显示有真实第三方使用:#1 问其他环境、#4 要多节点支持(均由后续 PR 落实)、#7 报告发布的 Spiral-Qwen3-4B 推理报错(作者回复需 enable_thinking=False,已关闭)。
'消除了对人类监督的需求'、自博弈产生'infinite curriculum'。
论文附录 Limitations 自己承认了折扣:依赖从人工标注题目转移到了人工设计的游戏环境(TicTacToe/Kuhn Poker 都很简单、奖励较密),延长训练收益递减(并非 infinite),每次运行 8×H100 约 25 小时,且承认 reward hacking 风险未在复杂环境验证。核心迁移结论有固定对手对照实验支撑(tex 源码 Table win_rate_evolution:固定 Gemini 对手胜率 0%→62.5% 而自博弈恒定约 50%),这部分证据是干净的。
'improving performance by up to 10% across 4 different models spanning Qwen and Llama families'。
论文 Table 1(tex 源码)自己的数字显示 10.5 只出现在 Qwen3-4B-Base;Llama-3.1-8B-Instruct 平均只 +2.0(且 MATH500 上 SFT 51.8 > SPIRAL 49.8),DeepSeek-R1-Distill-Qwen-7B 只 +1.4。'up to'措辞没撒谎,但对强基座/已 RLVR 模型的边际收益很小,引用时不应只记住 10%。

与我们方向的关系

对 RSI(递归自提升)方向,SPIRAL 提供了目前最干净的'自动课程即监督'证据之一:提升不来自外部标注,而来自'对手随自己变强而变强'这一结构性质,并且用固定对手对照实验把这个因素单独剥离了出来。这可以作为讨论'无监督自提升是否可能'时的正面锚点——但同时要注意它的边界:增益在已经用 RLVR 训过的模型上缩水到 1-2 个点,说明游戏自博弈更像是激发/放大 base 模型已有能力的 mid-training 手段,而非无上限的自提升回路。

可直接借鉴的工程点:RAE 这种按(环境, 角色)分桶的 EMA baseline 对任何'同一模型优化对抗性目标'的多智能体训练都适用,thinking collapse 的消融图是很好的失败模式参考;Oat + vLLM + TextArena 的全在线 actor-learner 栈和新加的 Tinker 简化入口(单卡就能试)降低了复现门槛。如果课题组想做'环境设计代替数据标注'的实验,三个游戏对应三种认知技能且可叠加的发现,提示可以按目标能力反向设计游戏。

阅读笔记

tex 源码是 ICLR 2026 投稿版(iclr2026_conference.tex,带 \revised 标记),比 arXiv v1 多了 instruct 模型结果、game generalization 等附录;OpenReview 有 forum(id=7Yayy5fNLg)但 API 拿不到 review,录用结果未核实。复现时注意:发布的 Spiral-Qwen3-4B 要 enable_thinking=False(issue #7);base 模型基准评测对 few-shot 模板极敏感(issue #13 的 20 分差距)。

材料清单

TeX 源码
已存档:Raw/spiral/source/
代码仓库github.com/spiral-rl/spiral
204★ · 最近推送 2026-03-27
HF Collectionhuggingface.co/collections/spiral-rl/spiral-68627f14c250c3cc1fdbf6fe
模型 + 对局数据集(SFT 基线用的 25k 专家轨迹也在这里)
OpenReviewopenreview.net/forum?id=7Yayy5fNLg
ICLR 2026 投稿页(需登录看 review)
TextArenagithub.com/LeonGuertler/TextArena
训练用的文字游戏环境库
复现疑问 issuegithub.com/spiral-rl/spiral/issues/13
MATH500 baseline 73.4% vs 复现 53.6% 的未回应提问

同类条目