论文
自举训练
Self-Rewarding Language Models
自我奖励语言模型:模型同时当选手和裁判
Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, et al. (Meta & NYU) · Meta · ICML 2024 · 2024-01 · 被引 695
一句话Meta 用 Llama 2 70B 做实验:模型自己生成回答、自己用 LLM-as-a-Judge 打分、构造 DPO 偏好对迭代训练,3 轮后 AlpacaEval 2.0 胜率从 9.94% 涨到 20.44%,且裁判能力本身也从 78.7% 提到 81.7%(pairwise 准确率)——'奖励信号随训练一起进化'的代表作,但战绩里有明显的长度偏置水分。
这是什么
RLHF 的标准做法是先用人类偏好数据训一个固定的 reward model,再拿它指导策略模型训练。这带来两个瓶颈:奖励信号的上限被人类标注水平锁死;reward model 训完就冻结,不会随策略模型一起变强。这篇论文的出发点是把这两个瓶颈一起拆掉:让语言模型自己既当选手(生成回答)又当裁判(给回答打分),裁判能力和生成能力用同一套参数,一起在迭代中提升。
具体做法非常轻量:不训独立 reward model、不用 PPO,全程只靠 LLM-as-a-Judge prompt + Iterative DPO。种子数据只用 Open Assistant 里 3200 条人写指令数据(IFT)加 1630 条评价数据(EFT),之后每一轮的训练数据都由模型自己造。论文在 ICML 2024 发表,S2 引用已 695 次,是 self-improvement 闭环里'评价者也在进化'这条线被引用最多的工作之一。
方法总览:左边 Self-Instruction creation——当前模型 M_t 对新 prompt 生成 N 个候选回答,再自己用 LLM-as-a-Judge 打分;右边取最高/最低分组成偏好对做 DPO,训出 M_{t+1},再喂回循环。整个闭环里没有外部 reward model,裁判和选手是同一套参数。机制与做法
自我造数据的循环
每轮迭代分两步。第一步 Self-Instruction creation:用 8-shot prompt 让模型(实际上是固定的 Llama 2-Chat 70B)仿照种子数据生成新 prompt;当前模型 M_t 对每个 prompt 采样 N=4 个候选回答(T=0.7);再让同一个 M_t 用 LLM-as-a-Judge prompt 给每个回答打 0-5 分,打分采样 3 次取平均以降方差。第二步:取最高分和最低分回答组成偏好对(同分则丢弃),用 DPO 训出 M_{t+1}。
裁判 prompt 是精心设计的'累加式 5 分制'(相关 +1、覆盖大部分 +1、有用 +1、AI 视角组织良好 +1、专家级 +1)。这个 prompt 本身很关键:换成 Instruction Backtranslation 论文里的分档式 prompt,SFT baseline 的 pairwise 准确率会从 65.1% 掉到 26.6%。
GPT-4 评的 head-to-head:对同一个 SFT baseline,M1 基本平手(30.5% vs 30.9%),M2 胜率 49.2% vs 14.5%,M3 涨到 62.5% vs 9.8%——逐轮增益清晰。但注意这期间回答平均长度也从 1092 涨到 2552,GPT-4 裁判的长度偏好会放大这个差距。模型序列与数据量
M0 = Llama 2 70B 裸模型;M1 = M0 上 SFT(IFT 3200 条 + EFT 1630 条);M2 = M1 + DPO on AIFT(M1)(3964 对偏好);M3 = M2 + DPO on AIFT(M2)(6942 对)。注意所有'自产'数据只有几千对,训练成本很低——这也是为什么方法容易被小团队复现尝试。
一个重要的设计验证:加 EFT 数据训裁判能力,不损害指令跟随能力(head-to-head 30.5% vs 30.9%,基本平手),所以两种技能可以安全地共存于一个模型。
两个轴同时提升
指令跟随轴:GPT-4 评的 head-to-head 中,M3 对 SFT baseline 的胜率 62.5% vs 9.8%;AlpacaEval 2.0 胜率 9.94% → 15.38% → 20.44%,超过榜上的 Claude 2 (17.19%)、Gemini Pro (16.85%)、GPT-4 0613 (15.76%)。作者也做了 50 条指令的人工盲评,趋势与 GPT-4 自动评一致。
裁判轴(论文最独特的结果):M2 是用 M1 的奖励训出来的,但 M2 自己当裁判时和人类偏好的 pairwise 一致率从 M1 的 78.7% 升到 80.4%,M3 再升到 81.7%——而这期间没有加任何新的 EFT 数据。也就是说奖励模型确实在闭环里跟着变好,这是对'固定 reward model 是 self-improvement 天花板'这一论断的直接回应。
关键结果
- AlpacaEval 2.0 胜率(对 GPT-4 Turbo):M1 9.94% → M2 15.38% → M3 20.44%,超过 Claude 2、Gemini Pro、GPT-4 0613 的榜上成绩。
- 裁判能力随迭代提升:pairwise 准确率 SFT 65.1% → M1 78.7% → M2 80.4% → M3 81.7%;Spearman 相关 0.253 → 0.349。
- MT-Bench 总分 6.78 (M1) → 7.25 (M3),但提升集中在 humanities/写作/roleplay;math+code+reasoning 只从 3.83 到 4.17,数学和逻辑推理类在 AlpacaEval 细分里也几乎不涨——方法主要是'更好地利用已有知识',不产生新能力。
- 消融:只把 5 分满分回答加进 SFT(positive-only,类似 ReST)不奏效(29% vs 30% 平手);必须用偏好对 + DPO 才有增益。
- 回答长度随迭代显著膨胀:M1 平均 1092 字符 → M2 1552 → M3 2552,作者自己承认长度与评分的相关性'可能是相对表现的一个因素'。
- NLP 基准有轻微 alignment tax:ARC-Challenge 从 SFT 的 55.97 降到 M3 的 53.13,HellaSwag 85.17 → 83.29;GSM8K 比 SFT 高但从 M1 起逐轮下滑(60.27 → 57.70)。
实证核查
有水分闭环机制本身成立(有人工盲评佐证,方向被大量后续工作跟进),但'超过 GPT-4 0613'的头条战绩明显搭了 AlpacaEval 长度偏置的便车;Meta 没放官方代码,小模型上的第三方复现表明迭代增益会衰减甚至反转。
M3 在 AlpacaEval 2.0 上胜率 20.44%,超过 Claude 2、Gemini Pro 和 GPT-4 0613。
该数字是 GPT-4 裁判的原始 win rate,而论文自己的数据(Section 4.2 'Data distribution analysis')显示回答平均长度从 M1 的 1092 膨胀到 M3 的 2552——超过一倍;GPT-4 裁判偏爱长回答是公认问题,AlpacaEval 官方后来专门推出 length-controlled win rate 来修正这类膨胀。论文 Limitations 一节也承认长度与评分相关'应该被更深入地理解'。用 LC 口径,这个'超过 GPT-4'的排名大概率不成立。
论文展示了一个可持续的自我提升闭环,奖励能力和生成能力可以一起迭代变好。
论文只跑了 3 轮、单一 setting(Llama 2 70B + Open Assistant),作者在 Limitations 里自称结果 preliminary。第三方在小模型上的验证不乐观:CREAM(arXiv 2410.12735,引用 39)在 7B 模型上发现 self-rewarding 的增益'几轮后衰减',归因于奖励偏差在闭环中累积、偏好标签过度自信;Meta 同组半年后的 Meta-Rewarding(arXiv 2407.19594)也承认裁判能力会饱和,需要引入 meta-judge 才能继续提升。裁判轴的提升本身也不大(78.7% → 81.7%)。
方法简单可复现:只需种子数据 + LLM-as-a-Judge + Iterative DPO。
Meta 没有发布官方代码和模型权重(论文和 arXiv 页面均无仓库链接)。生态里全是第三方实现:lucidrains/self-rewarding-lm-pytorch(1.4k stars,只是训练框架骨架,2024-04 后停更)、Oxen-AI/Self-Rewarding-Language-Models(用 Mistral 7B 在单卡 A10 上复现全流程,博客记录了 M0→M1 可以跑通,但没有复现出 70B 论文级别的逐轮增益)。流程可复现、战绩数字无人独立复现。
自我奖励训练不损害模型原有能力。
论文自己的 Table(NLP Benchmarks)显示并非无损:ARC-Challenge 55.97 → 53.13、HellaSwag 85.17 → 83.29、GSM8K 从 M1 的 60.27 逐轮降到 M3 的 57.70、NQ 35.48 → 31.86。作者用 InstructGPT 的 'alignment tax' 来解释。提升集中在开放式写作/对话类任务,数学与推理几乎不动。
与我们方向的关系
对 RSI(recursive self-improvement)方向,这篇是'评价者也在进化'的锚点工作:它把 self-improvement 闭环里最常被固定的组件——reward model——放进了迭代循环,并给出了裁判能力确实随训练提升的量化证据(尽管幅度不大)。后续的 Meta-Rewarding、SPIN、CREAM、以及各种 self-play alignment 工作基本都以它为参照系。
可借鉴与需警惕的点:(1) 累加式打分 prompt 比分档式好用得多(65.1% vs 26.6%),做 LLM-as-a-Judge 时值得直接抄;(2) positive-only 自蒸馏不如偏好对 + DPO,这个消融对设计自举训练流程有直接指导意义;(3) 最大的坑是奖励偏差累积——闭环里裁判和选手同源,长度膨胀就是最直观的 reward hacking 症状,任何 self-rewarding 复现都应该同时报 length-controlled 指标,并像 CREAM 那样考虑跨轮一致性正则。
阅读笔记
论文用的评测(AlpacaEval 2.0 raw win rate、GPT-4 head-to-head)在 2024 年初是标准做法,但今天看都是易被长度和风格 hack 的软指标;读这篇时应把'战绩'和'机制验证'分开看,机制部分(裁判能力可迭代提升 + 人工盲评一致)比排行榜数字可信。tex 源码在 Raw/self-rewarding-language-models/source/neurips_2023.tex。
材料清单
TeX 源码已存档:Raw/self-rewarding-language-models/source/
同类条目