← 返回资料站  /  Recursive Self-Improvement
论文 自提升极限分析

Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models

生成-验证差距:LLM 自提升能力的系统测量
一句话CMU/Harvard/Amazon 团队把 self-improvement 形式化为『生成-验证差距』(GV-Gap),在 GSM8K/MATH/NQ/Sudoku 上横跨 Qwen/Llama 等多个模型家族测量:relative GV-Gap 随预训练 flops 单调上升(但仅限特定 verification 方法),迭代自提升 2-3 轮内 gap 归零,有效多样性(pass@k)随迭代坍缩。ICLR 2025,引用约 104 次,无代码发布。

这是什么

Self-improvement 的标准流程是:模型生成多个候选回答 → 用同一模型给回答打分(自验证)→ 按分数过滤/重加权后蒸馏回模型。STaR、Self-Rewarding 等一批工作报告了效果,但『提升到底来自哪、能持续多久』一直没有干净的答案——以往用 update 前后的 accuracy 差来度量,里面混着 answer format 对齐等混淆因素。

这篇论文给出一个模块化的数学框架,把过程拆成 generation、verification、model update 三个环节,并定义核心量 GV-Gap:gap(f,g) = J(f[w(pu_g)]) − J(f),即『按 g 的验证分数重加权 f 的生成分布后,期望 utility 提升了多少』。这个量在 update 之前就能测,把『验证信号有多少料』和『蒸馏做得好不好』解耦。再除以到满分的剩余空间就得到 relative GV-Gap,用于跨模型比较。

作者用这套框架系统回答了三个问题:GV-Gap 如何随模型规模变化(scaling)、哪些任务根本不可自提升、迭代自提升何时饱和。它是目前判断『自提升能不能持续』最常被引用的分析框架,也是 RSI 方向讨论 verification bottleneck 时的标准参照。

迭代自提升的核心结果(Qwen-1.5 在 MATH 上):左图 accuracy 每轮递增但增幅迅速变小,右图 GV-Gap 从约 2.5% 在 3-4 轮内单调降到 0——无新信息注入时自提升必然饱和,且 7B/14B/32B 饱和速度几乎相同,与模型大小无关。
迭代自提升的核心结果(Qwen-1.5 在 MATH 上):左图 accuracy 每轮递增但增幅迅速变小,右图 GV-Gap 从约 2.5% 在 3-4 轮内单调降到 0——无新信息注入时自提升必然饱和,且 7B/14B/32B 饱和速度几乎相同,与模型大小无关。

机制与做法

框架:三个环节与 GV-Gap

Generation:模型 f 对 prompt 采样多个回答(温度采样,greedy 则无可提升空间)。Verification:用 proxy utility pu_g(x,y) 给回答打分。Update:把重加权分布 f[w(pu)] 投影回模型类,两种实例——rejection sampling(w 为阈值指示函数,过滤后 SFT)和 KL 正则 RL(w(s)=exp(s/β))。

自提升成立需要三个条件同时满足:生成有 variability、验证信号有信息量(gap>0)、update 蒸馏误差小。论文证明 J(f_{t+1}) − J(f_t) ≥ gap(f_t,g) − ε_update,所以 GV-Gap 是提升量的干净上界来源。作者还专门指出:实验里观察到 J(f_1) 有时超过 J(f_0[w])——这不是能力提升,是 finetune 后答案格式对齐带来的『假提升』,以往工作的度量方式会把它算进 self-improvement。

instruct/chat 模型的 relative GV-Gap 对 log(flops) 散点(附录版本)。可以直观看到 scaling 结论的真实成色:CoT-S(绿星)大致平缓向上,MC(蓝点)剧烈波动、在 Qwen-1.5 大模型处甚至为负;中间 Llama-2-Chat 面板的趋势线只由 3 个点支撑。
instruct/chat 模型的 relative GV-Gap 对 log(flops) 散点(附录版本)。可以直观看到 scaling 结论的真实成色:CoT-S(绿星)大致平缓向上,MC(蓝点)剧烈波动、在 Qwen-1.5 大模型处甚至为负;中间 Llama-2-Chat 面板的趋势线只由 3 个点支撑。

三种 verification 机制

MC(Multiple Choice):让模型对回答输出单 token 的 Correct/Incorrect,用两个 token 的 logits 归一化得到分数;CoT-Score/CoT-Binary:让模型先写验证推理链再给 1-10 分或 0/1 分,取期望;Tournament:成对比较淘汰赛,2^r 个候选打到剩 1 个。

结论是 CoT 验证明显比 MC 稳定:MC 在 Qwen-1.5 14B/32B、Llama-3 8B 这类中型模型上都可能给出负 gap,而 CoT 对中大型模型 gap 始终为正。不同 verification 方法选中的样本重叠度不高,ensemble 多种验证可以进一步增大 gap。

实验设计:scaling、不可提升任务、迭代

Scaling:在 GSM8K(1320 题)和 MATH(5000 题)上测 Qwen-1.5/2、Llama-2/3 等家族从 0.5B 到 72B 的 gap,对 pre-training flops 作图;另做 cross-verification(固定 generator 换 verifier、或反之),发现 gap 随 verifier flops 单调升、随 generator flops 单调降——越强的模型的错误越难被(弱)验证器抓住。

任务边界:Natural Questions 上所有模型 gap <1% 甚至为负——事实型任务验证不比生成容易,不可自提升;4x4 Sudoku(验证是 P、生成 NP-hard)上只有 72B 级模型有非平凡 gap(Qwen-2 72B gap 16.99%,accuracy 相对提升约 200%),0.5B-7B 全部失败——说明『验证在计算复杂度上更容易』不够,还需要模型预训练中获得的推理能力达到门槛。

迭代:对 Qwen-1.5 7B/14B/32B/72B 反复做 rejection-sampling/RL 自提升。gap 在 2-3 轮内降到近零,饱和速度与模型大小无关;pass@k 在小 k 上随迭代上升、大 k 上下降,即模型在收敛到部分错误答案、有效多样性坍缩——作者认为这是饱和的机制性原因。

关键结果

实证核查

有水分框架本身干净、负结果(饱和、任务边界)与先前工作互相印证,是靠谱的分析;但标题级的 scaling 结论比传播中的版本弱得多——只在挑过的 verification 方法和部分模型家族上成立,且全文无代码发布,数字无法复现核对。
『relative GV-Gap 随预训练 flops 单调 scaling』(题图与摘要中的核心卖点,常被引用为“自提升会随规模持续变好”)。
论文自己限定了『with certain verification methods (such as CoT-Score)』。对照其附录图(本地 figures/fig02_scale_instruct_relative.png,instruct/chat 模型版本):散点明显不单调,MC 在最大 flops 处甚至跌到 -17% 左右,Llama-2-Chat 面板的虚线趋势只由 3 个点支撑;每个家族只有 4-8 个模型点,『线性于 log flops』是作者明说的 conjecture 而非拟合律。scale.tex 中也承认各家族斜率不同、绝对 gap 无此趋势。
迭代自提升在 2-3 轮内饱和,原因是有效多样性下降。
与本地图 fig15_iterative_math.png 一致(7B/14B/32B 的 gap 都在 3-4 轮内归零),且作者引 Self-Rewarding (yuan2024self)、liang2024sheep 等独立工作观察到同样的饱和——这条负结果是全文最可信的部分,后续多篇工作沿用。
『comprehensive, modular and controlled study』,横跨多模型家族、多任务的大规模对照实验。
全文未发布任何代码或评测脚本:catalog 中 code_url 为空,serper 搜『论文名 + github』找不到官方仓库,tex 源码里也无仓库链接;所有表格数字只能信作者。顺带一提,arXiv 源码里还留着未删的内部批注(introduction.tex L6/L14 的 \hl{...} 合作者评论),上传较随意。引用约 104 次(Google Scholar 摘录,2026-08),但未检索到第三方复现报告。
GV-Gap > 0 意味着存在可利用的自提升信号(『verification 比 generation 容易』)。
论文自己的 NQ/Sudoku 实验已经划出边界(事实任务 gap≈0,Sudoku 仅 72B 级可行);2026 年的 self-improvement survey(arXiv 2603.25681)更设专节 'Illusory Generation-Verification Gap' 质疑该前提在 self-refinement 场景普遍不成立。也就是说这个框架的适用范围(数学等验证被预训练覆盖的任务)比标题暗示的窄。

与我们方向的关系

对 RSI 方向,这篇是『自提升能不能无限持续』问题的基准答案:不能——没有新信息注入时,gap 2-3 轮归零,且瓶颈机制(无法验证罕见正确答案 → 多样性坍缩)被明确指认。任何声称多轮持续自提升的系统,都应该对照这里的饱和曲线解释自己的新信息来源(工具、环境反馈、更强验证器)在哪。

可直接借鉴的方法论:用 GV-Gap(update 之前的重加权提升)替代『训练前后 accuracy 差』来度量自提升能力,可剥离格式对齐等混淆;评估自提升系统时先测任务的 gap 是否为正、verification 方法是否稳定(CoT 优于 MC logit)。cross-verification 的单调性也给『用什么模型当 judge』提供了定量依据。

阅读笔记

arXiv v3 (2026 更新) 与 ICLR 2025 camera-ready 内容一致。读附录时注意:主图 scale_relgap 是 base 模型,figures/ 里抓到的 fig02/fig03 是 instruct 模型的附录版本,趋势更噪。tex 源码里留有作者互相的 \hl 批注,可当八卦。

材料清单

TeX 源码
已存档:Raw/mind-the-gap/source/
OpenReviewopenreview.net/forum?id=Hgv0tqgaiA
ICLR 2025 评审页(PDF 可直接取)
后续质疑www.alphaxiv.org/abs/2603.25681v1
2026 self-improvement survey,含 'Illusory Generation-Verification Gap' 一节,质疑 GV-Gap 前提的普适性

同类条目