北航、北大与美团联合提出:策略提升强化学习!
大模型强化学习后训练迎来关键突破:PIRL(Policy Improvement Reinforcement Learning)及其落地算法PIPO,首次系统性地验证每次策略更新是否真正带来能力提升,而非仅依赖当前批次数据的局部优化信号。


传统RL后训练方法的核心关注点始终是:如何从当前采样的轨迹中有效学习?
PIRL/PIPO则将问题提升至更高维度:每次更新完成后,模型是否真正实现了策略进步?若进步了,如何强化这一方向;若未进步甚至退步,如何及时抑制或校正该次更新。

论文标题为Policy Improvement Reinforcement Learning,论文地址为https://arxiv.org/abs/2604.00860,代码开源在https://github.com/JacckMa/pipo_verl。
主要贡献
研究团队提出了PIRL这一全新的强化学习后训练视角,其核心突破在于不再局限于当前批次内的奖励、优势估计或教师信号,而是将跨迭代的策略提升本身作为优化目标。在此基础上,PIPO作为即插即用的闭环优化框架被提出,可无缝接入PPO、GRPO、DAPO及自蒸馏等现有RL后训练算法。该框架不替代原有方法的局部学习信号,而是在其外层构建“回头验证”机制:对确实带来策略提升的更新方向进行放大强化,对未带来提升甚至导致性能下降的更新方向进行抑制、抵消或反向校正。在数学推理、代码生成、工具调用及自蒸馏等多种场景下的实验验证表明,PIPO在多种基础算法和任务中均带来了一致性提升。
背景:RL 后训练已经很强,
但仍然是 “开环” 的
近年来,大模型能力持续提升的关键技术之一正是RL后训练(RL post-training)。
从经典的PPO算法,到推理任务中广泛应用的GRPO、DAPO、GSPO,再到利用模型自身轨迹与反馈进行学习的OPD及自蒸馏方法,技术路线日益丰富,效果持续增强。这些方法共同致力于解决一个核心问题:如何将当前批次数据中的奖励信号、优势估计、执行反馈或教师信号,转化为有效的参数更新,从而探索出更优策略。
尽管这些方法确实推动了策略性能的提升,这也是RL后训练成为主流范式的根本原因,但它们普遍存在一个共同特征:优化过程主要聚焦于当前采样的轨迹。换言之,算法会精细计算当前这批轨迹的学习方式,却很少显式验证该次更新完成后,新策略是否真实优于旧策略。
这正是论文所指出的“开环优化”问题。开环并不意味着方法无效,而是意味着训练流程中缺失了一个关键环节:对更新效果进行验证,并基于验证结果对上一轮更新方向进行回溯校正。
RL后训练不能仅关注当前批次内的局部信号,还需要构建跨时间的验证机制,以及能够对历史更新方向进行再加权、抑制或校正的回溯调整机制。
PIRL:把 “策略提升” 本身变成优化目标



论文从理论上证明,该目标不会改变最终优化方向。对于固定初始策略而言,最大化累计策略提升与最大化最终策略性能是彼此对齐的,这意味着目标改写并未偏离预期模型能力。
因此,PIRL并非否定奖励、优势或教师信号的价值,而是补充了它们所缺失的关键环节:更新之后,必须验证该次更新是否真正转化为策略提升。
PIPO:让训练过程学会 “回头看”
基于PIRL的理论框架,论文进一步提出了Policy Improvement Policy Optimization(PIPO)。其核心包含两个步骤:首先让基础算法正常进行探索,随后在下一轮迭代中利用策略提升反馈回头验证该次探索是否真正带来了策略进步。若新策略相较于历史基准表现更优,PIPO判定上轮更新方向与策略提升方向一致,进而放大并巩固该方向;若新策略未带来提升甚至导致性能下降,PIPO则削弱该更新方向的影响,必要时通过回溯校正在优化层面抵消有害更新。

该步骤回答的核心问题是:当前这批轨迹应当如何学习?




因此,策略提升目标可以被表述为类似于PPO的裁剪形式:



通过这种方式,PIPO能够在PPO、GRPO、SDPO等原有方法基础上即插即用地引入跨迭代验证机制。它将单批次内的局部学习信号与批次之间的历史表现建立关联,使每次更新都多一层判断依据:该次更新后,模型整体性能是否变得更强?若变强,则巩固有效的更新方向;若变弱,则削弱有害的更新影响。由此,原本开环的RL后训练被转化为带有策略提升反馈的闭环优化过程。
实验验证
论文首先在数学推理任务上对PIPO进行验证。
实验结果显示,在PPO、GRPO、GSPO、DAPO等算法基础上接入PIPO后,模型的平均表现与思考长度均获得显著提升。


PIPO的适用性不仅限于数学推理领域。论文进一步在代码生成任务与工具调用任务上进行了实验验证,同时也在自蒸馏设置下验证了PIPO的提升效果。


结语:RL 后训练需要更好的闭环
以往的RL后训练方法主要致力于回答一个问题:当前这批轨迹该如何学习?PIRL/PIPO则进一步追问:该次学习完成后,模型是否真正变得更强?
这正是论文最核心的观点:RL后训练不能仅关注当前批次内的奖励、优势估计或教师信号,真正关键的在于每次更新后,模型是否产生了可验证的策略提升,并据此对更新进行动态强化或削弱。
PIRL将“进步”本身定义为优化目标,PIPO则将该目标转化为一个可接入现有算法的闭环训练框架。
PIRL与PIPO的核心理念,是将传统RL后训练从依赖局部信号的开环优化,升级为具备跨迭代验证能力的闭环系统,让模型每次更新后都能确认自身是否真正进步,从而巩固有效方向、校正有害影响。