(2605) T²PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic RL (SOTA, UCLA & Amazon)
🌺 论文摘要
参考链接
核心方法
T²PO 框架 (Token- and Turn-level Policy Optimization)- 针对多轮Agentic RL中的探索效率低下问题,提出基于“不确定性 (Uncertainty)”的细粒度探索控制机制。
双层干预机制:Token级别 (TTI):监控推理过程的不确定性变化,当不确定性边际变化低于阈值时,强制截断思考,进入动作输出。Turn级别 (TDS):评估当前轮次的交互是否有显著的探索进展,若进展微小则动态重采样该轮次,避免无效交互。
模型效果(Qwen3-4B/8B)
- 在
WebShop、ALFWorld和Search QA等复杂多轮交互基准上均取得 SOTA 效果。 - 相比于此前的 SOTA 算法(如 GiGPO),Qwen3-4B 在 ALFWorld 上的成功率提升至
90.23%(+约10个点),WebShop 成功率提升至81.64%。
重要结论
- 多轮 Agentic RL 的训练崩溃(Training Collapse)主要源于
探索效率低下(Hesitation现象):包括Token级别的“过度思考”和Turn级别的“重复无效动作”。 - 显式地管控低信息量的探索,比单纯的基于奖励塑形(Reward Shaping)或轨迹过滤(Trajectory Filtering)更有效,能显著提升训练稳定性和成功率。
关键贡献
- 提出了融合“熵(Entropy)”和“置信度(Confidence)”的
自校准不确定性信号 (Self-calibrated uncertainty signal)。 - 提出了
TTI和TDS机制,在Token和Turn双级别实现了细粒度且自适应的“防犹豫(Anti-hesitation)”干预。
问题背景
❓问题背景
多轮 Agentic RL 的训练不稳定性
- 现代 LLM Agent 的自我进化依赖多轮强化学习(RL)。
- 然而,多轮长视野(Long-horizon)交互与稀疏奖励结合,使得信用分配极其困难,极其容易导致
训练崩溃(Training Collapse)。
传统缓解策略的局限性
- 以往的方法尝试通过细粒度奖励、内部过程奖励(PRM)、或粗粒度的轨迹过滤来稳定训练。
- 缺点:这些方法多在粗粒度轨迹级别操作,或者依赖隐式的奖励塑形,对超参极度敏感,依然难以避免训练崩溃。
核心洞察:Hesitation (犹豫现象)
- 作者发现不稳定的根源在于系统违背了探索与利用的平衡,即
无效探索 (Insufficient exploration):- Token 级别 (Overthinking):LLM会生成极长的思考链(CoT),但信息增益很快饱和,只剩下不断累积的采样噪声。
- Turn 级别:LLM 偏离正确轨道后,在多轮交互中不断重复同样的废话或无效操作,白白浪费 rollout 预算。 :::
T²PO 核心方法
📕核心方法
自校准不确定性信号 (Self-calibrated Uncertainty Signal)
- 传统的“熵”无法区分几乎均匀和高度尖锐的分布,而“置信度”只看Top-1概率忽略了尾部。
- 作者将两者归一化后融合:
。该信号能更准确地衡量LLM在当前Token生成的内在不确定性和探索状态。
Token级别的思考干预 (TTI, Token-Level Thinking Intervention)
- 目标:自适应截断冗余的思考链(CoT),防止过度思考。
- 机制:
- 实时监控
的变化量 。 - 当滑动窗口内的平均变化量低于阈值
时,说明LLM的想法已经“收敛”,再思考下去只是徒增噪声。 - 触发强制干预:覆写Logits,强制输出
</think>标签,并注入决定性的前缀\n<action>,直接强迫模型进入动作执行阶段。
- 实时监控
Turn级别的动态采样 (TDS, Turn-Level Dynamical Sampling)
- 目标:避免跨轮次的重复废话和无效交互。
- 机制:
- 将一轮对话内所有的 Token 不确定性聚合为 Turn 级信号
。 - 监控相邻两轮的差异
。 - 若
(变化极小),说明当前轮次大概率在做无意义的重复探索。此时直接丢弃当前轮次生成,在同一状态下强制重新采样 (Re-generate)。
- 将一轮对话内所有的 Token 不确定性聚合为 Turn 级信号
策略更新优化
- RFT 冷启动:使用拒绝采样微调(Rejective Fine-tuning)对模型进行冷启动,剔除畸形动作。
- 内存上下文窗口:只截取最近
轮的历史,缓解长文本带来的内存压力。 - 混合优势估计:结合全局轨迹层面的优势和单步级别的相对优势 (Group-in-Group) 来计算 RL 损失。
实验设置
✍️实验设置
基础模型
- Qwen3-4B / Qwen3-8B (经过 RFT 拒绝微调冷启动)
评测基准
- WebShop (网页购物代理)
- ALFWorld (具身决策代理)
- Search QA (多跳搜索问答,如 HotpotQA, MuSiQue 等)
对比基线
- 闭源模型:GPT-4o, Claude 4, Gemini-2.5-Pro
- RL基线:PPO, GRPO, GiGPO, GiGPO+DAPO
超参设置
- 训练硬件:8张 NVIDIA H100 GPU,基于
verl框架。 - 采用组优势估计 (Rollout group size = 8)。
- 融入格式惩罚 (Format Penalty=0.1) 防止动作格式崩坏。
关键结果
🍑关键结果
模型效果全面超越基线
- WebShop:基于 Qwen3-4B,T²PO 取得 81.64% 的成功率(GiGPO为73.83%)。基于 Qwen3-8B 取得 82.42% 成功率。
- ALFWorld:基于 Qwen3-4B,T²PO 取得 90.23% 成功率(GiGPO为80.47%),显著降低了不同随机种子下的方差。
- Search QA:在极具挑战的 MuSiQue 数据集上,T²PO 的性能几乎翻倍。
探索效率大幅提升
- 避免崩溃:基线方法在训练中后期容易因过度思考导致环境截断,出现训练崩溃;T²PO 则保持单调上升的稳定表现。
- Token与Turn更节省:成功轨迹中,T²PO 生成的 Token 数量显著少于 SOTA 基线(自动截断废话),且完成相同任务所需的交互轮数(Turns)更少。
消融实验证明机制必要性
- 移除 TTI(Token级截断)或 TDS(Turn级重采样)均会导致成功率大幅下降(约 8-18 个点)。
- 相比其他启发式截断方法(如硬编码最大长度限制、对长文本给予惩罚 Reward 等),自适应的 T²PO 效果碾压。
未来方向
⛳ 未来方向
研究与应用潜力
- 通用化与扩展性:通过识别“低效探索”并利用自监督的不确定性信号进行控制,该研究为 Agentic RL 提供了一个无需依赖外部人工 Reward 塑形的稳定训练框架。
- 更复杂的开放世界:未来的工作可以期望将该方法部署在更复杂的、需要极长视野决策的开放世界应用(如软件工程 Agent、复杂的系统操作等),进一步探索 LLM Agent 的大规模和可复现 RL 训练。
(2507) Agentic Reinforced Policy Optimization (人大 & 快手)
🌺 论文摘要
参考链接
核心方法
ARPO框架 (Agentic Reinforced Policy Optimization)- 针对训练多轮工具交互的LLM Agent,提出了一种结合全局采样与步骤级局部采样的强化学习算法。
核心机制:基于熵的自适应Rollout (Entropy-based Adaptive Rollout)+优势归因估计 (Advantage Attribution Estimation)。
训练数据
SFT阶段:Tool-Star 54K 开源数据集 + 少量扩充数据。RL阶段:规模极小,如深度搜索 (Deep Search) 任务仅使用了1K混合的困难搜索样本。
模型效果
- 在13个极具挑战性的基准测试 (如AIME, MATH500, GAIA, HLE) 上全面超越 GRPO、DAPO 等传统的轨迹级RL算法。
- 仅用1K数据训练的
Qwen3-14B,在 GAIA 达到43.7%,在 HLE 达到10.0%。
重要结论
- LLM在调用外部工具后往往会表现出极高的不确定性 (Token熵激增)。
- 基于熵动态触发分支探索,比单纯依赖 Prompt 工程或全局轨迹级 RL 更能激发 LLM 潜在的工具使用行为。
ARPO仅需现有方法一半的工具调用预算,大幅降低了训练成本。
关键贡献
- 揭示了多轮交互中的Token熵变化规律,并以此提出了兼顾探索多样性与训练效率的Agentic RL算法,同时提供了严谨的
广义策略梯度 (GPG) 定理理论证明。
问题背景
❓问题背景
轨迹级 RL 无法适配多轮交互
当前 RLVR 在 Agent 训练中的局限性
- 当前用于提升LLM推理能力的RL方法 (如 GRPO, DAPO) 大多是
轨迹级算法 (Trajectory-level)。 - 它们通过预定义的特殊 Token 独立采样完整的推理轨迹,并基于最终答案给予奖励。
缺点:完全忽略了 LLM 与外部工具环境之间多轮、实时的交互循环,容易导致工具滥用和稀疏奖励问题。
发现:Token 熵在工具调用后突增
- 作者通过先导实验测量了搜索 Agent 的 Token 生成熵:LLM 在收到每一轮工具返回的结果后,最初生成的 Token 会出现
极高的熵 (高不确定性)。 High Entropy - 这种外部反馈引入的不确定性,往往隐藏着 LLM 尚未被充分探索的潜在工具行为。传统的轨迹级 RL 过于强调完整 Rollout 的最终比对,从而错失了在这些关键的“步骤级 (Step-level)”探索多样化行为的绝佳机会。
ARPO 核心方法
📕核心方法
核心思想
核心思想
自适应分支采样:打破单纯的一镜到底 (Trajectory-level),在推理路径的不确定性节点上进行多路探索。- 核心包括两大模块:利用实时熵变化决定是否展开局部采样,以及利用优势归因估计精细化奖励更新策略。
理论支撑 (GPG 定理)
- 作者提出了
广义策略梯度定理 (Generalized Policy Gradient Theorem),证明了对于任何可微的 Transformer 策略,完全可以基于任意长度的“宏动作 (Macro actions)” (例如依据特殊Token切分的片段) 来进行有效的策略优化。 GPG Theorem
1. 基于熵的自适应 Rollout (Entropy-based Adaptive Rollout)
工作原理
全局初始化:对于输入的请求,LLM 先进行 次全局采样,并记录生成初始 Token 时的基础熵分布。 实时监控:每次调用工具并拿到返回结果后,监控后续生成 Token 的熵变化量。 自适应分支:定义一个随熵变化而变动的局部采样概率。当 超过阈值时,触发模型从当前节点开始额外分支采样 (Branching) 条推理路径;否则只顺着当前路径继续走。 Adaptive Rollout
优点
- 极大扩展了高不确定性区域的采样空间,同时避免了在简单路段浪费计算资源,将单次 Rollout 的计算复杂度从
降低到 与 之间。
2. 优势归因估计 (Advantage Attribution Estimation)
挑战
- 由于自适应 Rollout 机制,现在收集到的轨迹是一棵“树”,包含
共享的前缀部分 (Shared)和独立的分支部分 (Individual)。统一给一条路径上的所有 Token 分配相同的优势值是不公平的。
解决方案
硬优势估计 (Hard Estimation):显式区分,为分叉前共享的 Token 分配多条下游路径的“平均优势”,为分叉后的独立 Token 分配“个体优势”。软优势估计 (Soft Estimation, 默认):优雅地利用了 GRPO 损失函数中的重要性采样比 (Importance sampling ratio)。因为在分支前,多条轨迹的前缀 Token 是完全相同的,所以它们在 GRPO 更新中天生就会被隐式对齐并起到类似平均优势的效果。 - 实验表明,
Soft 设定在训练过程中能获得更高且更稳定的奖励回报。 Soft Setting
实验设置
✍️实验设置
基础模型
- 涵盖指令微调后的 Llama 3.1 (8B)、Qwen 2.5 (3B/7B) 以及 Qwen 3 (8B/14B)。
训练任务 / 数据
- 冷启动SFT:Tool-Star (54K) + CORT数学增强 (0.8K)
- RL阶段:深度推理用 10K RL 样本;深度搜索任务 (长上下文) 仅仅使用了 1K 样本。
评测基准
- 13 个主流 Benchmark:涵盖数学推理 (AIME, MATH500 等)、多跳知识推理 (HotpotQA 等) 和 高难度深度搜索 (GAIA, Humanity's Last Exam 等)。
算法/策略
- 奖励设定结合了格式奖励、正确性奖励以及多工具协同奖励 (例如同时正确使用
<search>和<python>工具给额外加分)。
超参
- Global Batch Size: 128;PPO Mini-batch: 16;全局 Rollout size: 16。
- DeepSearch 训练限制响应长度到 8192 Tokens,使用最高 16 张 H800 并行训练。
关键结果
🍑关键结果
模型效果
- 在 10 个数学与知识推理数据集上,ARPO 的平均准确率全面超越 GRPO、DAPO 等轨迹级强化学习算法 (平均提升 4%)。
- 在极限挑战的深度搜索任务中,采用 ARPO 训练后的
Qwen3-14B模型在 GAIA 上达到43.7%,在 HLE 上达到10.0%的极佳表现,显著超越同等规模模型。
重要结论
Prompt 工程上限极低:纯靠提示词 (TIR Prompting) 不仅难以引导 LLM 学好工具,甚至可能破坏基础的推理能力。工具预算极其高效:得益于在关键不确定性节点的精确分支,ARPO 仅使用现有方法一半的工具调用开销,就能取得更好的整体准确率。 Tool Efficiency搜索器 (Browser Agent) 规模呈正相关:在深度搜索中,单纯依赖摘要片段 (Snippet) 不行,必须有内容抓取能力;且辅助浏览的 Agent 模型参数越大,最终准确率上限越高。
总结与未来方向
⛳ 总结与未来方向
总结
- 填补了现有 RL 算法在
长视野多轮工具 Agent上的理论和工程空白。 - 创新地将“生成不确定性 (熵)”作为探索信号,引导模型智能地在交互关键节点进行分支试错。
未来可探索方向
- 进一步扩展更复杂的工具环境,让 Agent 在面对更多异构工具时自适应分配算力。
- 探索解决长轨迹下的信用分配 (Credit Assignment) 问题,目前虽然利用了 GRPO 和片段化策略优化,但在极端长度的任务中依旧存在挑战。
(2502) Leave-One-Out PPO
🌺 论文摘要
参考链接
核心方法
LOOP:留一法算优势+去掉std+PPO Off-Policy+PPO Clip+Token级建模AppWorld 训练数据筛选:去掉难度3场景、再去掉6场景
模型效果(Qwen2.5-32B-Inst, AppWorld)
TestNormal:TGC 达71.3分,SGC 达53.6分。- TestChallenge:TGC 达45.7分,SGC达 26.6分。
整体均超过其他方法。
重要结论
per-token>per-turn>per-traj,71.3> 64.1 >53.3组内std归一化会降低9pt:71.3 -> 61.9移除KL惩罚有效果:Test-C TGC 从 22.4 -> 26.6Loop 优于 GRPO:71.3>58。LOOP 非归一化 优于 GRPO 归一化 ?Loop 优于 PPO:71.3>50.8。Critic 不好训,易引入误差- 出现一些涌现行为。
关键贡献
- AppWorld SOTA
- 详细的
各方法对比实验
问题背景
❓问题背景
LLM Agent真实任务效果不行
LLM Agent处理真实任务效果不行
- AppWorld
- 单任务:agent和
python环境可能交互40轮、32k长度。 - 特点:
stateful、多领域、多app、环境API交互- 跨应用、长序列规划、动态适应、上下文长。
- 单任务:agent和
现有模型效果不好- 开源Qwen2.5仅40%,GPT4o 仅50%成功率。
RLOO 缺点
同策略算法,样本效率低。Trajetory-Level 建模,但Token-Level 通常更稳定一些。
基础RL算法概览及其问题
RL建模:llm token-level MDP
1. REINFORCE算法
参考笔记:REINFORCE、REINFORC++算法、优势AC算法
策略梯度,优势决定更新方向。优势大于0,鼓励;优势小于0,抑制。
2. RLOO 算法
参考笔记:RLOO
REINFORCE+留一法计算优势,无需Critic和Ref模型。
3. 本文LOOP 算法
RLOO+异策略,具体引入PPO信任域,提升样本效率。
4. GRPO 算法
5. PPO 算法
6. 其他非RL
- 迭代iSFT,通过
不断筛选好样本,来微调模型。
PPO序列和Token两种建模Loss计算
PPO 建模方式
Per-轨迹:把整个序列看成1个动作,计算1个总的重要性权重。GSPO 序列级IS权重Per-Token:把每个词看成1个动作,为每个词单独计算重要性权重。更稳定、平滑。
PPO Loss 计算方式
Seq-Level-Loss:PPO Seq-level-Loss, GSPO Seq-Level-Loss
Token-Level-Loss:DAPO Token-Level-Loss
PPO CLIP 粒度
per-trajectory:
1条轨迹计算1个IS权重。- 缺点:非常不稳定。
per-turn:为
每个回合计算1个IS权重。- 优点:
per-token:为
每个token单独计算1个IS权重。- 优点:最精细。
AppWorld 场景
- 相关:text-games(2015,2023), webshop(2022), 导航(2022), 手机控制(2024)
- WebShop:
- Yao(2022):REINFORCE + 可学习baseline
- ArCHer(2024):结合off-policy + on-policy 训练
- AgentQ(2024):DPO + Tree搜索
- 场景:
买东西,1个app,8个动作,每回合最多1个参数
场景和任务
多样化复杂逻辑:邮件、支付、音乐、购物、打电话、文件系统等。9个真实app,457个API调用,单API最多17个参数。250个场景,每个场景有3个任务,总计750个任务。- 任务难度分
1-3档。
训练评测数据量
训练:
35场景,105个任务。Level 1-2-3:36,36,18Dev:
20场景,60任务。Level 1-2-3:30,24,3- Level1-36条,Level2-36条,Level3-18条
Test-Normal:
56场景,168任务。Level 1-2-3:57,48,63Test-Challenge:
139场景,417任务。复杂、新APP。Level 1-2-3:72,150,195
评测维度
- 每个任务有
1套单元测试,3个维度事情已完成:任务所要求的环境状态成功执行无副作用:没有对环境或APP造成额外的修改答案正确:agent最终答案和标准答案一致
评估指标
- TGC:Task-Goal-Completion,
任务目标完成率 - SGC:Scenario-Goal-Completion,
场景目标完成率- 1场景有3任务,
3个任务全部完成,才算场景完成。
- 1场景有3任务,
部分可观测马尔可夫决策过程
状态
初始隐藏状态:Python REPL状态、模拟数据库等,
智能体看不见,上下文:
user prompt所有token序列:
大模型生成token+环境返回token,是agent可观察的历史信息。
动作
- Agent生成下一个token
状态转移
- 状态追加
LLM生成token+ 环境返回token
轨迹概率
- Token 概率乘积
- 指示函数I:轨迹和初始状态一致,则为1;否则为0。
优化目标
- 最大化累积期望奖励
Leave-One-Out PPO 算法
📕核心方法
PPO Off-Policy 提高样本效率
多轮次训练- Rollout数据使用
ppo_epochs轮,训练多轮。 - 使用
重要性权重来做分布修正。 - 如果
ppo_epochs=1,则LOOP退化成RLOO。
- Rollout数据使用
小批量学习- train_batch分成
多个mini-batch,进行多次梯度更新。
- train_batch分成
PPO Clip 保证更新稳定
PPO-Clip限制更新策略幅度保证稳定
标准差
- 在
不稳定的任务上,标准差大 除以标准差,会削弱或抑制那些偶然成功的高奖励学习信号。
差异
- GRPO:
除以标准差。 - LOOP:
不除以标准差。
LOOP 实验
- LOOP实验
不除以标准差好,能更有效地从不稳定的、探索性的行为中学习。
相关算法
- Dr.GRPO:
不除以标准差,避免难度偏差。 - REINFORCE++、LitePPO:
Global std

实验设置
✍️实验设置
奖励函数
- [0, 1],
单元测试通过比例。no sparse
训练数据
- 从原始Train中,
筛选出24场景,共72任务。 - 筛选逻辑
先去掉难度3场景,只用难度1和2(35 -> 30)。- 使用难度3会降低性能。
- 再
去掉6个场景:30 -> 24。
其他超参
- 最大轮次:
训练40轮,测试50轮。 - Rollout:6次。
- Batch:
40个任务、每次学习40*6=240条序列 - 固定学习率:5e-5
- Prompt:ReACT Prompt
- 长度:LLM单次
1500 token;环境单次:3000 token。 训练50epoch,取最好的checkpoint。
基础模型
- Qwen2.5-32B
训练任务/数据
- AppWorld
筛选后的训练数据:24个场景,共72个任务。
评测任务/数据
- AppWorld
Test-normal,Test-Challenge
算法/策略
LOOP,LORA训练
超参
- 2*8H100,训练42小时。
- 其他超参见上文
关键结果(Qwen2.5-32B-Instruct)
🍑关键结果
模型效果(Qwen2.5-32B-Inst, AppWorld)
TestNormal:TGC 达71.3分,SGC 达53.6分。- TestChallenge:TGC 达45.7分,SGC达 26.6分。
- 整体均超过其他方法。
重要结论
per-token>per-turn>per-traj,71.3> 64.1 >53.3组内std归一化会降低9pt:71.3 -> 61.9移除KL惩罚有效果:Test-C TGC 从 22.4 -> 26.6Loop 优于 GRPO:71.3>58。LOOP 非归一化 优于 GRPO 归一化 ?Loop 优于 PPO:71.3>50.8。Critic 不好训,易引入误差- 出现一些涌现行为。
关键贡献
- SOTA
- 从
莽撞到谨慎:不必要代码执行减少6倍,避免了次优loop - 从
想当然到查文档:调用特定APP接口时,API文档查询增加60% - 从
瞎猜到求证:毫无根据的假设减少了30倍,虚构密码等重要位置减少了6倍 - 从
脆弱到坚韧:失败后放弃次数减少3倍


未来方向
⛳未来方向
性能还不够好,提升成功率。目前仅70%完成。- 环境太理想化,
需提升真实复杂情况。- 不确定性、暂时性故障、模棱两可的任务、对抗性场景、与用户主动交互、与真人其他agent交互等等。
多模态能力:看懂网页截图、图表等。