Skip to content

Agent-RL 相关算法

📅 发表于 2025/11/17
🔄 更新于 2026/08/05
👁️ — 次访问
📝 5554 字
17 分钟
agentrl
#agentrl
#LOOP

(2605) T²PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic RL (SOTA, UCLA & Amazon)

🌺 论文摘要

T²PO 摘要

参考链接

核心方法

  • T²PO 框架 (Token- and Turn-level Policy Optimization)
    • 针对多轮Agentic RL中的探索效率低下问题,提出基于“不确定性 (Uncertainty)”的细粒度探索控制机制。
  • 双层干预机制
    • Token级别 (TTI):监控推理过程的不确定性变化,当不确定性边际变化低于阈值时,强制截断思考,进入动作输出。
    • Turn级别 (TDS):评估当前轮次的交互是否有显著的探索进展,若进展微小则动态重采样该轮次,避免无效交互。

模型效果(Qwen3-4B/8B)

  • WebShopALFWorldSearch QA 等复杂多轮交互基准上均取得 SOTA 效果。
  • 相比于此前的 SOTA 算法(如 GiGPO),Qwen3-4B 在 ALFWorld 上的成功率提升至 90.23%(+约10个点),WebShop 成功率提升至 81.64%

重要结论

  • 多轮 Agentic RL 的训练崩溃(Training Collapse)主要源于探索效率低下(Hesitation现象):包括Token级别的“过度思考”和Turn级别的“重复无效动作”。
  • 显式地管控低信息量的探索,比单纯的基于奖励塑形(Reward Shaping)或轨迹过滤(Trajectory Filtering)更有效,能显著提升训练稳定性和成功率。

关键贡献

  • 提出了融合“熵(Entropy)”和“置信度(Confidence)”的自校准不确定性信号 (Self-calibrated uncertainty signal)
  • 提出了 TTITDS 机制,在Token和Turn双级别实现了细粒度且自适应的“防犹豫(Anti-hesitation)”干预。

问题背景

问题背景

问题背景

多轮 Agentic RL 的训练不稳定性

  • 现代 LLM Agent 的自我进化依赖多轮强化学习(RL)。
  • 然而,多轮长视野(Long-horizon)交互与稀疏奖励结合,使得信用分配极其困难,极其容易导致训练崩溃(Training Collapse)

传统缓解策略的局限性

  • 以往的方法尝试通过细粒度奖励、内部过程奖励(PRM)、或粗粒度的轨迹过滤来稳定训练。
  • 缺点:这些方法多在粗粒度轨迹级别操作,或者依赖隐式的奖励塑形,对超参极度敏感,依然难以避免训练崩溃。

核心洞察:Hesitation (犹豫现象)

  • 作者发现不稳定的根源在于系统违背了探索与利用的平衡,即无效探索 (Insufficient exploration)
    • Token 级别 (Overthinking):LLM会生成极长的思考链(CoT),但信息增益很快饱和,只剩下不断累积的采样噪声。
    • Turn 级别:LLM 偏离正确轨道后,在多轮交互中不断重复同样的废话或无效操作,白白浪费 rollout 预算。 :::

T²PO 核心方法

📕核心方法

T²PO 核心方法

自校准不确定性信号 (Self-calibrated Uncertainty Signal)

  • 传统的“熵”无法区分几乎均匀和高度尖锐的分布,而“置信度”只看Top-1概率忽略了尾部。
  • 作者将两者归一化后融合:Mt=α(H~t)+(1α)(1C~t)。该信号能更准确地衡量LLM在当前Token生成的内在不确定性和探索状态。

Token级别的思考干预 (TTI, Token-Level Thinking Intervention)

  • 目标:自适应截断冗余的思考链(CoT),防止过度思考。
  • 机制
    • 实时监控 Mt 的变化量 Δtk=|MtkMt1k|
    • 当滑动窗口内的平均变化量低于阈值 ϵ 时,说明LLM的想法已经“收敛”,再思考下去只是徒增噪声。
    • 触发强制干预:覆写Logits,强制输出 </think> 标签,并注入决定性的前缀 \n<action>,直接强迫模型进入动作执行阶段。

Turn级别的动态采样 (TDS, Turn-Level Dynamical Sampling)

  • 目标:避免跨轮次的重复废话和无效交互。
  • 机制
    • 将一轮对话内所有的 Token 不确定性聚合为 Turn 级信号 Φk
    • 监控相邻两轮的差异 Γk=|ΦkΦk1|
    • Γk<η (变化极小),说明当前轮次大概率在做无意义的重复探索。此时直接丢弃当前轮次生成,在同一状态下强制重新采样 (Re-generate)

策略更新优化

  • RFT 冷启动:使用拒绝采样微调(Rejective Fine-tuning)对模型进行冷启动,剔除畸形动作。
  • 内存上下文窗口:只截取最近 P 轮的历史,缓解长文本带来的内存压力。
  • 混合优势估计:结合全局轨迹层面的优势和单步级别的相对优势 (Group-in-Group) 来计算 RL 损失。

实验设置

✍️实验设置

实验设置

基础模型

  • Qwen3-4B / Qwen3-8B (经过 RFT 拒绝微调冷启动)

评测基准

  • WebShop (网页购物代理)
  • ALFWorld (具身决策代理)
  • Search QA (多跳搜索问答,如 HotpotQA, MuSiQue 等)

对比基线

  • 闭源模型:GPT-4o, Claude 4, Gemini-2.5-Pro
  • RL基线:PPO, GRPO, GiGPO, GiGPO+DAPO

超参设置

  • 训练硬件:8张 NVIDIA H100 GPU,基于 verl 框架。
  • 采用组优势估计 (Rollout group size = 8)。
  • 融入格式惩罚 (Format Penalty=0.1) 防止动作格式崩坏。

关键结果

🍑关键结果

关键结果

模型效果全面超越基线

  • WebShop:基于 Qwen3-4B,T²PO 取得 81.64% 的成功率(GiGPO为73.83%)。基于 Qwen3-8B 取得 82.42% 成功率。
  • ALFWorld:基于 Qwen3-4B,T²PO 取得 90.23% 成功率(GiGPO为80.47%),显著降低了不同随机种子下的方差。
  • Search QA:在极具挑战的 MuSiQue 数据集上,T²PO 的性能几乎翻倍。

探索效率大幅提升

  • 避免崩溃:基线方法在训练中后期容易因过度思考导致环境截断,出现训练崩溃;T²PO 则保持单调上升的稳定表现。
  • Token与Turn更节省:成功轨迹中,T²PO 生成的 Token 数量显著少于 SOTA 基线(自动截断废话),且完成相同任务所需的交互轮数(Turns)更少。

消融实验证明机制必要性

  • 移除 TTI(Token级截断)或 TDS(Turn级重采样)均会导致成功率大幅下降(约 8-18 个点)。
  • 相比其他启发式截断方法(如硬编码最大长度限制、对长文本给予惩罚 Reward 等),自适应的 T²PO 效果碾压。

未来方向

未来方向

未来方向

研究与应用潜力

  • 通用化与扩展性:通过识别“低效探索”并利用自监督的不确定性信号进行控制,该研究为 Agentic RL 提供了一个无需依赖外部人工 Reward 塑形的稳定训练框架。
  • 更复杂的开放世界:未来的工作可以期望将该方法部署在更复杂的、需要极长视野决策的开放世界应用(如软件工程 Agent、复杂的系统操作等),进一步探索 LLM Agent 的大规模和可复现 RL 训练。

(2507) Agentic Reinforced Policy Optimization (人大 & 快手)

🌺 论文摘要

ARPO 摘要

参考链接

核心方法

  • ARPO框架 (Agentic Reinforced Policy Optimization)
    • 针对训练多轮工具交互的LLM Agent,提出了一种结合全局采样与步骤级局部采样的强化学习算法。
    • 核心机制基于熵的自适应Rollout (Entropy-based Adaptive Rollout) + 优势归因估计 (Advantage Attribution Estimation)

训练数据

  • SFT阶段:Tool-Star 54K 开源数据集 + 少量扩充数据。
  • RL阶段:规模极小,如深度搜索 (Deep Search) 任务仅使用了 1K 混合的困难搜索样本。

模型效果

  • 在13个极具挑战性的基准测试 (如AIME, MATH500, GAIA, HLE) 上全面超越 GRPO、DAPO 等传统的轨迹级RL算法。
  • 仅用1K数据训练的 Qwen3-14B,在 GAIA 达到 43.7%,在 HLE 达到 10.0%

重要结论

  • LLM在调用外部工具后往往会表现出极高的不确定性 (Token熵激增)。
  • 基于熵动态触发分支探索,比单纯依赖 Prompt 工程或全局轨迹级 RL 更能激发 LLM 潜在的工具使用行为。
  • ARPO 仅需现有方法 一半的工具调用预算,大幅降低了训练成本。

关键贡献

  • 揭示了多轮交互中的Token熵变化规律,并以此提出了兼顾探索多样性与训练效率的Agentic RL算法,同时提供了严谨的广义策略梯度 (GPG) 定理理论证明。

问题背景

问题背景

轨迹级 RL 无法适配多轮交互

问题背景

当前 RLVR 在 Agent 训练中的局限性

  • 当前用于提升LLM推理能力的RL方法 (如 GRPO, DAPO) 大多是轨迹级算法 (Trajectory-level)
  • 它们通过预定义的特殊 Token 独立采样完整的推理轨迹,并基于最终答案给予奖励。
  • 缺点:完全忽略了 LLM 与外部工具环境之间多轮、实时的交互循环,容易导致工具滥用和稀疏奖励问题。

发现:Token 熵在工具调用后突增

  • 作者通过先导实验测量了搜索 Agent 的 Token 生成熵:LLM 在收到每一轮工具返回的结果后,最初生成的 Token 会出现极高的熵 (高不确定性)High Entropy
  • 这种外部反馈引入的不确定性,往往隐藏着 LLM 尚未被充分探索的潜在工具行为。传统的轨迹级 RL 过于强调完整 Rollout 的最终比对,从而错失了在这些关键的“步骤级 (Step-level)”探索多样化行为的绝佳机会。

ARPO 核心方法

📕核心方法

核心思想

Agentic Reinforced Policy Optimization

核心思想

  • 自适应分支采样:打破单纯的一镜到底 (Trajectory-level),在推理路径的不确定性节点上进行多路探索。
  • 核心包括两大模块:利用实时熵变化决定是否展开局部采样,以及利用优势归因估计精细化奖励更新策略。

理论支撑 (GPG 定理)

  • 作者提出了广义策略梯度定理 (Generalized Policy Gradient Theorem),证明了对于任何可微的 Transformer 策略 πθ,完全可以基于任意长度的“宏动作 (Macro actions)” (例如依据特殊Token切分的片段) 来进行有效的策略优化。 GPG Theorem

1. 基于熵的自适应 Rollout (Entropy-based Adaptive Rollout)

熵驱动探索机制

工作原理

  • 全局初始化:对于输入的请求 q,LLM 先进行 N 次全局采样,并记录生成初始 Token 时的基础熵分布。
  • 实时监控:每次调用工具并拿到返回结果后,监控后续生成 Token 的熵变化量 ΔHt
  • 自适应分支:定义一个随熵变化而变动的局部采样概率 Pt。当 Pt 超过阈值时,触发模型从当前节点开始额外分支采样 (Branching) Z 条推理路径;否则只顺着当前路径继续走。 Adaptive Rollout

优点

  • 极大扩展了高不确定性区域的采样空间,同时避免了在简单路段浪费计算资源,将单次 Rollout 的计算复杂度从 O(n2) 降低到 O(nlogn)O(n2) 之间。

2. 优势归因估计 (Advantage Attribution Estimation)

奖励精细化分配

挑战

  • 由于自适应 Rollout 机制,现在收集到的轨迹是一棵“树”,包含共享的前缀部分 (Shared)独立的分支部分 (Individual)。统一给一条路径上的所有 Token 分配相同的优势值是不公平的。

解决方案

  • 硬优势估计 (Hard Estimation):显式区分,为分叉前共享的 Token 分配多条下游路径的“平均优势”,为分叉后的独立 Token 分配“个体优势”。
  • 软优势估计 (Soft Estimation, 默认):优雅地利用了 GRPO 损失函数中的重要性采样比 (Importance sampling ratio) ri,t(θ)。因为在分支前,多条轨迹的前缀 Token 是完全相同的,所以它们在 GRPO 更新中天生就会被隐式对齐并起到类似平均优势的效果。
  • 实验表明,Soft 设定在训练过程中能获得更高且更稳定的奖励回报Soft Setting

实验设置

✍️实验设置

实验设置

基础模型

  • 涵盖指令微调后的 Llama 3.1 (8B)、Qwen 2.5 (3B/7B) 以及 Qwen 3 (8B/14B)。

训练任务 / 数据

  • 冷启动SFT:Tool-Star (54K) + CORT数学增强 (0.8K)
  • RL阶段:深度推理用 10K RL 样本;深度搜索任务 (长上下文) 仅仅使用了 1K 样本

评测基准

  • 13 个主流 Benchmark:涵盖数学推理 (AIME, MATH500 等)、多跳知识推理 (HotpotQA 等) 和 高难度深度搜索 (GAIA, Humanity's Last Exam 等)。

算法/策略

  • 奖励设定结合了格式奖励、正确性奖励以及多工具协同奖励 (例如同时正确使用 <search><python> 工具给额外加分)。

超参

  • Global Batch Size: 128;PPO Mini-batch: 16;全局 Rollout size: 16。
  • DeepSearch 训练限制响应长度到 8192 Tokens,使用最高 16 张 H800 并行训练。

关键结果

🍑关键结果

关键结果

模型效果

  • 在 10 个数学与知识推理数据集上,ARPO 的平均准确率全面超越 GRPO、DAPO 等轨迹级强化学习算法 (平均提升 4%)。
  • 在极限挑战的深度搜索任务中,采用 ARPO 训练后的 Qwen3-14B 模型在 GAIA 上达到 43.7%,在 HLE 上达到 10.0% 的极佳表现,显著超越同等规模模型。

重要结论

  • Prompt 工程上限极低:纯靠提示词 (TIR Prompting) 不仅难以引导 LLM 学好工具,甚至可能破坏基础的推理能力。
  • 工具预算极其高效:得益于在关键不确定性节点的精确分支,ARPO 仅使用现有方法一半的工具调用开销,就能取得更好的整体准确率Tool Efficiency
  • 搜索器 (Browser Agent) 规模呈正相关:在深度搜索中,单纯依赖摘要片段 (Snippet) 不行,必须有内容抓取能力;且辅助浏览的 Agent 模型参数越大,最终准确率上限越高。

总结与未来方向

总结与未来方向

总结与方向

总结

  • 填补了现有 RL 算法在 长视野多轮工具 Agent 上的理论和工程空白。
  • 创新地将“生成不确定性 (熵)”作为探索信号,引导模型智能地在交互关键节点进行分支试错。

未来可探索方向

  • 进一步扩展更复杂的工具环境,让 Agent 在面对更多异构工具时自适应分配算力。
  • 探索解决长轨迹下的信用分配 (Credit Assignment) 问题,目前虽然利用了 GRPO 和片段化策略优化,但在极端长度的任务中依旧存在挑战。

(2502) Leave-One-Out PPO

🌺 论文摘要

LOOP 论文摘要

参考链接

核心方法

  • LOOP: 留一法算优势 + 去掉std + PPO Off-Policy + PPO Clip + Token级建模
  • AppWorld 训练数据筛选去掉难度3场景再去掉6场景

模型效果(Qwen2.5-32B-Inst, AppWorld)

  • TestNormal:TGC 达71.3分,SGC 达53.6分
  • TestChallenge:TGC 达45.7分,SGC达 26.6分。
  • 整体超过其他方法

重要结论

  • per-token > per-turn > per-traj71.3 > 64.1 > 53.3
  • 组内std归一化降低9pt:71.3 -> 61.9
  • 移除KL惩罚有效果:Test-C TGC 从 22.4 -> 26.6
  • Loop 优于 GRPO71.3 > 58。LOOP 非归一化 优于 GRPO 归一化 ?
  • Loop 优于 PPO71.3 > 50.8。Critic 不好训,易引入误差
  • 出现一些涌现行为。

关键贡献

  • AppWorld SOTA
  • 详细的各方法对比实验

问题背景

❓问题背景

LLM Agent真实任务效果不行

Agent真实效果不行 + RLOO存在缺点

LLM Agent处理真实任务效果不行

  • AppWorld
    • 单任务:agent和python环境可能交互40轮32k长度
    • 特点:
      • stateful多领域多app环境API交互
      • 跨应用、长序列规划、动态适应、上下文长。
  • 现有模型效果不好
    • 开源Qwen2.5仅40%,GPT4o 仅50%成功率。

RLOO 缺点

  • 同策略算法样本效率低
  • Trajetory-Level 建模,但Token-Level 通常更稳定一些。

基础RL算法概览及其问题

RL建模llm token-level MDP

主流RL算法

1. REINFORCE算法

2. RLOO 算法

  • 参考笔记:RLOO

  • REINFORCE+留一法计算优势,无需Critic和Ref模型。

3. 本文LOOP 算法

  • RLOO + 异策略,具体引入PPO信任域,提升样本效率

4. GRPO 算法

5. PPO 算法

  • 参考笔记:PPO, PPO改进系列
  • 标准PPO,复杂有点贵
    • 异策略算法提升样本效率
    • 重要性采样修正权重;
    • Clip信任域 限制更新幅度,保证稳定。

6. 其他非RL

  • 迭代iSFT,通过不断筛选好样本,来微调模型。

PPO序列和Token两种建模Loss计算

PPO建模和Loss计算 (序列+token)

PPO 建模方式

  • Per-轨迹:把整个序列看成1个动作,计算1个总的重要性权重GSPO 序列级IS权重

    θJGSPO(θ)=ExD,{yi}i=1Gπθold(|x)[1Gi=1Gsi(θ)ISA^iθlogsi(θ)]
  • Per-Token:把每个词看成1个动作,为每个词 单独计算重要性权重更稳定、平滑

    θJGRPO(θ)=ExD,{yi}i=1Gπθold(|x)[1Gi=1G1|yi|t=1|yi|πθ(yi,t|x,yi,<t)πθold(yi,t|x,yi,<t)token重要性权重A^i,ttoken优势θlogπθ(yi,t|x,yi,<t)token梯度]

PPO Loss 计算方式

Lppo(θ)=1Gi=1G1|oi|t=1|ot|序列内平均min(πθ(oi,tq,oi,<t)πθold(oi,tq,oi,<t)A^i,t,clip(πθ(oi,tq,oi,<t)πθold(oi,tq,oi,<t),1ϵ,1+ϵ)A^i,t)LDAPO(θ)=1i=1G|oi|i=1Gt=1|ot|所有Token直接做平均min(πθ(oi,tq,oi,<t)πθold(oi,tq,oi,<t)A^i,t,clip(πθ(oi,tq,oi,<t)πθold(oi,tq,oi,<t),1ϵ,1+ϵ)A^i,t)

PPO CLIP 粒度

  • per-trajectory1条轨迹计算1个IS权重

    • 缺点:非常不稳定。
  • per-turn:为每个回合计算1个IS权重

    • 优点:
  • per-token:为每个token单独计算1个IS权重

    • 优点:最精细。

AppWorld 场景

相关场景
  • 相关:text-games(2015,2023), webshop(2022), 导航(2022), 手机控制(2024)
  • WebShop:
    • Yao(2022):REINFORCE + 可学习baseline
    • ArCHer(2024):结合off-policy + on-policy 训练
    • AgentQ(2024):DPO + Tree搜索
    • 场景:买东西1个app8个动作,每回合最多1个参数
AppWorld 场景

场景和任务

  • 多样化复杂逻辑:邮件、支付、音乐、购物、打电话、文件系统等。
  • 9个真实app457个API调用,单API最多17个参数
  • 250个场景每个场景3个任务,总计750个任务
  • 任务难度分1-3档

训练评测数据量

  • 训练35场景105个任务。Level 1-2-3:36, 36, 18

  • Dev20场景60任务。Level 1-2-3:30, 24, 3

    • Level1-36条,Level2-36条,Level3-18条
  • Test-Normal56场景168任务。Level 1-2-3:57, 48, 63

  • Test-Challenge139场景417任务复杂新APP。Level 1-2-3:72, 150, 195

评测维度

  • 每个任务有1套单元测试3个维度
    • 事情已完成:任务所要求的环境状态成功执行
    • 无副作用:没有对环境或APP造成额外的修改
    • 答案正确:agent最终答案和标准答案一致

评估指标

  • TGC:Task-Goal-Completion,任务目标完成率
  • SGC:Scenario-Goal-Completion,场景目标完成率
    • 1场景有3任务,3个任务全部完成,才算场景完成

部分可观测马尔可夫决策过程

POMDP

状态

  • 初始隐藏状态:Python REPL状态、模拟数据库等,智能体看不见

  • 上下文user prompt

  • 所有token序列大模型生成token + 环境返回token,是agent可观察的历史信息。

    [s0,c,x1:t]

动作

  • Agent生成下一个tokenpθ(c,x1:t)

状态转移

  • 状态追加 LLM生成token xt+1 + 环境返回tokenxt+2:t+1+k[s0,c,x1:t][s0,c,x1:t+1+k]

轨迹概率

  • Token 概率乘积
  • 指示函数I:轨迹和初始状态一致,则为1;否则为0。
pθ(xs0,c)=I(s0,c)t=1Tpθ(xtc,x1:t1)

优化目标

  • 最大化累积期望奖励Lθ(s0,c)=Expθ(s0,c)[R(s0,c,x)]

Leave-One-Out PPO 算法

📕核心方法

使用 PPO Off-Policy和Clip策略

PPO Off-Policy 提高样本效率

  • 多轮次训练
    • Rollout数据使用 ppo_epochs轮,训练多轮。
    • 使用重要性权重来做分布修正
    • 如果ppo_epochs=1,则LOOP退化成RLOO
  • 小批量学习
    • train_batch分成多个mini-batch,进行多次梯度更新
ri=πθ(xs0,c)πθold(xs0,c)=t=1Tπθ(xtc,x<t)πθold(xtc,x<t)

PPO Clip 保证更新稳定

  • PPO-Clip 限制更新策略幅度 保证稳定
使用留一法做优势估计
  • 同1个prompt,采样k次,使用其余k-1次的平均值作为基线

  • 参考笔记:RLOO 留一法

    A(x,yi)=R(x,yi)1K1j=1,jiKR(x,yj)A(x,yi)=KK1(R(x,yi)1Kj=1KR(x,yj))
A(x,yi)R(x,yi)mean(R)
LOOP 不除以标准差

标准差

  • 不稳定的任务上,标准差大
  • 除以标准差,会削弱或抑制那些偶然成功的高奖励学习信号

差异

  • GRPO:除以标准差
  • LOOP:不除以标准差

LOOP 实验

  • LOOP实验不除以标准差好,能更有效地从不稳定的、探索性的行为中学习

相关算法

实验设置

✍️实验设置

RL超参

奖励函数

  • [0, 1],单元测试通过比例no sparse

训练数据

  • 从原始Train中,筛选出24场景共72任务。
  • 筛选逻辑
    • 先去掉难度3场景,只用难度1和2(35 -> 30)。
      • 使用难度3会降低性能。
    • 去掉6个场景:30 -> 24。

其他超参

  • 最大轮次:训练40轮测试50轮
  • Rollout:6次。
  • Batch:40个任务、每次学习40*6=240条序列
  • 固定学习率:5e-5
  • Prompt:ReACT Prompt
  • 长度:LLM单次 1500 token;环境单次:3000 token
  • 训练50epoch,取最好的checkpoint。
实验设置

基础模型

  • Qwen2.5-32B

训练任务/数据

  • AppWorld筛选后的训练数据24个场景,共72个任务

评测任务/数据

  • AppWorld Test-normal, Test-Challenge

算法/策略

  • LOOPLORA训练

超参

  • 2*8H100,训练42小时。
  • 其他超参见上文

关键结果(Qwen2.5-32B-Instruct)

🍑关键结果

关键结果

模型效果(Qwen2.5-32B-Inst, AppWorld)

  • TestNormal:TGC 达71.3分,SGC 达53.6分
  • TestChallenge:TGC 达45.7分,SGC达 26.6分。
  • 整体均超过其他方法。

重要结论

  • per-token > per-turn > per-traj71.3 > 64.1 > 53.3
  • 组内std归一化降低9pt:71.3 -> 61.9
  • 移除KL惩罚有效果:Test-C TGC 从 22.4 -> 26.6
  • Loop 优于 GRPO71.3 > 58。LOOP 非归一化 优于 GRPO 归一化 ?
  • Loop 优于 PPO71.3 > 50.8。Critic 不好训,易引入误差
  • 出现一些涌现行为。

关键贡献

  • SOTA
涌现出优秀行为
  • 莽撞到谨慎:不必要代码执行减少6倍,避免了次优loop
  • 想当然到查文档:调用特定APP接口时,API文档查询增加60%
  • 瞎猜到求证:毫无根据的假设减少了30倍,虚构密码等重要位置减少了6倍
  • 脆弱到坚韧:失败后放弃次数减少3倍

未来方向

⛳未来方向

未来方向
  • 性能还不够好,提升成功率。目前仅70%完成。
  • 环境太理想化,需提升真实复杂情况
    • 不确定性、暂时性故障、模棱两可的任务、对抗性场景、与用户主动交互、与真人其他agent交互等等。
  • 多模态能力:看懂网页截图、图表等。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026