前段时间看的Agentic RL论文
| Time | Method | Venue | 简介 |
|---|---|---|---|
| 26.1 | paper | agentic rl综述 | |
| link | tongyi deepreserrch的一系列论文 | ||
| 26.1 | ASTRA | paper code data | 贝壳基于qwen3训练的agent |
| 26.3 | AgentIR | paper | 把agent的推理过程作为检索词增强 |
| 26.3 | Memex(RL) | paper | 长期记忆设计,从“有损压缩”范式转向“无损索引+精确检索”范式 |
| 25.1 | SHARSA | NeurIPS 2025 paper | 缩短决策视野让rl可以scaling,如何缩减:把长路径“折叠”成短路径在价值学习层面,可以使用 N步回报(n-step returns) 等技术,跳过一步一步的 TD 误差累积。在策略学习层面,可以引入层次化(Hierarchical)机制,将长远目标分解为一个个近期的短视目标。 |
| 25.9 | AgentGym-RL | ICLR 2026 paper | 开源框架AgentGym-RL;先学习处理短视野(Short-horizon)的简单任务(比如先学会打开网页)。当模型在短任务上表现稳定后,再逐步增加交互的步数和任务的复杂性。 |
| 26.3 | MC-SEARCH | ICLR 2026 paper | 针对 Agentic MM-RAG 的、具有长步骤注释和结构化推理链的基准测试,引入了过程级(Process-level)指标, 评估每一步检索信息的准确性、有没有偏离正确的推理轨道;可以作为训练数据 |
| 26.2 | ContextRL | paper | 将完整的标准参考解答作为上下文提供给奖励模型,进行细粒度的步骤验证,识别并过滤掉那些“答案碰巧正确但推理过程低劣”的假阳性样本,遏制“奖励欺骗”。引入了一种多轮交互采样策略。当模型在某道题上的尝试全部失败时,奖励模型不仅给出低分,还会针对失败的尝试生成错误报告。 |
| 26.2 | DART | paper code(?) | 将思考和工具调用的参数更新解耦,分别用两个独立的lora优化,推理时动态调用两个lora层 |
| 26.3 | OpenClaw-RL | paper | 利用用户回复或环境反馈等实时的“下一状态信号”来在线训练,通过过程奖励模型(PRM)将评估性信号转化为标量奖励,将指令性文本转化为词元级的方向性监督:用一个裁判模型(Judge)对当前的反馈进行浓缩,提取出提示(Hint),让当前的 AI看着那个带有提示的强化版提示词重新生成刚刚回答,将“老师(看了 Hint 的模型)”对每个词的预测概率,减去“学生(没看 Hint 的模型)”对每个词的预测概率,得出一个词元级优势值 |
| 25.4 | ToolRL | paper | 奖励函数设计:格式奖励,工具名、参数键、参数值,工具选择不完全相同时给予部分奖励;初期注重格式奖励,后期缓慢降低格式奖励,长度奖励的期望长度也随训练调整,后期鼓励更长;给了长度奖励有害的结论 |
| 25.12 | MoRAgent | ICML 2025 paper code | 把智能体能力拆成“推理者、执行者、总结者”三种角色,并分别用专门化 LoRA 模块学习 |
| 26.4 | HiLL | paper | 加入提示解决RL训练奖励稀疏的工作之一 |
| 26.4 | OPD | paper | 在线蒸馏的一些介绍 |
| 26.4 | SAT | ACL 2026 paper | 将推理过程构建为有限状态机(FSM),设置慢速、常规、快速、跳过四种差异化思考模式。模型依托轻量化过程奖励模型(PRM)动态切换运行状态,对简单推理步骤进行压缩简化,同时为复杂难点步骤保留完整推理深度。 |
| 25.9 | AgentFlux | paper | |
| 25.12 | AutoTool | openreview | Agent 不直接输出工具名字文本,输出向量,用这个向量去外部工具库里做距离检索。被ICLR26拒稿 |
| SPaRK | paper | ||
| AReaL | paper | ||
| AgentFlow | paper |
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 姜将的个人博客!
