Time Method Venue 简介
26.1 paper agentic rl综述
link tongyi deepreserrch的一系列论文
26.1 ASTRA paper code data 贝壳基于qwen3训练的agent
26.3 AgentIR paper 把agent的推理过程作为检索词增强
26.3 Memex(RL) paper 长期记忆设计,从“有损压缩”范式转向“无损索引+精确检索”范式
25.1 SHARSA NeurIPS 2025 paper 缩短决策视野让rl可以scaling,如何缩减:把长路径“折叠”成短路径在价值学习层面,可以使用 N步回报(n-step returns) 等技术,跳过一步一步的 TD 误差累积。在策略学习层面,可以引入层次化(Hierarchical)机制,将长远目标分解为一个个近期的短视目标。
25.9 AgentGym-RL ICLR 2026 paper 开源框架AgentGym-RL先学习处理短视野(Short-horizon)的简单任务(比如先学会打开网页)。当模型在短任务上表现稳定后,再逐步增加交互的步数和任务的复杂性。
26.3 MC-SEARCH ICLR 2026 paper 针对 Agentic MM-RAG 的、具有长步骤注释和结构化推理链的基准测试,引入了过程级(Process-level)指标, 评估每一步检索信息的准确性、有没有偏离正确的推理轨道;可以作为训练数据
26.2 ContextRL paper 将完整的标准参考解答作为上下文提供给奖励模型,进行细粒度的步骤验证,识别并过滤掉那些“答案碰巧正确但推理过程低劣”的假阳性样本,遏制“奖励欺骗”。引入了一种多轮交互采样策略。当模型在某道题上的尝试全部失败时,奖励模型不仅给出低分,还会针对失败的尝试生成错误报告。
26.2 DART paper code(?) 将思考和工具调用的参数更新解耦,分别用两个独立的lora优化,推理时动态调用两个lora层
26.3 OpenClaw-RL paper 利用用户回复或环境反馈等实时的“下一状态信号”来在线训练,通过过程奖励模型(PRM)将评估性信号转化为标量奖励,将指令性文本转化为词元级的方向性监督:用一个裁判模型(Judge)对当前的反馈进行浓缩,提取出提示(Hint),让当前的 AI看着那个带有提示的强化版提示词重新生成刚刚回答,将“老师(看了 Hint 的模型)”对每个词的预测概率,减去“学生(没看 Hint 的模型)”对每个词的预测概率,得出一个词元级优势值
25.4 ToolRL paper 奖励函数设计:格式奖励,工具名、参数键、参数值,工具选择不完全相同时给予部分奖励;初期注重格式奖励,后期缓慢降低格式奖励,长度奖励的期望长度也随训练调整,后期鼓励更长;给了长度奖励有害的结论
25.12 MoRAgent ICML 2025 paper code 把智能体能力拆成“推理者、执行者、总结者”三种角色,并分别用专门化 LoRA 模块学习
26.4 HiLL paper 加入提示解决RL训练奖励稀疏的工作之一
26.4 OPD paper 在线蒸馏的一些介绍
26.4 SAT ACL 2026 paper 将推理过程构建为有限状态机(FSM),设置慢速、常规、快速、跳过四种差异化思考模式。模型依托轻量化过程奖励模型(PRM)动态切换运行状态,对简单推理步骤进行压缩简化,同时为复杂难点步骤保留完整推理深度。
25.9 AgentFlux paper
25.12 AutoTool openreview Agent 不直接输出工具名字文本,输出向量,用这个向量去外部工具库里做距离检索。被ICLR26拒稿
SPaRK paper
AReaL paper
AgentFlow paper