skill相关

Time Method Venue 简介
26.4 SKILL0 https://arxiv.org/abs/2604.02268 将技能内化到模型参数中。采用渐进式移除技能上下文的动态课程训练,结合技能分类与精简可视化内容教学模型完成任务。
26.2 SkillRL https://arxiv.org/abs/2602.08234 技能提炼:从任务成功 / 失败轨迹中,浓缩为精简可复用的技能与避坑要点,实现高效信息压缩。分层技能库:构建通用技能(跨任务通用)+ 专属技能(任务特定)的分层库,支持快速检索复用。递归进化:先冷启动训练掌握技能用法,再通过强化学习迭代优化;基于失败案例动态更新技能库,形成能力与技能协同进化的闭环。
26.5 SkillOpt https://arxiv.org/abs/2605.23904 冻结目标模型、仅优化skill。由独立模型依据任务轨迹生成结构化增删改编辑,通过文本学习率约束单次更新幅度、验证门控筛选有效修改、拒绝缓冲区复用负反馈、周期慢更新沉淀长期经验
26.5 SKILLC https://arxiv.org/abs/2605.27899 同步采样成对的技能注入 / 无技能轨迹;保留全局排序的同时向无技能成功加分,实现信用重分配;并基于验证级平滑对比信号驱动自适应课程,动态调节归因强度、轨迹分配与活跃技能剪枝

opd相关

Time Method Venue 简介
26.1 OPSD https://arxiv.org/abs/2601.18734 同一大模型分饰师生两角色:学生仅看题生成答案,教师基于标准答案逐 token 给出分布监督,最小化两者分布差异
26.4 Rethinking OPD https://arxiv.org/abs/2604.13016 师生思维逻辑必须匹配(思考模式一致);高分≠能带新知识,老师必须具备学生没有的独有能力;师生思路不匹配、OPD 训练崩:离线预热冷启动(Off-policy cold start,SFT+OPD 两段式训练)、对齐老师专属提示词(Teacher-aligned prompt 筛选)

信用分配

Time Method Venue 简介
26.4 HiLL https://arxiv.org/abs/2604.00698 提示器依据题目、解题器错误轨迹与标准答案,在线生成自适应提示;引入提示依赖度量化正确轨迹对提示的依赖程度,推导迁移性边界,设计迁移加权奖励,引导提示生成兼顾信号有效性与无提示场景迁移性。
26.5 CARL https://arxiv.org/abs/2605.27788 把一次工具使用轨迹切成 invoke / assimilate / commit 三类片段,在这些自然边界上训练 critic,估计“当前上下文下模型自己成功答题的概率”,再用相邻边界的价值差给每个片段分配奖励或惩罚。
26.4 StepPO https://arxiv.org/abs/2604.18401 一轮完整交互 = 1 个决策单元;按步骤分配奖惩(Step 级 GAE),哪个步骤做得好就给哪步加分、步骤拉胯就扣分,之后再把本步收益分摊到这一步生成的所有文字;步骤级损失计算,用几何平均归一化整步权重,长短动作训练更稳定。配套工程框架 Agent-R1:保证训练时文字编码和推理一致,避免文字转译错乱;Claw-R1:统一各种第三方 Agent 的数据格式,异步收集多源交互数据,节约算力。
25.9 NGRPO https://arxiv.org/abs/2509.18851 全组全做错,靠虚拟满分制造差距,强制让错题产生学习信号,把批量翻车的错题变成训练素材,倒逼 AI 探索新思路解题。