前段时间看的skill、OPD、信用分配论文
skill相关
| Time | Method | Venue | 简介 |
|---|---|---|---|
| 26.4 | SKILL0 | https://arxiv.org/abs/2604.02268 | 将技能内化到模型参数中。采用渐进式移除技能上下文的动态课程训练,结合技能分类与精简可视化内容教学模型完成任务。 |
| 26.2 | SkillRL | https://arxiv.org/abs/2602.08234 | 技能提炼:从任务成功 / 失败轨迹中,浓缩为精简可复用的技能与避坑要点,实现高效信息压缩。分层技能库:构建通用技能(跨任务通用)+ 专属技能(任务特定)的分层库,支持快速检索复用。递归进化:先冷启动训练掌握技能用法,再通过强化学习迭代优化;基于失败案例动态更新技能库,形成能力与技能协同进化的闭环。 |
| 26.5 | SkillOpt | https://arxiv.org/abs/2605.23904 | 冻结目标模型、仅优化skill。由独立模型依据任务轨迹生成结构化增删改编辑,通过文本学习率约束单次更新幅度、验证门控筛选有效修改、拒绝缓冲区复用负反馈、周期慢更新沉淀长期经验 |
| 26.5 | SKILLC | https://arxiv.org/abs/2605.27899 | 同步采样成对的技能注入 / 无技能轨迹;保留全局排序的同时向无技能成功加分,实现信用重分配;并基于验证级平滑对比信号驱动自适应课程,动态调节归因强度、轨迹分配与活跃技能剪枝 |
opd相关
| Time | Method | Venue | 简介 |
|---|---|---|---|
| 26.1 | OPSD | https://arxiv.org/abs/2601.18734 | 同一大模型分饰师生两角色:学生仅看题生成答案,教师基于标准答案逐 token 给出分布监督,最小化两者分布差异 |
| 26.4 | Rethinking OPD | https://arxiv.org/abs/2604.13016 | 师生思维逻辑必须匹配(思考模式一致);高分≠能带新知识,老师必须具备学生没有的独有能力;师生思路不匹配、OPD 训练崩:离线预热冷启动(Off-policy cold start,SFT+OPD 两段式训练)、对齐老师专属提示词(Teacher-aligned prompt 筛选) |
信用分配
| Time | Method | Venue | 简介 |
|---|---|---|---|
| 26.4 | HiLL | https://arxiv.org/abs/2604.00698 | 提示器依据题目、解题器错误轨迹与标准答案,在线生成自适应提示;引入提示依赖度量化正确轨迹对提示的依赖程度,推导迁移性边界,设计迁移加权奖励,引导提示生成兼顾信号有效性与无提示场景迁移性。 |
| 26.5 | CARL | https://arxiv.org/abs/2605.27788 | 把一次工具使用轨迹切成 invoke / assimilate / commit 三类片段,在这些自然边界上训练 critic,估计“当前上下文下模型自己成功答题的概率”,再用相邻边界的价值差给每个片段分配奖励或惩罚。 |
| 26.4 | StepPO | https://arxiv.org/abs/2604.18401 | 一轮完整交互 = 1 个决策单元;按步骤分配奖惩(Step 级 GAE),哪个步骤做得好就给哪步加分、步骤拉胯就扣分,之后再把本步收益分摊到这一步生成的所有文字;步骤级损失计算,用几何平均归一化整步权重,长短动作训练更稳定。配套工程框架 Agent-R1:保证训练时文字编码和推理一致,避免文字转译错乱;Claw-R1:统一各种第三方 Agent 的数据格式,异步收集多源交互数据,节约算力。 |
| 25.9 | NGRPO | https://arxiv.org/abs/2509.18851 | 全组全做错,靠虚拟满分制造差距,强制让错题产生学习信号,把批量翻车的错题变成训练素材,倒逼 AI 探索新思路解题。 |
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 姜将的个人博客!
