多模态大模型梳理
多模态大模型进展梳理多模态大模型相比纯文本大模型,在输入输出上多了对多模态数据的支持。最主流的就是增加了对图像、视频输入的视觉语言模型,视觉语言模型的基础上增加对语音的输入输出支持,则是Omni(全能)模型。但主流的开源Omni模型并非真正的全能,它缺少了对图像视频等视觉数据的输出功能。此外还有相对小众一些的TTS(文本转语音,能力是Omni模型的子集),ASR(自动语音识别)等多模态大模型。本文梳理了主流的开源多模态大模型的技术报告和技术博客中的信息,从主流的Qwen VL系列,到当前的诸多原生多模态大模型,重点关注模型结构和训练流程,并穿插一些自己的启发。
Qwen-VL(2023,基于 Qwen-7B)参考:https://arxiv\.org/abs/2308\.12966
第一代,思路很”经典组合式”,几乎是 BLIP-2 路线的加强版。
结构
视觉编码器:Openclip 的 ViT-bigG(约 1.9B),输入固定分辨率(第一阶段 224,后期 448)。
连接器:一个单层 cross-attention 的 position-aware VL Adapter——用 ...
主流大模型是如何训练agent能力的
主流大模型是如何训练agent能力的本博客只讨论了对于小参数通用agent模型训练可能会有启发的内容。原生多模态,百万上下文(与此相关的大同小异的稀疏注意力),coding agent能力相关内容没有列出。
GLM5.2参考:https://z\.ai/blog/glm\-5\.2
1. 长周期任务 RL:从 group-wise 优化转向 critic-based PPO这一段是最重要的:
RL for Long-Horizon Tasks. For GLM-5.2, long-horizon tasks produce substantially longer execution traces, and once a super-long trajectory is split by compaction into multiple sub-traces, different rollouts under the same prompt yield different numbers of trainable traces with highly variable lengths. ...
前段时间看的skill、OPD、信用分配论文
skill相关
Time
Method
Venue
简介
26.4
SKILL0
https://arxiv.org/abs/2604.02268
将技能内化到模型参数中。采用渐进式移除技能上下文的动态课程训练,结合技能分类与精简可视化内容教学模型完成任务。
26.2
SkillRL
https://arxiv.org/abs/2602.08234
技能提炼:从任务成功 / 失败轨迹中,浓缩为精简可复用的技能与避坑要点,实现高效信息压缩。分层技能库:构建通用技能(跨任务通用)+ 专属技能(任务特定)的分层库,支持快速检索复用。递归进化:先冷启动训练掌握技能用法,再通过强化学习迭代优化;基于失败案例动态更新技能库,形成能力与技能协同进化的闭环。
26.5
SkillOpt
https://arxiv.org/abs/2605.23904
冻结目标模型、仅优化skill。由独立模型依据任务轨迹生成结构化增删改编辑,通过文本学习率约束单次更新幅度、验证门控筛选有效修改、拒绝缓冲区复用负反馈、周期慢更新沉淀长期经验
26.5
SKILLC
https://arxiv ...
前段时间看的Agentic RL论文
Time
Method
Venue
简介
26.1
paper
agentic rl综述
link
tongyi deepreserrch的一系列论文
26.1
ASTRA
paper code data
贝壳基于qwen3训练的agent
26.3
AgentIR
paper
把agent的推理过程作为检索词增强
26.3
Memex(RL)
paper
长期记忆设计,从“有损压缩”范式转向“无损索引+精确检索”范式
25.1
SHARSA
NeurIPS 2025 paper
缩短决策视野让rl可以scaling,如何缩减:把长路径“折叠”成短路径在价值学习层面,可以使用 N步回报(n-step returns) 等技术,跳过一步一步的 TD 误差累积。在策略学习层面,可以引入层次化(Hierarchical)机制,将长远目标分解为一个个近期的短视目标。
25.9
AgentGym-RL
ICLR 2026 paper
开源框架AgentGym-RL;先学习处理短视野(Short-horizon)的简单任务(比如先学会打开 ...
国科大《高级人工智能》复习
大哲学家沈老师上的部分很值得一听,时不时会引起一些思考。
三大学派
符号主义逻辑的基本概念设计通用问题求解器是一个伟大的算法问题
知识表示:把用自然语言表达的基本的数学公理表达为形式化的符号语言知识推理:以形式化语言表述的知识库和查询为输入,需要一个自动化的算法,自动运行以得到最终的答案
什么是所谓“正确的推理”:逻辑蕴含
模型是可以评估的结构化世界
逻辑体系是用于判断结论是否在某一个模型中成立的语言体系
句子 (Sentence) 是由符号按照特定规则构成的表达式,表达的内容为需要被判定真假的信息;语法 (Syntax) 定义了句子的表达结构和规则;
如果有一个句子 α 在模型 m 中为真,则称 m 满足 α,或 m 是 α 的一个模型,并用符号 M(α) 表示所有满足 α 的模型的集合。
逻辑的语义蕴含实质是定义了一组逻辑句子与一个新句子之间的所谓的“正确推理”的关系。此时,这组逻辑句子,我们称为知识库 (Knowledge Base),记作 KB,它是一个包含了多个逻辑句子的集合;这个新的句子,记作 α。那么,KB 与 α 之间的语义蕴含关系定义为:
KB 蕴含句子 α,记为 ...
国科大自动课程评估
由于国科大这个课程评估系统每个课要填的内容很多,主观题还有字数要求,且不评估会一直弹提醒,过一段时间就有一门新课需要评估,所以有必要使用一下快捷的方式。
省流:打开课程评价界面,F12打开开发者工具,在console粘贴以下代码,回车执行。
这种方式比较兼顾效率和安全。
1234567891011121314var tds = document.getElementsByTagName('td'); for(var i = 0; i<tds.length;i+=5) tds[i].getElementsByTagName("input")[0].checked=true;var answers = [ "老师讲的很有意思,结合生活,生动形象", "我认为本课程不需要进一步改进和提高", "我平均每周在这门课程上花费2小时", "在参与这门课之前,我对这个学科领域很感兴趣", ...
《动手学深度学习》部分笔记
李沐老师b站的课程动手学深度学习v2以及书,根据个人情况,选择性地做了一些笔记。
基础权重衰退 正则化(Regularization) 是一种防止模型过拟合(Overfitting) 的核心技术。它的核心思想是通过对模型施加某种约束,限制其复杂度,从而提升在未知数据(测试集) 上的泛化能力。 通常惩罚项是权重参数的L1/L2范数。
对于若某一层的操作是 逐元素操作(例如激活函数 ReLU、Sigmoid),则每个输出元素仅依赖于对应的输入元素。向量对向量的导数是矩阵, 当对向量进行逐元素操作时,求导得到的Jacobian矩阵是对角矩阵。这是因为每个输出元素仅依赖于对应的输入元素,导致非对角线上的偏导数为零。
eval()的作用切换模型模式:将模型及其所有子模块(如Dropout、BatchNorm等)设置为评估模式。
影响特定层的行为:
Dropout层:在训练模式下会随机丢弃神经元,但在评估模式下会关闭丢弃功能,使用全部神经元进行前向传播。
BatchNorm层:在训练时基于当前批次计算均值和方差,而评估时使用训练阶段累积的全局移动平均统计量,确保结果稳定。
卷积
1*1的卷积层 ...
理解transformer网络结构
先看整体结构:
首先是嵌入层embedding,将inputs和outputs的token转换为向量。解码器在做预测时输入是之前时刻解码器的输出,因此这里写的右移(shiftrd right)。
positional encoding将序列信息加入向量中。RNN通过将上一个时刻的输出作为下一个时刻的输入之一学习到了数据中的时序信息,在transformer中,后续的attention仅计算加权和,没有时序信息(但也因此获得了并行的优势),因此在positional encoding这里将时序信息编码之后加入输入之中,否则的话学习不到时序信息,一组token打乱顺序输入也不会有区别。
在编码器中,有n个相同的层,每个层包括多头自注意力层和前馈神经网络层两个子层,每个子层都采用残差连接和层标准化。残差连接解决网络层数加深时梯度爆炸、梯度消失等问题。层标准化对每个样本进行标准化,而批标准化对每个特征进行标准化,在时序数据中样本长度可能变化会比较大,因此经过填充后批标准化的结果波动比较大。
多头注意力相对于单头注意力来说,进行h次不同映射的投影,将每个attention的输出拼接起来作为最 ...
集成学习预测生还者
代码及数据集:https://github.com/JIANG54864/ml_exp/tree/main/exp5
【实验内容及说明】
本实验通过使用乘客数据(即姓名、年龄、性别、社会经济阶层等)使用集成学习的方法,来对数据集进行分类,从而预测哪些乘客在事故中幸存。本实验训练集包含891条数据,测试集包含418条数据。每条数据都有以下几个特征,包括Pclass(舱位等级)、Sex(性别)、Age(年龄)、SibSp(同行的兄弟姐妹/配偶等的个数)、Parch(同行的父母/子女的个数)、Ticker(票号)、Fare(票价)、Cabin(舱位号)、Embarked(上船港口,C = Cherbourg,Q = Queenstown,S = Southampton)等。通过Survived(乘客是否存活,1表示存活) 作为标签进行模型的训练。
利用若干算法,针对同一样本数据训练模型,使用投票机制,少数服从多数,用多数算法给出的结果当作最终的决策依据,对数据集进行分类,给出在测试集上的精确度。集成学习所用的基学习器需要自己实现而不能调用现成的第三方库。
【正文】
集成学习构建并结合多个学 ...
三种决策树算法分类汽车品牌
完整代码及数据集:https://github.com/JIANG54864/ml_exp/tree/main/exp4
【实验说明】
本实验通过汽车数据集cars.csv来实现对决策树进一步的了解。其中,汽车数据集包含3个品牌(即美国、欧洲、日本)的汽车的信息。该数据集的目标是使用诸如油耗、汽缸数、立方英寸、马力、重量、到60迈的时间、制造年份等特征找到汽车的品牌。
数据集内包含3类汽车数据,每条记录都有7项特征:油耗(mgp)、汽缸数(cylinders)、立方英寸(cubicinch)、马力(hp)、重量(weightlbs)、提速到60迈的时间(time-to-60)、制造年份(year),可以通过这7个特征预测汽车属于(US., Europe., Japan.)三个中的哪一品牌。
本实验将五分之四的数据集作为训练集对决策树模型进行训练;将剩余五分之一的数据集作为测试集,采用训练好的决策树模型对其进行预测。训练集与测试集的数据随机选取。本实验采用准确率(accuracy)作为模型的评估函数:预测结果正确的数量占样本总数。 决策树模型需要自己实现,不可使用已有的第三方库;
2. ...
