Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?论文笔记
Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
一句话总结
这篇论文的核心问题是: 多模态情感识别一定需要 7B、8B 甚至更大的模型吗?
作者的答案是:在合适的知识蒸馏方法下,不一定。可以把一个 8B 多模态情感模型的能力压缩到约 0.855B 参数的模型中,同时保留较好的识别和描述能力。
这篇论文证明了:对于多模态情感识别,模型规模并不是唯一关键因素。通过对教师模型隐藏表示进行几何结构蒸馏,再用多奖励强化学习压缩输出,一个不到 1B 参数的学生模型也可以获得接近甚至超过 8B 模型的效果,并显著降低部署成本。
SWD-H 是一种隐藏状态知识蒸馏策略,通过最小化教师模型和学生模型在答案 token 位置上的隐藏状态分布之间的切片 Wasserstein 距离,使学生模型学习教师模型的多模态表示结构。
GRPO 是一种基于组内相对奖励的强化学习策略,通过比较同一输入生成的多个回答,增加高质量回答的生成概率,减少低质量回答的生成概率。
摘要及引言部分
在本文中,我们质疑了“大模型必然不可或缺”的假设,并提出了一个名为 Light-MER 的轻量级 MER 框架,通过知识蒸馏实现了更好、更快的多模态情感理解与识别。
引入了两种新的优化策略来增强知识转移:
- (1)一种结合了切片 Wasserstein 距离(Sliced Wasserstein Distance)与隐藏状态对齐(hidden-state alignment)的新型最优传输损失;
- (2)一种基于 GRPO 的新型多奖励优化策略,通过平衡 MER 性能与效率,旨在进一步提升学生模型的学习能力。
图1:大型多模态情感模型性能强劲,但难以在边缘端部署。我们的目标是在保持8B参数量教师模型大部分性能的同时,将部署模型参数量压缩至10亿以下。
主要挑战在于如何在压缩过程中保留教师内部的多模态推理过程。现有的基于 KL 散度与 MSE 这样简单的隐藏状态回归损失会丢失信息。
提出了 Light-MER,这是一个结合多奖励 GRPO 精炼的知识蒸馏框架,旨在实现更好、更快的多模态情感理解与识别。
引入了两种关键的优化策略。
- 首先,我们将 SWD-H 定义为隐藏状态对齐目标,利用切片 Wasserstein 距离(Sliced Wasserstein Distance)来最小化教师与学生隐式分布之间的距离。与逐点对齐不同,SWD-H 将隐藏表示视为经验分布,促进了基于最优传输的映射,对高维流形偏移具有稳健性。
- 其次,我们使用基于 GRPO 的新型优化策略(称为 M-GRPO)进一步精炼蒸馏后的学生模型,该策略设计了对多奖励性能和效率的同步约束,用于生成式 MER
- 假设隐藏状态对齐(SWD-H)捕获了教师的隐式几何结构,但它本身并不针对生成输出的质量进行优化。因此引入 M-GRPO 作为关键的精炼阶段,将模型生成的叙述与多维度奖励对齐,特别是专注于 MER 的细微差别
贡献分为四个方面:
- 我们从效率的角度重新审视了多模态情绪识别,并询问高质量的生成式 MER 是否真的需要大于 1B 参数量的部署模型。
- 我们提出了 Light-MER,这是一个紧凑的“教师-学生”框架,可将多模态情绪理解和识别能力从大型生成式 MLLM 转移到轻量级学生模型中以供部署。
- 我们引入了 SWD-H,这是一种基于切片 Wasserstein 距离的隐藏状态对齐目标,显式保留了多模态隐式结构的几何形状,从而提升了知识蒸馏的有效性。
- 我们提出了 M-GRPO,这是一种基于 GRPO 的新优化策略,具有对多奖励性能和效率的同步约束,可进一步提升生成质量和生成式 MER 的学生学习能力。
在九个基准数据集上的广泛实验表明,Light-MER 不仅显著提高了推理效率,而且达到了最先进的性能,证明了高质量的生成式 MER 并不必然需要参数量大于 1B 的部署模型。
方法
问题定义
给定一个多模态样本:
X={xfrm/xface,xaud,xsub}
以及一条指令 (q),模型需要生成一段情感描述:
Y={y1,…,yL}
其中:
- (x_{\mathrm{frm}}):完整视频帧;
- (x_{\mathrm{face}}):从视频中裁剪出的人脸片段;
- (x_{\mathrm{aud}}):音频;
- (x_{\mathrm{sub}}):字幕或文本;
- (q):输入给模型的任务指令;
- (Y):模型生成的情感描述;
- (L):生成文本的长度。
视觉输入既可以使用完整视频帧,也可以使用人脸裁剪片段。由于人脸区域通常包含最显著的情感线索,因此在所有实验中都采用人脸裁剪作为视觉输入。
考虑一个教师模型 (T) 和一个学生模型 (S):
- 教师模型是一个能力较强的大规模多模态情感语言模型,只在训练阶段使用;
- 学生模型是最终用于部署的轻量级模型。
作者希望训练学生模型,使其同时满足两个目标:
- 通过隐藏状态蒸馏,保留教师模型的多模态情感理解能力;
- 通过策略优化,生成更短、更干净的情感描述。
模型采用标准的自回归训练目标。交叉熵损失定义为:
LCE=−L1l=1∑Llogpθ(yl∣x,q,y[1:l−1])(1)
其中:
- (\theta) 表示学生模型的参数;
- (y_{[1:l-1]}) 表示生成第 (l) 个 token 之前已经生成的 token;
- (p_\theta) 表示学生模型预测下一个 token 的概率。
要为这个自回归目标建立知识蒸馏框架,需要考虑两个设计问题:
- 应该在哪个表示层面对教师和学生进行对齐?
- 输出 logits;
- 中间隐藏状态;
- 跨层或跨位置的关系。
- 应该使用什么距离或散度来进行对齐?
作者在第 3.3 节中分析隐藏状态分布和输出分布的差异,并在第 3.4 节中使用 SWD 方法解决对齐距离的问题。之后,学生模型还会在第 3.5 节中使用基于 GRPO 的多奖励策略优化进行进一步改进。
模型架构(Model Architecture)
图2:我们模型的概览。 一个冻结的8B参数教师模型通过SWD隐藏状态对齐(SWD-H)来监督一个参数量低于10亿的学生模型,随后,经过蒸馏的学生模型进一步通过多奖励GRPO进行精调,以生成简洁的情感描述。
Light-MER 的整体框架如图 2 所示。
教师模型由以下组件组成:
Qwen3-8B:语言解码器;CLIP-ViT-Large-Patch14:视觉编码器;HuBERT-Large:音频编码器。
教师模型在 MER-Caption+ 数据集上进行预训练,并在学生模型蒸馏阶段保持冻结。
学生模型采用面向部署的轻量级架构:
Qwen3-0.6B:语言解码器;CLIP-ViT-Base-Patch16:视觉编码器;HuBERT-Base:音频编码器。
学生模型中的语言模型分支通过 LoRA 进行更新;多模态投影层和融合层则与学生语言解码器一起进行训练。
多模态融合
对于每一种模态 (m\in{\mathrm{face},\mathrm{aud}}),首先使用对应的冻结编码器,将其编码成一个时间序列:
Z(m)={z1(m),…,zTm(m)}
其中 (T_m) 表示模态 (m) 的时间步数量。
随后,通过可学习的时间池化操作,将整个时间序列压缩为一个向量:
zˉ(m)=t∑at(m)zt(m)
其中 (a_t^{(m)}) 是可学习的时间权重。
接着,使用线性映射将其投影到语言模型的输入空间:
h(m)=Wmzˉ(m)
为了完成多模态融合,首先分别对人脸和音频编码序列进行平均池化,并将它们映射到一个共同的特征空间:
u(m)=Pm(Tm1t∑zt(m))(2)
然后,通过可学习的模态权重对两个模态进行合并:
h(mm)=Wmm(βfaceu(face)+βaudu(aud))(3)
其中:
- (u^{(\mathrm{face})}):人脸特征;
- (u^{(\mathrm{aud})}):音频特征;
- (\beta_{\mathrm{face}}):人脸模态的权重;
- (\beta_{\mathrm{aud}}):音频模态的权重;
- (h^{(\mathrm{mm})}):融合后的多模态特征。
两个模态的权重由下式计算:
[βface,βaud]=W2W1[u(face):u(aud)](4)
其中,符号 ([ : ]) 表示向量拼接。
最终,语言模型接收以下信息:
- 融合后的多模态 token (h^{(\mathrm{mm})});
- 单独的人脸 token;
- 单独的音频 token;
- 字幕文本;
- 任务指令。
随后,学生模型使用带有 LoRA 适配的 Qwen3-0.6B 进行解码。
论文中的所有实验均采用这种基于门控的融合方式,并使用人脸裁剪作为视觉输入。
图 2 的含义
图 2 展示了 Light-MER 的整体流程:
- 冻结的
Qwen3-8B教师模型向学生模型提供监督; - 教师和学生分别使用大规模和轻量级的视觉、音频编码器;
- 使用 SWD-H 对齐教师和学生的隐藏状态;
- 使用交叉熵损失训练学生模型;
- 经过蒸馏后,再使用多奖励 GRPO 对学生模型进行优化;
- 最终得到一个不到 1B 参数、适合部署的多模态情感模型。
图中所示的学生模型总参数量约为 855M,教师模型总参数量约为 9B。
实证观察:隐状态 vs. 输出分布(Empirical Observation: Hidden States vs. Output Distributions)
图3:在子集评估套件上汇总的隐藏状态与输出概率分析。
(a) 前20个token的概率。
(b) 蒸馏前一个代表性隐藏状态维度。教师模型与学生模型均为多峰分布,且峰值位置不同。
(c) 所有1024个维度上的峰值计数直方图。其中99.2%的维度包含两个或更多峰值。
(d) SWD-H蒸馏后与(b)相同的维度。教师和学生的峰值更加对齐。
在开始蒸馏之前,作者首先比较了两个模型:
- 一个独立训练的
Qwen3-8B模型; - 一个独立训练的
Qwen3-0.6B模型。
作者从九个基准数据集构成的评测集合中抽取数据,并分析了两个模型的:
- 输出概率;
- 最后一层隐藏状态。
输出概率非常集中
两个模型的输出概率都非常尖锐。
对于 Qwen3-8B:
- 概率最高的第一个 token 获得了约 0.980 的概率;
- 排名第 2 到第 20 的 token 加起来只占约 0.016 的概率;
- 前 20 个 token 的累计概率约为 0.9961。
对于 Qwen3-0.6B,前 20 个 token 的累计概率约为 0.9999。
当教师模型的输出分布如此集中时,基于 KL 散度的知识蒸馏就会接近普通的硬标签交叉熵训练。
原因是,KL 蒸馏的梯度会按照教师模型给出的概率进行加权。由于教师模型几乎把所有概率都放在第一候选 token 上,因此第一候选 token 会主导训练信号。
这意味着:
学生模型基本只能学习教师模型的最高概率预测,而无法从教师模型的完整输出分布中获得更多信息。
换句话说,教师模型的输出分布中几乎没有足够丰富的“软标签知识”可以传递。
隐藏状态具有复杂的多模态结构
与输出概率不同,隐藏状态呈现出了明显的多峰结构。
在学生模型隐藏表示的 1024 个维度中,有 1016 个维度包含两个或更多的模式,占比约为:
10241016=99.2%
作者观察到,在某个代表性隐藏状态维度上,教师模型和学生模型的隐藏值分布都具有多个峰值,但:
- 峰值的位置不同;
- 峰值的高度不同;
- 两个模型的内部表示组织方式不同。
有意思的是,即使教师和学生最终产生了几乎相同的输出,它们的内部表示仍然可能完全不同。
因此,作者认为:
- 输出 logits 只能反映模型最终选择了什么;
- 隐藏状态则能反映模型在生成之前如何组织和融合多模态证据。
最简单的隐藏状态对齐方式是均方误差,即 MSE。但 MSE 只比较对应位置上的数值差异,无法充分考虑两个隐藏表示整体分布的形状。
相比之下,最优传输方法可以衡量不同分布之间的整体几何距离。
因此,作者提出使用 SWD-H 来对齐教师和学生的隐藏状态分布。图 3 展示了:
- SWD-H 蒸馏前,教师和学生隐藏状态的峰值位置不同;
- SWD-H 蒸馏后,两者的隐藏状态峰值更加接近。
基于隐状态的切片 Wasserstein 蒸馏(SWD-H)
蒸馏目标
作者的蒸馏目标不是语言模型的输出 logits,而是语言模型最后一层的隐藏状态。
设:
HT∈RL×4096
表示教师模型在受监督解码位置上的隐藏状态;
HS∈RL×1024
表示学生模型对应位置上的隐藏状态。
由于教师和学生的隐藏维度不同,作者首先将它们映射到同一个空间中:
H~T=HTWT
H~S=LN(HSWS)(5)
其中:
- (WT\in\mathbb{R}{4096\times1024}) 是教师投影矩阵;
- (W^T) 被冻结,并采用正交初始化;
- (WS\in\mathbb{R}{1024\times1024}) 是学生投影矩阵;
- (W^S) 使用单位矩阵初始化;
- (\mathrm{LN}) 表示 LayerNorm。
也就是说,教师的 4096 维隐藏状态被投影到 1024 维空间,学生的 1024 维隐藏状态则通过一个可学习投影进行调整。
监督位置掩码
在标准的自回归训练中,交叉熵损失只在答案序列对应的位置上计算。
作者对隐藏状态蒸馏使用相同的移位掩码。
对于序列中的第 (i) 个位置,只有当:
yi+1=−100
时,才启用 SWD 对齐。
这里的 (-100) 是训练中常用的忽略标记,表示该位置不参与损失计算。
设 (M) 表示答案 token 的掩码,那么只有答案部分的隐藏状态才会参与教师和学生之间的分布对齐。
SWD-H 损失
作者在 1024 维空间中随机采样 (R=200) 个单位方向:
{θr}r=1R
对于每一个随机方向,分别将教师和学生隐藏状态投影到一维空间,然后进行排序。
SWD-H 损失定义为:
LSWD=Rn1r=1∑Rsort(H~MTθr)−sort(H~MSθr)1(6)
其中:
- (R):随机投影方向的数量;
- (n):参与对齐的答案 token 数量;
- (\tilde H^T_M):经过答案位置掩码后的教师隐藏状态;
- (\tilde H^S_M):经过答案位置掩码后的学生隐藏状态;
- (\operatorname{sort}(\cdot)):排序操作;
- (|\cdot|_1):L1 距离。
为什么要进行排序?
在一维情况下,两个经验分布之间的最优传输方案就是按照分位数进行匹配。
设两个一维分布中的样本分别为:
α(1)≤⋯≤α(n)
和:
β(1)≤⋯≤β(n)
其中下标括号表示排序后的顺序。
那么,(p)-阶 Wasserstein 距离可以写成:
Wpp(α,β)=n1i=1∑n∣α(i)−β(i)∣p(7)
本文使用 (p=1)。
这意味着,在一维空间中,只需要:
- 将教师的投影值排序;
- 将学生的投影值排序;
- 按照相同排名逐一匹配;
- 计算对应值之间的距离。
因此,不需要显式求解一个复杂的传输矩阵。
作者将这种方式推广到多个随机一维投影方向上,从而近似计算高维隐藏状态分布之间的 Wasserstein 距离。
计算复杂度
SWD-H 的计算复杂度主要来自排序操作,大约为:
O(Rnlogn)
相比之下,经过 (K) 次迭代的 Sinkhorn 最优传输方法,其复杂度约为:
O(Kn2)
因此,SWD-H 具有以下优点:
- 不需要显式构造完整的 token 两两传输矩阵;
- 不需要进行多轮迭代;
- 不需要设置熵正则化系数;
- 更适合在训练过程中反复进行隐藏状态匹配。
总蒸馏目标
作者将交叉熵损失和 SWD-H 损失结合起来:
L=LCE+αtLSWD
其中:
αt=λSWDmin(5000t,1)(8)
并且:
λSWD=1.0
这里的 (t) 表示训练步数。
这说明 SWD-H 的损失权重不会一开始就直接设置为 1,而是会在前 5000 个训练步骤中线性增加,之后保持为 1。
这种逐渐增加的方式叫作 warm-up,目的是:
- 让学生模型先学习基本的生成任务;
- 避免在训练初期隐藏状态对齐信号过强;
- 提高蒸馏过程的稳定性。
作者在八种蒸馏方案之间进行比较后发现,SWD-H 整体表现最好。
基于多奖励 GRPO 的描述精炼(M-GRPO)
描述生成优化
隐藏状态蒸馏可以保留教师模型的情感推理能力,但同时也可能把教师模型冗长的生成习惯传递给学生模型。
大型情感模型经常会生成过于详细、过于展开的情感描述。例如,它可能会:
- 重复描述相同的情绪;
- 加入大量没有必要的推理;
- 对输入进行过度解读;
- 在已经得到情感结论后继续生成很长的分析。
在本文的设置中,模型输出包含一个固定格式的前缀,例如:
“The character’s emotional state is ...”
中文可以理解为:
“人物的情绪状态是……”
在这个固定前缀之后,模型会生成一个或多个开放词汇的情感标签。
仅仅使用情感 F1 分数,无法控制以下行为:
- 输出格式是否正确;
- 生成内容是否过于冗长;
- 是否包含无用推理;
- 是否能够干净地停止;
- 是否生成了过多或过少的情感标签。
因此,作者使用多个奖励共同构成总奖励:
r=2.0rF1+1.0rfmt+0.3rbrev+0.5rnoreason+0.3rstop+0.5rcount(9)
各个奖励的含义如下:
- (r_{\mathrm{F1}}):预测情感标签和真实标签之间的 F1 重叠分数;
- (r_{\mathrm{fmt}}):是否符合标准的情感状态输出格式;
- (r_{\mathrm{brev}}):是否足够简洁;
- (r_{\mathrm{noreason}}):是否抑制不必要的推理性表达;
- (r_{\mathrm{stop}}):是否能够以一条完整句子正常结束;
- (r_{\mathrm{count}}):生成的情感标签数量是否合理。
其中,情感 F1 的权重最高,为 2.0,说明识别正确性仍然是最重要的目标。
组内相对优势
对于每一个训练样本,作者生成 (G=4) 个候选回答。
然后,比较这四个回答的奖励,并计算每个回答相对于同组其他回答的优势。
第 (i) 个回答的优势定义为:
Ai=σG+10−8ri−G1∑j=1Grj(10)
其中:
- (r_i):第 (i) 个回答的总奖励;
- (G):同一个输入生成的回答数量,这里为 4;
- (\sigma_G):这一组回答奖励的标准差;
- (10^{-8}):防止除零的小常数。
如果某一组回答的奖励几乎完全相同,即:
σG<10−8
那么这组回答的优势会被设为 0,并跳过该组训练。
这种方法不需要额外训练一个价值模型或 critic,而是直接利用同一输入下多个回答之间的相对奖励来判断哪些回答更好。
GRPO 优化目标
作者使用类似 PPO 的裁剪目标,并添加了相对于冻结参考模型的 KL 惩罚:
LGRPO=−Ei[min(ρiAi,clip(ρi,1−ϵ,1+ϵ)Ai)]+βEi[KLi](11)
其中:
- (\rho_i):当前策略和参考策略之间的概率比;
- (A_i):第 (i) 个回答的组内相对优势;
- (\epsilon=0.10):PPO 风格的裁剪范围;
- (\beta=1.0):KL 惩罚项的权重;
- (\pi_\theta):当前正在训练的学生策略;
- (\pi_{\mathrm{ref}}):冻结的参考策略。
为了提高数值稳定性,作者首先对序列级别的 log-ratio 进行裁剪:
Δi=clip(logπθ(yi∣x)−logπref(yi∣x),−5,5)(12)
然后定义:
ρi=exp(Δi)(13)
KL 项使用如下形式:
KLi=ρi−1−Δi=exp(Δi)−1−Δi(14)
这里的参考模型是蒸馏完成后的学生模型副本,并且保持冻结。
这样做的作用是限制当前模型不要偏离蒸馏后的模型太远,同时鼓励它朝着以下方向优化:
- 更准确地识别情感;
- 使用规范的输出格式;
- 减少无意义的解释;
- 生成更短的情感描述;
- 保持合理的情感标签数量;
- 正确停止生成。
因此,Light-MER 的训练过程可以概括为:
大模型教师→隐藏状态蒸馏→轻量学生模型→多奖励 GRPO 优化
最终得到的学生模型既能够保留较强的多模态情感理解能力,又能生成更简洁、可解释、适合实际部署的情感描述。
实验
实验设置
作者使用了 9 个基准数据集,分成三类任务:
| 任务类型 | 数据集 | 主要考察内容 |
|---|---|---|
| 基本情感识别 | MER2023、MER2024、MELD、IEMOCAP | 识别高兴、悲伤、愤怒、焦虑等情绪 |
| 情感分析 | CMU-MOSI、CMU-MOSEI、CH-SIMS、CH-SIMS v2 | 判断正面、负面或中性情感 |
| 细粒度开放词汇情感识别 | OV-MERD+ | 不局限于预先规定的情感类别,生成更细的情感标签 |
不仅测试单一任务,还测试:
- 固定类别情感识别;
- 开放词汇情感识别;
- 中文和英文数据;
- 视频、音频、文本的不同组合;
- 情感分类和情感极性的判断。
教师模型:
- 语言模型:Qwen3-8B;
- 视觉编码器:CLIP-ViT-Large-Patch14;
- 音频编码器:HuBERT-Large。
学生模型:
- 语言模型:Qwen3-0.6B;
- 视觉编码器:CLIP-ViT-Base-Patch16;
- 音频编码器:HuBERT-Base。
主要指标是 HIT,判断:模型预测出的情感标签集合中,是否包含真实情感标签。 例如真实标签是“焦虑”,模型输出“焦虑、紧张、不安”,就算预测命中。 作者还报告了 mscore。相比 HIT,mscore 对预测标签过多更加敏感,因此更偏向衡量预测的精确性。
情感分析使用:
- WAF:加权平均 F1;
- ACC:准确率。
作者把 WAF 作为主要指标,是因为不同情感类别的数据量可能不平衡。
开放词汇情感识别使用集合级别的:
- Precision;
- Recall;
- (F_s)。
模型可以生成一个或多个情感词,评估时比较预测情感集合和真实情感集合之间的重合程度。 论文最后把每个数据集的主要指标取平均,作为整体性能评价。
还分别测试:
- 音频 + 文本;
- 视频 + 文本;
- 音频 + 视频 + 文本。
这样可以判断 Light-MER 是否只能在三模态完整输入时有效,还是在缺少某个模态时也能工作。
实验内容
主实验:小模型能否超过大模型?
将 Light-MER 与多种已有的多模态大语言模型进行比较,包括:
- OneLLM;
- PandaGPT;
- Emotion-LLaMA;
- AffectGPT;
- Video-LLaVA;
- mPLUG-Owl 等。
主要比较三个方面:
- 模型大小;
- 输入模态;
- 情感识别效果。
观察:
- 学生模型是否保留教师模型的能力;
- 蒸馏后的小模型是否在多个数据集上稳定工作;
- 小模型是否只适用于某种模态组合;
- 模型规模减少后,是否出现明显性能崩溃。 主实验结果表明,Light-MER 在三种模态设置下都具有较好的泛化能力。在完整的音频、视频、文本输入下,它的平均性能略高于 8B 教师模型。
消融实验:每个模块有什么作用?
逐步加入不同模块,主要比较三种模型:
- 只使用交叉熵训练;
- 交叉熵 + SWD-H;
- 交叉熵 + SWD-H + M-GRPO。
只使用交叉熵 学生模型只学习生成正确答案,相当于普通的监督微调。 这个模型可以学到基本任务,但无法充分模仿教师模型的内部多模态表示。
加入 SWD-H SWD-H 负责对齐教师和学生的隐藏状态分布。 它的作用主要是:
- 传递教师模型内部的多模态信息;
- 让学生学习教师如何组织情感相关特征;
- 改善基本情感识别能力;
- 弥补学生模型参数规模较小的问题。 从实验设计上看,如果加入 SWD-H 后性能明显提升,就说明隐藏状态蒸馏确实比单纯的监督学习更有效。
再加入 M-GRPO M-GRPO 主要调整模型的生成行为。 它负责:
- 减少冗余分析;
- 让输出格式更加统一;
- 让回答更短;
- 让模型更好地控制情感标签数量;
- 改善情感描述的可读性和部署效率。
因此,两个模块的职责并不完全相同:
- SWD-H 更偏向“学会大模型的情感能力”;
- M-GRPO 更偏向“让输出更适合使用”。 消融实验显示,SWD-H 带来的性能提升明显大于 M-GRPO,但 M-GRPO 对输出质量和推理速度仍然有补充作用。
蒸馏方法对比:为什么使用 SWD-H?
比较了八种策略:
- 只使用交叉熵;
- 对 logits 使用 KL 散度;
- 对 logits 使用 Sinkhorn OT;
- 对隐藏状态使用 Sinkhorn OT;
- Position-aware OT;
- Unbalanced OT;
- 对 logits 使用 SWD;
- 对隐藏状态使用 SWD,也就是本文的 SWD-H。
第一,比较 logits 和 hidden states 作者固定最优传输方法,只改变蒸馏对象:
- 蒸馏输出 logits;
- 蒸馏隐藏状态。
目的在于验证:
模型的内部隐藏表示是否比最终输出概率包含更多知识?
作者认为,情感识别涉及视觉、声音和文本信息的融合。很多重要信息在模型产生最终 token 之前,已经体现在隐藏状态中,而不一定体现在最后的输出概率中。 因此,隐藏状态应该更适合传递多模态推理结构。
第二,比较 Sinkhorn 和 SWD 作者固定隐藏状态作为蒸馏目标,再比较:
- Sinkhorn OT;
- SWD。
两者都属于最优传输方法,但计算方式不同。 Sinkhorn OT 需要:
- 构造完整的 token 两两距离矩阵;
- 迭代求解传输方案;
- 设置熵正则化参数。
SWD 则通过:
- 随机投影到多个一维方向;
- 对投影结果排序;
- 逐一计算排序后样本的距离;
来近似高维分布之间的 Wasserstein 距离。 作者认为,情感描述的 token 数通常只有几十到一百左右,而隐藏维度却很高。在这种情况下,Sinkhorn 的传输矩阵可能比较敏感,训练过程也容易出现波动;SWD 的排序方法则更加稳定、计算量也更低。 因此,这组实验不是简单地证明“SWD 比其他方法好”,而是试图拆解出两个原因:
- 隐藏状态比 logits 更适合知识迁移;
- 在隐藏状态层面,SWD 比需要迭代求解的 Sinkhorn 更稳定。
M-GRPO 实验:模型输出是否变得更好?
作者比较:
- SWD-H 蒸馏后、未进行 GRPO 的学生模型;
- 经过 M-GRPO 优化后的学生模型。
主要观察两个方面。
第一,任务性能是否保持 作者检查 M-GRPO 会不会为了追求短输出而损害识别能力。 因为 M-GRPO 鼓励简洁,所以可能出现一个权衡:
- 输出更短;
- 但包含的情感细节更少;
- 对多标签情感识别来说,可能漏掉部分情感词。 因此,作者分别观察基本情感任务、情感分析任务和开放词汇任务,而不是只看一个总分。
第二,描述质量是否改善 作者使用 GPT-5.4 作为自动评审模型,从五个维度评价生成描述:
- 情感分类准确性;
- 面部细节丰富程度;
- 流畅性和连贯性;
- 语义一致性;
- 简洁性和信息密度。
此外,作者还观察 GRPO 训练过程中的:
- 总奖励变化;
- 分析文本长度变化;
- 是否出现某个奖励压倒其他奖励的情况。
实验中的定性示例也用于说明模型行为变化:
- GRPO 之前,模型往往会进行很长的推测;
- GRPO 之后,模型会减少没有证据支持的判断;
- 输出更短,也更集中于可观察的情绪线索。
这一部分的核心结论是: M-GRPO 不只是让回答变短,也试图让回答减少过度解读,更贴近输入中的实际证据。
不过它带来一个明显的权衡:描述的细节覆盖程度会下降。
效率实验:模型是否适合部署?
统计:
- 总参数量;
- FLOPs;
- 峰值显存;
- 单样本推理时间;
- 输出词数。
同时设计了两种推理模式。
Direct mode:直接模式 模型直接输出情感标签,不生成中间分析过程。 优点:
- 速度快;
- 输出短;
- 适合固定情感类别的任务。
缺点:
- 没有明确的情感解释;
- 不适合需要开放词汇或可解释描述的场景。
Descriptive mode:描述模式 模型先生成完整的情感描述,然后再由标签提取器从描述中提取情感标签。 优点:
- 具有更强的可解释性;
- 可以生成开放词汇的情感描述;
- 能够保留一定的情感证据链。
缺点:
- 生成文本更长;
- 推理速度慢于直接模式。
论文报告的整体趋势是:
- 学生模型参数和显存需求大幅下降;
- 直接模式速度最快;
- M-GRPO 通过缩短输出,进一步降低描述模式的推理延迟。
结论
论文提出 Light-MER,通过:
- 用 8B 大模型指导不到 1B 的学生模型;
- 用 SWD-H 蒸馏隐藏状态,保留多模态情感知识;
- 用 M-GRPO 让输出更准确、简洁、规范。
实验表明,小模型在整体情感识别性能上可以接近甚至超过大模型,同时显著降低显存和推理成本。因此,论文认为:多模态情感识别的部署模型不一定需要超过 1B 参数。
主要局限性
- 小模型并不是在所有数据集上都优于大模型,部分任务仍存在性能下降。
- M-GRPO 虽然让输出更短,但也会减少情感细节,可能漏掉一些细粒度情绪。
- 模型依赖 8B 教师模型进行训练,训练成本并没有完全消失,只是降低了部署成本。
- 实验主要使用人脸裁剪作为视觉输入,对复杂场景、多人交互等情况的适应性还需要验证。
- 部分描述质量由 GPT-5.4 自动评价,评价结果可能受到评判模型偏差影响。
- 推理速度和显存数据依赖具体硬件,实际部署效果可能与论文报告有所不同。
总体来说,这篇论文证明的是“小模型可以通过有效蒸馏获得大模型的部分能力”,而不是“小模型在所有情况下都能完全替代大模型”。