基于骨架的人体动作理解
从语义生成到在线 Prompt Learning
2026.04 · 已记录实验
基于 Neuron 开展骨架—文本对齐研究,完成六组实验,覆盖语义 Prompt 设计、CLIP 特征诊断与双流在线 Prompt Learning。
项目角色
研究设计、模型实现与实验分析
主要方法
零样本学习 · CLIP · Prompt Learning

研究问题
零样本动作识别利用语言描述识别训练阶段未见过的动作。我的研究关注:什么样的文本语义真正有助于骨架识别?更详细的描述可能引入骨架关节无法观测的信息,而重复的句式又可能让不同动作在 CLIP 空间中难以区分。我以 Neuron 为基线,研究文本表示如何影响未见类别识别,以及广义零样本学习中已见类与未见类的平衡。
我的贡献
- 设计并记录六组实验:从三轮动作语义生成改写,推进到固定标签模板、单流可学习 Prompt 和双流可学习 Prompt 的对照实验。
- 搭建语义生成与编码流程,对应三个空间粒度和三个时间阶段,控制关键身体部位、骨架可观测信息、文本长度与阶段连续性。
- 构建文本与特征分析流程,结合词长统计、词面重合度、CLIP 余弦相似度矩阵、类别混淆和时空分支指标,定位文本改动影响识别效果的原因。
- 实现分支专属的可学习 Prompt Tokens,以及由模板流引导的双流 CLIP 编码;通过可学习门控融合隐藏状态,并加入余弦相似度形式的文本保真损失。
技术路线
- 语义设计:先引入动作属性和判别性运动线索,再恢复由粗到细的空间层次与链式时间描述,随后去掉机械的阶段开头词,让动作词和关键部位优先进入文本。
- 特征诊断:比较文本在 CLIP 编码前后的类间区分度。实验中,即使词长与原始描述接近,编码后的类别原型仍可能过于相似,因此进一步从修改措辞转向改造编码方式。
- 在线学习:对照共享标签模板与六组分支专属 Prompt。在双流版本中,模板流在 Transformer 前若干层引导可学习流,保真损失约束文本语义偏移。
- 实验评估:在 NTU60 上同时跟踪 ZSL Top-1、GZSL 已见类准确率、未见类准确率与调和平均值,并分别检查空间、时间分支及类别混淆,分析整体指标背后的变化。
成果与发现
- 实验揭示了未见类识别与广义零样本平衡之间的取舍:未见类准确率提高,并不意味着已见类与未见类的综合表现同步改善。文本更流畅、更详细,也不必然带来更有区分力的类别原型。
- NTU60 跨主体双流实验(55 个已见类/5 个未见类,随机种子 1)第 28 个 epoch 的检查点取得已见类准确率 77.16%、未见类准确率 65.94%、调和平均值 71.11%;同一检查点的 ZSL Top-1 为 72.88%。
- 建立了从语义 Prompt 设计到可训练文本表示的实验研究路径,配套分支诊断与训练记录。目前进一步围绕全局动作语义和阶段专属 Prompt,研究显式的时序结构关系。