Publication
Condensed Test-Time Adaptation of VLMs for Action Recognition
面向视频动作识别中的视觉语言模型测试时自适应,提出无需训练的 ConDA 方法。该方法利用视觉-文本对齐指导视觉-视觉对齐,通过语义补丁选择与自适应视频管构建压缩缓存,减轻外观偏置,并在多个基准上展现出良好的泛化能力。
Publication
面向视频动作识别中的视觉语言模型测试时自适应,提出无需训练的 ConDA 方法。该方法利用视觉-文本对齐指导视觉-视觉对齐,通过语义补丁选择与自适应视频管构建压缩缓存,减轻外观偏置,并在多个基准上展现出良好的泛化能力。