Publications

论文资料

整理课程阅读、复现实验、组会精读和师生论文。

2026

Condensed Test-Time Adaptation of VLMs for Action Recognition

面向视频动作识别中的视觉语言模型测试时自适应,提出无需训练的 ConDA 方法。该方法利用视觉-文本对齐指导视觉-视觉对齐,通过语义补丁选择与自适应视频管构建压缩缓存,减轻外观偏置,并在多个基准上展现出良好的泛化能力。

作者
Wenxuan Ge, Hongyu Qu, Rui Yan, Guo-Sen Xie, Yazhou Yao, Xiangbo Shu, Jinhui Tang
来源
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2025

Mobile U-ViT: Revisiting large kernel and U-shaped ViT for Efficient Medical Image Segmentation

面向资源受限设备上的医学图像分割,提出 Mobile U-ViT。模型采用参数高效的大核卷积层次化嵌入、局部-全局-局部信息交互模块和轻量 Transformer 瓶颈,在兼顾医学图像局部细节与长程依赖的同时提升分割效率与性能。

作者
Fenghe Tang, Bingkun Nian, Jianrui Ding, Wenxin Ma, Quan Quan, Chengqi Dong, Jie Yang, Wei Liu, S. Kevin Zhou
来源
ACM International Conference on Multimedia (ACM MM)
2025

EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality

提出 EfficientViM 轻量视觉 Mamba 架构,以隐藏状态混合器状态空间对偶性为核心,在压缩隐藏状态内完成通道混合,并融合多阶段隐藏状态。该设计降低状态空间模型的计算与内存瓶颈,在 ImageNet-1K 上取得优良的速度-精度权衡。

作者
Sanghyeok Lee, Joonmyung Choi, Hyunwoo J. Kim
来源
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2025

Alias-Free ViT: Fractional Shift Invariance via Linear Attention

针对视觉 Transformer 对细微图像平移敏感的问题,提出 Alias-Free ViT。该方法将无混叠下采样与非线性设计结合可处理整数和分数平移的线性交叉协方差注意力,获得平移不变的全局表示,并在图像分类与对抗平移鲁棒性方面表现出竞争力。

作者
Hagay Michaeli, Daniel Soudry
来源
Advances in Neural Information Processing Systems (NeurIPS)
2025

BHViT: Binarized Hybrid Vision Transformer

针对 Vision Transformer 在边缘设备上的二值化部署难题,提出二值化友好的混合视觉 Transformer BHViT。方法结合局部信息交互、分层特征聚合、移位模块与注意力矩阵二值化,并通过正则化损失改善训练稳定性,在二值 ViT 方法中取得领先性能。

作者
Tian Gao, Yu Zhang, Zhiyuan Zhang, Huajun Liu, Kaijie Yin, Chengzhong Xu, Hui Kong
来源
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2024

MobileMamba: Lightweight Multi-Receptive Visual Mamba Network

提出轻量级视觉状态空间模型 MobileMamba,以多感受野特征交互模块融合长程小波变换增强 Mamba、高效多核深度卷积与冗余恒等分支消除机制,在高分辨率视觉任务中兼顾推理速度与识别精度。

作者
Haoyang He, Jiangning Zhang, Yuxuan Cai, Hongxu Chen, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Yunsheng Wu, Lei Xie
来源
arXiv preprint
2023

Run, Don't Walk: Chasing Higher FLOPS for Faster Neural Networks

论文指出低 FLOPs 不必然带来低推理延迟,并将效率瓶颈归因于频繁内存访问。作者提出部分卷积 PConv 与 FasterNet 网络,在减少冗余计算和内存访问的同时提升多种设备上的推理速度,并保持具有竞争力的视觉任务精度。

作者
Jierun Chen, Shiu-hong Kao, Hao He, Weipeng Zhuo, Song Wen, Chul-Ho Lee, S.-H. Gary Chan
来源
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)