2026
面向视频动作识别中的视觉语言模型测试时自适应,提出无需训练的 ConDA 方法。该方法利用视觉-文本对齐指导视觉-视觉对齐,通过语义补丁选择与自适应视频管构建压缩缓存,减轻外观偏置,并在多个基准上展现出良好的泛化能力。
- 作者
- Wenxuan Ge, Hongyu Qu, Rui Yan, Guo-Sen Xie, Yazhou Yao, Xiangbo Shu, Jinhui Tang
- 来源
- IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2025
面向资源受限设备上的医学图像分割,提出 Mobile U-ViT。模型采用参数高效的大核卷积层次化嵌入、局部-全局-局部信息交互模块和轻量 Transformer 瓶颈,在兼顾医学图像局部细节与长程依赖的同时提升分割效率与性能。
- 作者
- Fenghe Tang, Bingkun Nian, Jianrui Ding, Wenxin Ma, Quan Quan, Chengqi Dong, Jie Yang, Wei Liu, S. Kevin Zhou
- 来源
- ACM International Conference on Multimedia (ACM MM)
2025
提出 EfficientViM 轻量视觉 Mamba 架构,以隐藏状态混合器状态空间对偶性为核心,在压缩隐藏状态内完成通道混合,并融合多阶段隐藏状态。该设计降低状态空间模型的计算与内存瓶颈,在 ImageNet-1K 上取得优良的速度-精度权衡。
- 作者
- Sanghyeok Lee, Joonmyung Choi, Hyunwoo J. Kim
- 来源
- IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2025
针对视觉 Transformer 对细微图像平移敏感的问题,提出 Alias-Free ViT。该方法将无混叠下采样与非线性设计结合可处理整数和分数平移的线性交叉协方差注意力,获得平移不变的全局表示,并在图像分类与对抗平移鲁棒性方面表现出竞争力。
- 作者
- Hagay Michaeli, Daniel Soudry
- 来源
- Advances in Neural Information Processing Systems (NeurIPS)
2025
针对 Vision Transformer 在边缘设备上的二值化部署难题,提出二值化友好的混合视觉 Transformer BHViT。方法结合局部信息交互、分层特征聚合、移位模块与注意力矩阵二值化,并通过正则化损失改善训练稳定性,在二值 ViT 方法中取得领先性能。
- 作者
- Tian Gao, Yu Zhang, Zhiyuan Zhang, Huajun Liu, Kaijie Yin, Chengzhong Xu, Hui Kong
- 来源
- IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
2024
提出轻量级视觉状态空间模型 MobileMamba,以多感受野特征交互模块融合长程小波变换增强 Mamba、高效多核深度卷积与冗余恒等分支消除机制,在高分辨率视觉任务中兼顾推理速度与识别精度。
- 作者
- Haoyang He, Jiangning Zhang, Yuxuan Cai, Hongxu Chen, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Yunsheng Wu, Lei Xie
- 来源
- arXiv preprint
2023
论文指出低 FLOPs 不必然带来低推理延迟,并将效率瓶颈归因于频繁内存访问。作者提出部分卷积 PConv 与 FasterNet 网络,在减少冗余计算和内存访问的同时提升多种设备上的推理速度,并保持具有竞争力的视觉任务精度。
- 作者
- Jierun Chen, Shiu-hong Kao, Hao He, Weipeng Zhuo, Song Wen, Chul-Ho Lee, S.-H. Gary Chan
- 来源
- IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)