近日,计算机学院姜伟教授团队在机器学习与视觉计算领域取得系列突破性研究成果,以浙江水利水电学院为唯一通讯单位,连续在信息安全领域国际权威期刊《IEEE Transactions on Information Forensics and Security》(CCF A类Top期刊,IF=8.695)、人工智能领域高水平期刊《Neural Networks》(CCF B类Top期刊,IF=7.22),以及国际机器学习权威会议ICML(International Conference on Machine Learning,CCF A类会议)发表多篇原创性研究论文,标志着团队在机器学习与视觉智能领域形成了具有国际竞争力的特色研究方向,研究实力跻身国际先进行列。
近年来,姜伟教授团队始终面向人工智能发展与国家公共安全重大需求,持续围绕视觉智能、机器学习、高效人工智能等前沿方向开展原创性研究。此次系列成果相继发表,充分体现了团队持续开展原创性科研攻关取得的重要进展,进一步提升学校在机器学习与视觉计算领域的国际学术声誉与行业影响力,为学校计算机学科高水平平台搭建、科研青年人才梯队培育及国际化学术建设注入了强劲动力。
破解跨模态行人重识别核心瓶颈:从“模态偏差”到“数据失衡”
可见光-红外跨模态行人重识别(VI-ReID)是智慧城市与全天候公共安全的关键支撑技术。针对该任务中长期被忽视的“模态优化偏差”问题,团队在发表于IEEE TIFS的论文《Quantifying and Overcoming the Bias Nature of Modality for Visible-Infrared Person Re-identification》中,首次从数学上严格量化并系统揭示了其内在机理——可见光模态因语义信息丰富,在联合训练中天然占据主导地位,从而压制难以学习的红外模态,形成有偏特征表征。
研究从优化动力学角度证明,共享分类器会衍生出“可见光主导子空间”,为该现象提供了严谨的理论解释;进而提出轻量、即插即用的模态偏差净化器,通过偏差记忆库、双向引导正则化损失与模态平衡正则化三者协同,实现偏差显式解耦与模态平衡训练。
(https://ieeexplore.ieee.org/document/11574036/)

模态偏差净化器框架图(IEEE TIFS)
针对真实监控场景中另一项被学界长期忽视的现实痛点—数据层面的模态不均衡(夜间行人稀少、红外设备成本高、隐私顾虑等因素,造成红外样本数量远少于可见光样本),团队在《Neural Networks》发表的论文《Stochastic style perturbation modelling for visible-Infrared person re-Identification with severely modality imbalance》中,提出协同模态平衡学习框架。
其核心创新为无参数、非架构侵入的随机风格扰动模块,能够在深度特征空间动态合成多样化红外样本;配合跨分布对齐损失与类感知对比相似度学习策略,从全局分布与类中心两个层面显著增强稀疏模态的判别力。
(https://doi.org/10.1016/j.neunet.2025.108206)

协同模态平衡学习框架图(Neural Networks)
上述两项成果分别针对VI-ReID中“优化偏差”与“数据不均衡”两大关键瓶颈,形成了从理论建模、方法创新到大规模基准验证的完整研究闭环,为跨模态检索系统在真实低光照、非配对场景下的鲁棒部署提供了新理论依据与技术路径。
开拓数据集压缩新范式:高效生成式蒸馏突破表征与多样性困境
在数据集压缩方向,团队于ICML发表的论文《ProtoVAR: Efficient Dataset Distillation via Prototype-Guided Visual Autoregressive Modeling》创新提出基于原型引导的视觉自回归框架(ProtoVAR)。
该方法利用多尺度类原型,在“由粗到细”的自回归生成过程中实施精准语义引导,成功攻克了生成式数据集蒸馏中长期存在的“表征性与多样性难以兼得”的难题,不仅突破了传统核心集选择方法多样性匮乏的局限,更实现了比主流DiT模型快70倍的极速推理。
实验表明,在无需高昂微调成本的前提下,该方法在ImageNet等大规模基准数据集上刷新最高性能纪录(SOTA),为有限算力下的高效模型部署与联邦学习开辟了全新路径。

视觉自回归框架图(ICML)



