• Jump to Content
北京大学计算机研究所多媒体信息处理研究室
[English Version]

关注MIPL微信公众号

主页
新闻
成员
招生方向
研究方向 招生要求 毕业生简介
科研项目
主要论文
成果应用
产业应用 系统演示
开设课程
国际评测
发明专利
学生荣誉
活动休闲
北京大学多媒体信息处理研究室:新闻
2026-09-27:MIPL的4篇论文被NeurIPS 2026接收

  第40届神经信息处理系统大会,英文全称The Fortieth Annual Conference on Neural Information Processing Systems (NeurIPS 2026) 于2026年12月6日至12日在澳大利亚悉尼市举行,是CCF推荐的A类国际会议,也是人工智能领域的顶级国际会议。
  MIPL共有4篇论文被接收,研究细粒度视觉语言模型、强化学习加速、细粒度多模态大模型、生物医学多模态提示学习。

(1)PA-CLIP:基于多层级对比学习的视觉语言模型
  Learning Fine-Grained Vision-Language Alignment from Discriminative Part Descriptions
  作者:尹思博(博士生),彭宇新
  通讯作者:彭宇新
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202626
  源代码链接:https://github.com/PKU-ICST-MIPL/PA-CLIP_NeurIPS2026
  以CLIP为代表的视觉-语言预训练模型(Vision-Language Models,VLMs)具备强大的零样本迁移能力,并被广泛用作多模态大模型的视觉编码器。然而,这类模型仅在全局层面对齐图像与文本,难以区分鸟类物种、汽车型号等视觉上高度相似的细粒度类别,且可解释性不足。其根源在于训练数据缺乏对物体部件细节的描述,而喙的形状、翅膀花纹等部件特征恰恰是区分细粒度类别的关键依据。现有方法虽然引入了更长、更详细的文本,但描述仍侧重整体场景,缺乏部件层面的判别性信息。
  针对上述问题,本文提出了部件感知的视觉-语言对齐框架PA-CLIP(Part-Aware CLIP),主要贡献包括:(1)部件级图文数据集FG-Part:设计了自动化数据构建流程,利用人工标注或开放词汇检测定位物体的判别性部件,再引导多模态大模型从形状、颜色、纹理等方面生成部件描述,构建了约100万对部件级图文数据;(2)多层次对比学习:在全局图文对比学习的基础上,引入部件级对比损失,将部件图像与其细粒度描述显式对齐,使模型能够感知并定位判别性局部特征。实验结果表明,PA-CLIP在7个细粒度视觉识别基准上均取得了最优性能,平均准确率超过现有最优方法7.8%。
  该论文的第一作者是北京大学王选计算机研究所2024级博士生尹思博,通讯作者是彭宇新教授。

(2)LADDERS:面向快速强化学习生成的长度感知数据分配与既有响应推测方法
  LADDERS: Length-Aware Data Distribution and Existing-Response Speculation for Fast RL Rollout Generation
  作者:尹升鹏(硕士生),甄慧玲(华为诺亚),李钘(华为诺亚),袁明轩(华为诺亚),王梓烁(硕士生),彭宇新
  通讯作者:彭宇新
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202627
  源代码链接:https://github.com/PKU-ICST-MIPL/LADDERS_NeurIPS2026
  大语言模型强化学习后训练需要从当前策略模型中反复采样大量响应,其中生成阶段往往是整个训练流程中最主要的效率瓶颈之一。由于自回归生成具有串行特性,响应越长,所需生成时间通常也越长;与此同时,不同样本之间的响应长度差异较大,使得同一批次的整体生成时间往往由其中最长的响应决定。即使较短的响应已经提前结束,GPU仍需要等待长响应完成,从而产生大量计算空闲。在多GPU并行生成场景中,如果较长的响应集中在少数设备上,还会进一步造成设备间负载不均衡。现有高吞吐推理系统和底层算子优化主要提升单个词元的计算效率,但无法从根本上消除这种由响应长度差异带来的“最长序列效应”,因此如何降低长尾响应造成的等待开销,是提升强化学习训练效率的重要问题。
  针对上述问题,本文提出轻量级强化学习生成加速框架LADDERS,从长度感知的数据分配和既有响应推测两个互补方向提升生成效率。首先,LADDERS利用策略模型的隐藏状态预测不同提示词对应的响应长度,并将预计长度相近的样本组织到同一批次中,从而减少批次内部的长度差异;同时,进一步采用长度感知的S形分配策略,将长短不同的生成任务更加均衡地分配到不同GPU上,缓解设备之间的负载不均衡。其次,LADDERS充分利用策略模型已经生成的响应,为每个提示词构建对应的后缀树,并从已有响应中检索可能的后续生成片段,用于加速后续响应的生成。该方法无需额外引入独立的草稿模型,并通过当前策略模型对候选片段进行验证和修正,从而在保持原有生成分布的同时降低生成开销。实验结果表明,在Qwen3-8B模型上,LADDERS最多能够将生成时间降低56%,同时在下游评测数据集上保持与原始训练流程相当的任务性能。
  该论文由MIPL与华为诺亚合作完成,第一作者是北京大学深研院信息工程学院2025级硕士生尹升鹏,通讯作者是彭宇新教授。

(3)面向大模型细粒度视觉分类的列表式强化学习方法
  Uncertainty-Aware Listwise Reinforcement Fine-Tuning for Fine-Grained Visual Classification
  作者:谭智(硕士生),何胡凌霄(博士生),彭宇新
  通讯作者:彭宇新
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202628
  源代码链接:https://github.com/PKU-ICST-MIPL/List-GRPO_NeurIPS2026
  细粒度视觉分类(Fine-Grained Visual Classification,FGVC)旨在区分外观高度相似、仅在局部细节上存在差异的类别,例如鸟类的羽毛颜色、头部纹理和喙部形状。由于不同细粒度类别之间具有较高的视觉相似性,模型在识别过程中容易在少数相似类别之间产生混淆。然而现有多模态大模型强化学习方法通常要求模型回答唯一类别,采用“完全正确或完全错误”的训练方式,因而难以充分利用相似类别之间的关联与判别信息,限制了模型对细粒度类别间共性与差异的深入学习。
  针对上述问题,本文提出不确定性感知的列表式强化学习方法List-GRPO,使模型能够根据预测的不确定程度,自适应生成由一个或多个类别组成的排序候选列表,具体包括如下2个步骤:(1)候选列表生成:突破单一类别的强制决策方式,并利用召回(Recall)奖励和精确(Precision)奖励,在提高真实类别覆盖率的同时强化首位类别的预测准确性,将单一的正误反馈转化为更具信息量的列表式监督;(2)动态真实类别锚定响应构建:从模型的在线预测结果中挖掘高频易混淆类别,并将其与真实类别共同构造成锚定响应,在模型未能探索到真实类别时提供可靠的正向引导,同时增强模型对相似类别的辨别能力;并通过隔离式优势估计,将在线预测结果与锚定响应的优势计算相互解耦,并动态调节锚定响应的作用强度,使其在提供有效引导的同时,避免干扰模型从在线探索中形成的类别偏好。实验结果表明,提出的方法能够有效提升多模态大模型的细粒度识别准确率,并在未参与训练的新类别上展现出良好的泛化能力。
  该论文的第一作者是北京大学深研院信息工程学院2024级硕士生谭智,通讯作者是彭宇新教授。

(4)生物医学图像采集风格偏移的混合偏移解析与风格感知混合专家多模态提示学习
  Biomedical Acquisition-induced Style Shifts as Mixture Shifts: Style-aware Mixture-of-Experts Multimodal Prompt Learning
  作者:缪平逸(博士生),陈先来,安莹,王运波,任立男,彭宇新
  通讯作者:王运波
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202625
  源代码链接:https://github.com/Miaopingyi/SaMoE
  提示学习(Prompt Learning)旨在通过少量可学习参数实现模型的领域适配,在生物医学图像分类等任务中具有重要应用价值。然而,真实医疗环境中的图像数据受采集设备、扫描协议及成像模态等因素影响,存在显著的由数据采集引发的风格偏移。现有提示学习方法大多从源域数据中学习统一的提示,未能显式考虑采集条件变化所引入的风格差异,导致学习到的提示容易过度适应源域的特定风格,降低了模型在未见医疗机构或新成像条件下的性能。
  针对上述挑战,本文提出了一种面向数据采集引发风格偏移的多模态提示学习框架:SaMoE(Style-aware Mixture-of-Experts Multimodal Prompt Learning)。SaMoE将不同领域建模为潜在风格组件的混合,并通过理论分析揭示目标域风险与潜在风格组件风险之间的关系。主要贡献包括:(1)设计了潜在风格感知提示变换模块,利用风格专家库对多模态提示进行显式表征;(2)提出基于图像条件的稀疏路由机制,从视觉中间层提取特征统计量与全局语义信息作为风格线索,在无需领域标签的情况下动态组合风格适应提示;(3)将组合后的提示注入视觉与语言分支的多个Transformer层,并结合负载均衡损失,促进提示与多层视觉-语言表征的交互及对齐,提升模型在未知风格分布下的泛化能力。实验结果表明,该框架在涵盖12个成像模态和10种器官的15个公开数据集上(包含跨机构、跨协议、跨模态等设置),性能优于现有提示学习方法,为真实医疗场景下鲁棒的多模态模型迁移提供新思路。
  该论文由中南大学和MIPL合作完成,第一作者是中南大学计算机学院2025级博士生缪平逸,通讯作者是王运波副教授,与彭宇新教授合作完成。
北京大学王选计算机研究所多媒体信息处理研究室