• Jump to Content
北京大学计算机研究所多媒体信息处理研究室
[English Version]

关注MIPL微信公众号

主页
新闻
成员
招生方向
研究方向 招生要求 毕业生简介
科研项目
主要论文
成果应用
产业应用 系统演示
开设课程
国际评测
发明专利
学生荣誉
活动休闲
北京大学多媒体信息处理研究室:新闻
2026-06-19:MIPL的2篇论文被ECCV 2026接收

  第19届欧洲计算机视觉会议,英文全称The 19th European Conference on Computer Vision (ECCV 2026) 于2026年9月8日至12日在瑞典马尔默市举行。
  MIPL共有2篇论文被接收,研究细粒度多图感知和人与物体交互检测。

(1)DiCoBench:基于差异与共性视觉线索的细粒度多图感知基准测试
  DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues
  作者:李耕(博士生),彭宇新
  通讯作者:彭宇新
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202621
  源代码链接:https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026
  虽然多模态大模型(MLLMs)在现有的常规图像感知任务中表现出色,但这类评测往往高度依赖人类提问时给出的明确提示(例如:直接指出画面中的某项特定物品再询问细节,如提问“桌上的咖啡杯是什么颜色的?”)。这本质上只是在测试模型根据文字寻找对应画面的能力。然而在真实的物理世界中,人类的视觉感知是主动且非指令驱动的,即使没有明确提示,我们也能自然地同时观察多张图像,并敏锐地发现它们之间细微的视觉差异或共性。例如下图中左上角第1个案例,人类可以发现两张小男孩的照片中的差异是胸前的小花图案,而左下角案例中,则可以发现两张照片唯一的共同点是反复出现的同一名中年女性,而现有多模态大模型则难以实现这2种细粒度的对比观察。
  针对上述挑战,本文提出了视觉线索引导的细粒度多图感知任务,并构建了首个相应评测基准DiCoBench。DiCoBench系统性地将视觉线索划分为差异线索(两张内容相似图片的视觉不同点)和共性线索(两张内容不同图片的视觉相同点)两类,涵盖8个具体的感知子任务,差异线索包括:①属性(微观属性改变)、②实体(微观实体替换/出现)、③空间关系(位置微调重组)和④推理(微观不一致性的因果推理)。共性线索包括:⑤实例(极端视角下的实例重识别)、⑥类别(跨领域偏移的特定语义类别对齐)、⑦空间定位(识别等价相对空间位置的对象)和⑧推理(无视觉重叠时推导跨图对象间的功能关系)。DiCoBench共计765个样本,所含样本的基础图像平均分辨率接近2K,相比当前最大的细粒度基准BLINK和TreeBench,在样本量和多样性上实现2倍左右提升。
  通过对18种主流MLLMs进行广泛评估,包括Gemini-3-Pro,Qwen 3.5等,相关结论表明:在人类看来直观的任务(人类平均准确率达98.3%),对于目前最顶尖的大模型仍极其困难。性能最强的闭源模型Gemini-3-Pro仅达到了58.1%的平均准确率,落后人类40.2%。实验进一步揭示,推理任务(Reasoning)是目前所有大模型的普遍短板(得分普遍在20%左右),绝大多数开源模型在处理共性推理时会频繁出现“视觉线索的丢失”问题,这凸显了由于缺乏相关任务训练数据,大模型在视觉线索引导的感知任务上存在系统性缺陷。DiCoBench为未来推动具备感知增强与主动视觉认知能力的多模态系统研发提供了一定基础。
  该论文的第一作者是北京大学王选计算机研究所2023级博士生李耕,通讯作者是彭宇新教授。

(2)AgentHOI:挖掘多模态大语言模型在真实场景免训练人物交互检测中的潜力
  Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
  作者:雷廷(博士生),刘佳林,徐铸,彭宇新,刘洋
  通讯作者:刘洋
  论文链接:https://mipl.pku.edu.cn/download_paper.php?fileId=202622
  源代码链接:https://github.com/oceanflowlab/AgentHOI
  人与物体交互检测(Human-Object Interaction Detection, HOID)旨在从图像中识别并定位“人-动作-物体”三元组,是视觉场景理解中的重要任务。现有方法大多依赖大规模人工标注的HOI数据进行监督训练,虽然在封闭类别测试集上取得了较好效果,但往往受限于固定交互词表和数据集分布,难以泛化到真实世界中开放、组合、多样的人物交互场景。针对这一问题,本文提出了AgentHOI,一种面向真实场景的免训练智能体式HOI检测框架。不同于传统方法学习特定交互分类器,AgentHOI通过协同调度多模态大语言模型与视觉定位基础模型,将HOI检测重新建模为“开放语义推理 + 精确空间定位”的结构化推理过程,从而在无需HOI数据训练、无需参数更新的条件下实现人与物体交互检测。
  为解决复杂场景中交互发现不完整和定位歧义的问题,本文进一步提出了两个关键机制:(1)上下文感知的多轮推理机制,通过初始交互识别、交互再挖掘和动作重分配,逐步补全图像中可能被遗漏的多个人与物体交互;(2)多维度交互定位机制,通过生成融合语义、空间和外观线索的实例级描述,帮助定位模型区分相似人物和相似物体,从而提升复杂场景下的交互定位精度。实验结果表明,AgentHOI在HICO-DET等基准和风格迁移、图像退化等真实分布偏移场景下均表现出较强的泛化能力和鲁棒性,在无需任何HOI专门训练数据的情况下,取得了优于多种全监督和弱监督方法的性能。
  该论文的共同第一作者是北京大学王选计算机研究所2023级博士生雷廷和实习生刘佳林,通讯作者是刘洋助理教授,与彭宇新教授合作完成。
北京大学王选计算机研究所多媒体信息处理研究室