2026-07-30:MIPL师生参加ChinaMM 2026
2026年7月30日至8月1日,中国多媒体大会(ChinaMM 2026)在山西省太原市召开。MIPL彭宇新教授、博士生耿子竣参加了此次会议。
ChinaMM每年举办一次,为多媒体领域的学术界和产业界提供前沿的技术发展动态、丰富多样的交流活动、全面前瞻的产业技术宣传平台,以广泛促进学术分享与交流、产业合作与互动,推动产学研联动发展,提升我国多媒体技术的研究与应用水平。
彭宇新教授作为大会报告嘉宾,应邀做了题为“细粒度家族:迈向更细、更深、更快的视觉感知”的大会特邀报告,首先阐释了“细粒度家族”的定义,涵盖类别、空间、时间三个感知维度,并分析现有大模型在每个维度上面临的挑战。针对上述挑战,进一步介绍了团队在基于细粒度树的分层图像分类、多模态大模型细粒度视觉感知、细粒度图像token剪枝、细粒度美学照片重构、细粒度动作质量评价等方面的最新研究进展。最后介绍了团队在细粒度视觉内容理解与生成技术上的落地应用。
彭宇新教授应邀在专题论坛中做题为“细粒度多模态大模型”的专题报告,介绍近年来“细粒度多模态大模型”主要研究进展,包括细粒度图像分类大模型、空间推理与占用预测、美学理解、细粒度运动分析等方法与技术。报告深入剖析了上述技术的优势、局限及典型应用场景,并立足前沿,对细粒度多模态大模型的未来发展趋势进行了前瞻性展望。
本次大会,MIPL有1篇论文接收进行墙报展示,论文信息如下:
Zijun Geng, Zijun Deng and Yuxin Peng*, "PBench: A Multi-Dimensional Benchmark for Evaluating Instruction Following and Information Expression in Poster Generation", China Multimedia (ChinaMM), Taiyuan, Shanxi, China, Jul.30 - Aug.1, 2026.
该论文针对现有文生图评测方法难以全面衡量海报的信息传达与设计功能问题,提出面向生成海报的多维评测基准PBench:从指令遵循和信息表达两个互补视角,将海报生成能力细分为主题、风格、文本内容与颜色、视觉元素及布局、文本可读性与显著性、图文一致性和视觉注意力引导等13个维度,并依托995个测试样本,在不依赖单一总分的前提下提供细粒度评价,实验表明当前模型在文本控制与信息表达上仍存明显不足,为设计导向的生成研究提供可靠评估。
彭宇新教授应邀做《细粒度家族:迈向更细、更深、更快的视觉感知》大会特邀报告
彭宇新教授应邀做《细粒度多模态大模型》专题报告
MIPL师生会场合影(从左到右:耿子竣、彭宇新教授)
耿子竣同学墙报展示
ChinaMM每年举办一次,为多媒体领域的学术界和产业界提供前沿的技术发展动态、丰富多样的交流活动、全面前瞻的产业技术宣传平台,以广泛促进学术分享与交流、产业合作与互动,推动产学研联动发展,提升我国多媒体技术的研究与应用水平。
彭宇新教授作为大会报告嘉宾,应邀做了题为“细粒度家族:迈向更细、更深、更快的视觉感知”的大会特邀报告,首先阐释了“细粒度家族”的定义,涵盖类别、空间、时间三个感知维度,并分析现有大模型在每个维度上面临的挑战。针对上述挑战,进一步介绍了团队在基于细粒度树的分层图像分类、多模态大模型细粒度视觉感知、细粒度图像token剪枝、细粒度美学照片重构、细粒度动作质量评价等方面的最新研究进展。最后介绍了团队在细粒度视觉内容理解与生成技术上的落地应用。
彭宇新教授应邀在专题论坛中做题为“细粒度多模态大模型”的专题报告,介绍近年来“细粒度多模态大模型”主要研究进展,包括细粒度图像分类大模型、空间推理与占用预测、美学理解、细粒度运动分析等方法与技术。报告深入剖析了上述技术的优势、局限及典型应用场景,并立足前沿,对细粒度多模态大模型的未来发展趋势进行了前瞻性展望。
本次大会,MIPL有1篇论文接收进行墙报展示,论文信息如下:
Zijun Geng, Zijun Deng and Yuxin Peng*, "PBench: A Multi-Dimensional Benchmark for Evaluating Instruction Following and Information Expression in Poster Generation", China Multimedia (ChinaMM), Taiyuan, Shanxi, China, Jul.30 - Aug.1, 2026.
该论文针对现有文生图评测方法难以全面衡量海报的信息传达与设计功能问题,提出面向生成海报的多维评测基准PBench:从指令遵循和信息表达两个互补视角,将海报生成能力细分为主题、风格、文本内容与颜色、视觉元素及布局、文本可读性与显著性、图文一致性和视觉注意力引导等13个维度,并依托995个测试样本,在不依赖单一总分的前提下提供细粒度评价,实验表明当前模型在文本控制与信息表达上仍存明显不足,为设计导向的生成研究提供可靠评估。
