2026年春季学期视觉计算实验室第3次论文研读预告

时间:2026年9月19日(周六) 09: 00

地点:望江校区基础教学楼B座318实验室

分享者:邓子祎、张晋博

Part1

分享者:邓子祎

分享内容

[1] Frederic Gmeiner, Nicolai Marquardt, Michael Bentley, Hugo Romat, Michel Pahud, David Brown, Asta Roseway, Nikolas Martelaro, Kenneth Holstein, Ken Hinckley, and Nathalie Riche. 2025. Intent Tagging: Exploring Micro-Prompting Interactions for Supporting Granular Human-GenAI Co-Creation Workflows. In Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems (CHI '25). Association for Computing Machinery, New York, NY, USA, Article 531, 1–31. https://doi.org/10.1145/3706598.3713861

论文简介

尽管生成式人工智能(GenAI)系统在提升内容创作方面具有潜力,用户仍常常难以将 GenAI 有效融入自身的创意工作流。其核心挑战包括AI 生成内容与用户意图之间的错位、用户不确定如何向 AI 系统恰当地表达自身意图,以及 AI 系统在支持多样化创意工作流方面灵活性不足。为应对这些挑战,本文开发了IntentTagger:一个引入“意图标签”概念的幻灯片创建系统。“意图标签”是封装用户意图的、原子化的小型意图单元,用于在人机 GenAI 协作工作流中探索细粒度、非线性的微提示交互。一项包含 12 名参与者的用户研究,对在不同模糊程度下灵活表达意图、元意图引出,以及基于意图标签的工作流的优势与挑战提供了见解。最后,本文讨论了更广泛的研究启示,以及面向 GenAI 支持的内容创作工作流的设计考量。

Part2

分享者:张晋博

分享内容

[1] Meng X, Wei S. General Incomplete Multimodal Learning via Dynamic Quality Perception[C]//Proceedings of the European Conference on Computer Vision (ECCV). 2026.

论文简介

针对模态缺失问题具有鲁棒性的多模态学习方法对于实际应用至关重要。现有方法主要关注跨模态缺失(即整个模态均缺失的情况),而忽视了模态内退化问题(即模态存在但严重受损的情况)。在实际应用中,这两类缺失现象往往同时存在,导致现有方法效果不佳。为解决这一局限性,本研究提出了一种名为“通用不完整多模态学习”(General Incomplete Multi-modal Learning,简称GIML)的统一框架,该框架通过动态质量感知机制同时处理跨模态缺失与模态内退化问题。具体而言,GIML将异构缺失模式建模为连续的模态信息退化过程,从而支持具备退化感知能力的自适应融合机制。为实现可靠的质量感知,引入了一种“噪声感知质量估计器”,该估计器通过受控的噪声注入方式学习从受损特征到噪声强度之间的映射关系。此外,本研究还提出了一种“噪声-语义解耦模块”,用于将语义信息与噪声干扰分离。这一设计提升了模型对未见损坏模式的鲁棒性与泛化能力。在涵盖多种模态类型的不同数据集上开展的大量实验,充分证明了GIML的有效性与普适性。