ECCV 2026 - Day 2

2026年9月10日,第19届欧洲计算机视觉大会(European Conference on Computer Vision, ECCV 2026)进入主会阶段。当天会议正式开启 Main Conference 与 Expo,包括开幕式、Spotlight、Poster、Demo以及企业展览等多个环节,来自世界各地的研究人员围绕视觉基础模型、多模态学习、三维视觉、具身智能以及生成式人工智能等前沿方向展开交流。

ECCV 2026主会开幕式现场

ECCV 2026开幕式回顾了ECCV的发展历程以及本届会议的整体安排,并介绍了大会主题报告、论文展示和学术交流活动。本届ECCV再次来到瑞典举办,也吸引了来自高校、科研机构和产业界的大量研究人员参会。从现场交流可以明显感受到,随着视觉基础模型和视觉—语言模型快速发展,计算机视觉研究正在进一步由传统的单任务感知向开放世界理解、跨模态推理以及能够与真实环境交互的智能系统拓展。

ECCV 2026论文投稿与录用情况介绍

开幕式后开始了以视觉—语言模型和基础模型为代表的Spotlight报告。其中,Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations 聚焦Vision-Language-Action(VLA)模型在机器人任务中的高效适配问题。现有VLA模型在面对不同机器人本体、环境条件以及空间关系时通常需要重新微调,而传统参数高效微调方法往往对不同任务采用相似的参数更新方式。该工作提出了一种基于mechanistic interpretability(机制可解释性)的Robotic Steering方法,通过少量示例识别与特定任务相关的注意力头,仅对这些关键表示进行选择性调整,从而在降低微调成本的同时提升模型在不同任务变化下的鲁棒性和可解释性。

Vision-Language-Action模型Spotlight报告现场

当天的Spotlight中还展示了 CFM: Language-aligned Concept Foundation Model for Vision。该工作针对当前视觉基础模型内部表示难以解释的问题,将模型视觉特征映射为具有语义意义且能够进行空间定位的概念表示,并进一步建立概念之间由粗到细的层级关系,使模型能够针对分类、开放词汇分割以及图像描述等不同任务提供更直观的概念级解释。

除Spotlight外,当天还开始了大规模Poster Session。现场展示的研究涵盖视觉—语言模型、三维重建、Gaussian Splatting、多模态推理、机器人视觉、可信人工智能等多个方向,参会者围绕模型设计、实验设置以及潜在应用进行了深入交流。ECCV官方公开的论文列表也显示,本届会议在Vision-Language Models & Foundation Models、3D Vision等方向设置了大量Poster和Spotlight工作,反映出多模态基础模型与三维视觉仍是当前计算机视觉领域的重要研究热点。

ECCV 2026 第一天 Poster Session现场

会议展区同时设置了多种互动式Demo。其中一个现场演示设计了类似“夺取金牌”的互动任务:参与者需要在不触发警报的情况下取走目标金牌,成功完成挑战后即可获得一枚纪念金牌作为奖励。相比传统的论文和海报展示,这类互动Demo将视觉感知技术与真实交互场景结合,使参会者能够更加直观地体验计算机视觉系统在实际环境中的工作方式,也进一步增强了主会期间学术研究与实际应用之间的互动。