ECCV 2026 - Day 3

2026年9月11日,第19届欧洲计算机视觉大会(European Conference on Computer Vision, ECCV 2026)主会继续在瑞典马尔默举行。当天会议的重要活动之一是 Yann LeCun 以 “World Models: Enabling the Next AI Revolution” 为题作大会主题报告,从智能的本质、当前人工智能系统的局限、世界模型以及面向真实环境的自主智能等方面,分享了其对于下一阶段人工智能发展的思考。

Yann LeCun作“World Models: Enabling the Next AI Revolution”主题报告

报告首先从“什么是智能”这一基本问题展开。Yann LeCun指出,智能并不简单等同于知识和技能的积累,更重要的是系统能否在面对新的、此前未经历的情境时,利用已有经验进行理解、推理并采取适当行动。他将人类和动物所具有的快速学习能力、物理常识以及在极少示例甚至零示例条件下处理新问题的能力,与当前人工智能系统进行了对比,认为现有模型距离真正能够理解和适应现实世界的智能仍有明显距离。

这一观点进一步延伸到现实世界数据本身的复杂性。与语言等离散符号序列相比,真实环境由连续、高维且充满不确定性的视觉、运动和物理信号构成。人类和动物能够通过观察环境以及与环境交互逐渐形成对空间、物体、运动和因果关系的理解,而当前许多人工智能系统仍然高度依赖大规模监督、模仿数据或任务特定训练。Yann LeCun认为,要进一步迈向更加通用的机器智能,仅依赖语言建模远远不够,人工智能系统需要形成能够预测真实世界演化规律的内部表示,即世界模型。这一核心思想也与他此前对世界模型的阐述一致,即通过学习环境内部状态及其变化规律,使系统能够根据不同动作推测未来可能发生的结果。

Yann LeCun分享智能与真实世界学习问题

围绕这一目标,报告重点介绍了 Joint-Embedding Predictive Architecture(JEPA) 以及面向视频理解和规划的 V-JEPA 2。与直接生成或重建输入信号不同,JEPA的核心思想是在表征空间中预测重要信息,使模型更加关注场景中具有语义意义和可预测性的结构,而不是试图精确恢复每一个像素。这种方式希望通过大量未标注视觉数据学习关于物体、运动和环境动态的抽象表示,并进一步将感知与规划连接起来。

在报告展示的V-JEPA 2框架中,视频不仅被作为视觉识别的数据来源,也被视为学习物理世界规律的重要载体。模型通过对视频中的空间和时间变化进行自监督学习,逐步形成对于环境动态的内部表示,并利用这种表示进行预测与规划。这一思路反映出视觉研究正在从传统的“识别图像中有什么”,进一步走向“理解世界如何变化,以及采取某个动作之后会发生什么”。

V-JEPA 2用于视频理解与规划的报告内容

报告最后,Yann LeCun还提出了一系列具有鲜明个人立场的研究建议,包括更加关注联合嵌入式架构、能量模型和基于世界模型的预测控制,并对当前生成式模型、概率模型、强化学习以及单纯依赖大语言模型通向人类级智能的路线表达了不同看法。从现场展示的最后一页可以看到,他甚至提出,如果研究目标是真正的人类级人工智能,应当将更多注意力转向对真实世界进行感知、预测和规划的模型,而不是局限于语言模型本身。

Yann LeCun结尾抛出个人主张并回答观众提问

这些观点并不代表人工智能领域已经形成统一共识,但其所提出的核心问题具有重要启发意义:下一代人工智能是否需要从以数据相关性为核心的模式学习,进一步转向能够构建环境表征、理解物理规律并主动规划行为的世界模型? 从本届ECCV大量关于World Model、Embodied AI、Vision-Language-Action以及机器人学习的研究也可以看到,如何连接视觉感知、环境理解与自主行动,正在成为计算机视觉领域的重要研究方向。ECCV 2026录用论文中同样包含大量世界模型、具身智能和自主驾驶相关研究。

当天晚间,大会还安排了面向参会人员的交流活动。来自不同高校、研究机构和企业的研究人员在相对轻松的环境中继续进行交流与讨论,为不同研究方向和团队之间建立联系提供了机会。ECCV 2026的完整注册也包含大会期间的招待交流活动,其中9月11日安排了Conference Reception相关活动。

ECCV 2026晚宴及参会人员交流现场

晚宴期间,现场还邀请乐队进行演出,随着音乐和现场气氛逐渐活跃,参会人员在一天紧凑的学术活动之后进行了更加轻松的互动交流。学术会议不仅为研究人员提供论文展示和技术讨论的平台,这类非正式交流活动同样为来自不同国家和研究机构的学者建立联系、了解彼此研究方向提供了机会。

晚宴乐队演出及现场交流活动

总体来看,ECCV 2026主会第二天围绕世界模型与下一代人工智能展开了更加深入的讨论。Yann LeCun的主题报告将问题从单一计算机视觉任务进一步提升到机器如何理解、预测并与真实世界交互这一更基础的层面。从JEPA和V-JEPA 2所体现的自监督视觉表征,到基于世界模型进行预测与规划的研究路线,都展现了视觉研究与具身智能、自主智能之间日益紧密的联系。