
ECCV 2026 - Day 4
2026年9月12日,第19届欧洲计算机视觉大会(European Conference on Computer Vision, ECCV 2026)迎来最后一天。当天除参加多场 Oral Presentation 外,兰天中还在 Poster Session 中展示并介绍了实验室本届ECCV录用工作,与来自不同高校和科研机构的研究人员围绕医学影像分析、混合监督学习以及三维视觉等方向进行了现场交流。
本次展示的论文题为 “Wavelet-Driven Cross-Domain Consistency for Mixed-Supervised 3D Tumor Segmentation”。该工作面向三维医学图像分割中高质量体素级标注成本较高的问题,探索不同监督形式下的数据协同学习,通过引入小波域信息和跨域一致性约束,提高模型对不同数据分布和监督条件的适应能力。在Poster交流过程中,兰天中向参会研究者介绍了工作的研究动机、方法设计和实验结果,并就混合监督学习、跨域泛化以及医学图像分割中的实际问题进行了进一步讨论。

当天的Oral Presentation涵盖图像生成、三维视觉和几何建模等多个方向。其中,MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation 探索了如何将Masked Image Modeling(MIM)与Normalizing Flows(NF)统一到端到端生成框架中。传统Normalizing Flow由于严格的可逆性约束,容易将较多模型容量用于低层像素细节,而不利于学习更高层的语义结构。MIMFlow通过从掩码图像中学习具有语义信息的潜在表示,使Normalizing Flow主要负责较低频的语义流形建模,而解码器承担高频图像细节的恢复,从而将视觉表征学习与生成建模更加紧密地结合起来。该工作在ImageNet图像生成任务中展示了较好的生成性能和表示学习能力。

另一项值得关注的Oral工作是 “Geometric Latent Diffusion: Repurposing Geometric Foundation Models for Multi-view Diffusion”。与传统在VAE潜空间中进行扩散建模的方法不同,该工作尝试直接利用几何基础模型已经学习到的特征空间作为多视图扩散模型的潜在表示,使生成模型天然获得更强的跨视角几何对应关系。方法面向新视角合成任务,在生成RGB图像的同时还能够利用已有几何表示恢复深度图和三维点云,并在无需依赖预训练文生图模型的情况下实现多视图生成。

从当天的报告可以看到,当前计算机视觉研究中的“基础表示”正在承担越来越重要的角色。无论是MIMFlow利用掩码图像建模提升生成模型的语义表征能力,还是Geometric Latent Diffusion将几何基础模型的特征空间直接用于多视图生成,其共同思路都不再局限于为单一任务设计独立网络,而是希望首先学习具有更强结构性和迁移能力的中间表示,再将其应用于生成、重建和三维理解等不同任务。这也与本届ECCV中基础模型、多模态学习、世界模型和三维视觉等方向的活跃发展呼应。
随着当天学术活动结束,兰天中完成了本次ECCV 2026的参会交流。本次会议覆盖了医学视觉、视觉基础模型、生成式人工智能、世界模型和具身智能等多个研究方向。通过连续多日的学术报告、论文展示和现场交流,兰天中进一步了解了计算机视觉领域的最新研究趋势,同时也向国内外同行介绍了实验室在三维医学影像分析方面的研究成果,为后续开展相关研究和学术合作提供了新的思路与机遇。