时间:2026年09月12日(周六)上午09:00
地点:望江校区基础教学楼B座318实验室
分享者:朱陶涛、姚和
Part1
分享者:朱陶涛
分享内容:[1] Gao Y, Zhang Y, Wang C, et al. Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2026: 13744-13754.
基础模型通过从大规模未标记数据中学习通用表示,已经在视觉与自然语言领域实现了变革,但3D医学成像领域仍缺乏类似的方法。现有自监督方法依赖低级重建或对比目标,无法捕捉医学图像分析至关重要的解剖语义,限制了其向下游任务的迁移。本文提出掩码引导自监督学习(MASS)方法,将上下文内分割作为学习通用医学成像表示的预文本任务。该方法的核心洞见在于,自动生成的类别无关掩码可为学习语义丰富的表示提供充足的结构监督。通过对涵盖解剖结构与病理发现的数千种多样化掩码提案进行训练,该方法能够学习医学结构的语义定义:外观、形状、空间上下文及解剖关系的整体组合。作者在多种数据场景中验证了其有效性:从单个数据集的小规模预训练,到5000份CT、MRI及PET volumes的大规模多模态预训练,全程无需标注。MASS展现出以下性能:(1)针对新结构的少样本分割;(2)仅用20%至40%的标注数据即可达到全监督水平,且在低数据场景下Dice分数较自监督基线高出20以上;(3)对未知病理的冻结编码器分类性能,可与数千样本的全监督训练相媲美。掩码引导自监督预训练能够捕获广泛通用的知识,为无需专家标注的3D医学成像基础模型开辟了一条路径。

Part2
分享者:姚和
分享内容:[2] Cen, Jun, et al. "Worldvla: Towards autoregressive action world model." *arXiv preprint arXiv:2506.21539* (2025).
本研究提出了 WorldVLA, 一种自回归动作世界模型,其统一了动作与图像的理解及生成功能。该模型将视觉-语言-动作模型与世界模型融合于同一框架内。其中,世界模型借助动作和图像理解进行未来图像预测,旨在学习环境物理规律以优化动作生成;而动作模型则依据图像观测生成后续动作,辅助视觉理解,并由此促进世界模型的视觉生成效果。实验结果表明,WorldVLA 优于独立的动作模型和世界模型,体现了二者之间的互促关系。同时,研究还发现,动作模型在自回归生成动作序列时性能会下降,原因是其对动作预测的泛化能力有限,使得早期动作的误差沿序列向后传播。针对此问题,该研究提出了一种注意力掩码策略,即在生成当前动作时选择性遮蔽先前动作,该策略在动作块生成任务中显著提升了模型性能。
