Advancing Volumetric Medical Image Segmentation via Global-Local Masked Autoencoders.
研究背景
深度学习用于医学图像分析多依赖监督学习和标注数据,但医学图像标注耗时费力。自监督学习(SSL)通过预训练未标注数据再微调标注数据成了解决方案。不过,现有基于掩码图像建模(MIM)的方法处理三维医学图像时,存在不能同时建模全局和局部解剖结构、忽略全局上下文与局部细节关联的问题。因此,本文提出全局 - 局部掩码自动编码器(GL - MAE)。
方法速览
GL - MAE主要方法包括:从输入体积图像中随机裁剪和下采样提取全局和局部视图;对视图应用掩码变换;用Vision Transformer(ViT)编码可见令牌,解码器重建掩码令牌;通过全局 - 全局和全局 - 局部一致性学习确保视图间一致性。
主要发现
- 协同重建提升建模:GL - MAE同时重建全局和局部视图,实现多级重建,增强模型对器官变化的鲁棒性。
- 一致性学习增强对齐:引入全局 - 全局和全局 - 局部一致性学习,加速训练收敛,提高模型整体表示能力。
- 下游任务表现优越:在多个主流公共数据集微调中,GL - MAE性能优于其他自监督算法,在多种分割和分类任务中显著提升性能。
- 标签效率学习出色:在有限标注数据下,GL - MAE仍能提高Dice分数,泛化和鲁棒性强。
- 泛化能力强大:在未参与预训练的数据集上表现出色,还能跨模态提升模型性能。
总结展望
GL - MAE通过全局和局部视图协同重建、全局引导一致性学习,在医学图像分割多个下游任务中表现优越,且有强大泛化能力。不过,该方法计算复杂,不同模态融合和数据依赖性问题待进一步研究。