自适应查询Transformer用于3D实例分割
原文:AQ3D: Adaptive Query Transformer for 3D Instance Segmentation
基于 Transformer 的 3D 实例分割解码器通常采用固定的查询数量,以及基于训练分布而非当前场景校准的位置建模。室内扫描在空间范围和物体数量上差异巨大,因此固定的查询集合在小型场景中会过度初始化,在大型场景中则会初始化不足,而学习到的绝对和相对位置编码受限于训练场景的范围并可能饱和。我们提出 AQ3D,旨在在训练和推理阶段处理各种规模的场景。查询按场景超点的固定比例实例化,形成一个超完备集合,其背景剔除完全交给解码器完成。位置信息使用量化度量坐标上的 3D RoPE 进行编码,取代了以往解码器中学习到的有界查找表。此外,我们通过基于归因的超点池化、掩码细化分支和用于背景剔除的余弦分类器来改进解码器本身。实验表明,在 ScanNetV2、ScanNet200 和 ScanNet++V2 数据集的验证集和隐藏测试集上,在未使用额外数据增强训练的解码器方法中,我们的方法创造了新的最先进纪录。代码已发布于 github.com/kenomo/aq3d。