多模态共享潜表示用于眼科手术相位识别
原文:Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery
手术阶段识别是玻璃体视网膜手术中实现情境感知的计算机辅助反馈的关键,然而同步多模态术中数据的稀缺,尤其是显微镜视图和术中OCT数据的稀缺,限制了那些旨在复现外科医生自然进行的多模态整合的方法。相比之下,手术旁白在网络上有大量可用资源,能提供丰富的语义监督。以往工作主要探索成对对比学习(如术中OCT-显微镜或显微镜-旁白),而对三种模态的联合建模基本未被研究。我们提出了一个框架,以显微镜视图作为共享锚点来桥接手术旁白和术中OCT(iOCT),无需完全同步的三模态数据集,并利用真实的显微镜-旁白视频以及同步显微镜视频与工具对齐iOCT配对的合成数据集。对比对齐将来自合成域的结构先验迁移到缺乏iOCT的真实视频上,并使用双头MS-TCN++整合所得嵌入,以进行宏阶段和微阶段的联合预测。在真实玻璃体视网膜手术上的评估显示,我们的框架将宏阶段识别性能相较于零样本基线有所提升(平均F1从0.38提高到0.53),并为估计仅凭真实显微镜视频无法直接观测的细粒度器械-组织测量提供了探索性路径;这些微阶段估计在合成数据上得到了定量验证,在真实手术上仅做了定性展示。据我们所知,这是首个将显微镜视图、iOCT B-scan和手术旁白统一到共享潜在空间中用于手术阶段识别的工作。