← 返回信息流
模型 arXiv 论文 · Onur Izmitlioglu, Shervin Dehghani, Tarek Ghannoum, Benedikt Schworm, Nassir Navab 2026-08-31 16:41 🔥 热度 3

面向玻璃体视网膜手术阶段识别的多模态共享潜在表示:旁白、显微镜与iOCT图像

多模态共享潜表示用于眼科手术相位识别

原文:Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery

手术阶段识别是玻璃体视网膜手术中实现情境感知的计算机辅助反馈的关键,然而同步多模态术中数据的稀缺,尤其是显微镜视图和术中OCT数据的稀缺,限制了那些旨在复现外科医生自然进行的多模态整合的方法。相比之下,手术旁白在网络上有大量可用资源,能提供丰富的语义监督。以往工作主要探索成对对比学习(如术中OCT-显微镜或显微镜-旁白),而对三种模态的联合建模基本未被研究。我们提出了一个框架,以显微镜视图作为共享锚点来桥接手术旁白和术中OCT(iOCT),无需完全同步的三模态数据集,并利用真实的显微镜-旁白视频以及同步显微镜视频与工具对齐iOCT配对的合成数据集。对比对齐将来自合成域的结构先验迁移到缺乏iOCT的真实视频上,并使用双头MS-TCN++整合所得嵌入,以进行宏阶段和微阶段的联合预测。在真实玻璃体视网膜手术上的评估显示,我们的框架将宏阶段识别性能相较于零样本基线有所提升(平均F1从0.38提高到0.53),并为估计仅凭真实显微镜视频无法直接观测的细粒度器械-组织测量提供了探索性路径;这些微阶段估计在合成数据上得到了定量验证,在真实手术上仅做了定性展示。据我们所知,这是首个将显微镜视图、iOCT B-scan和手术旁白统一到共享潜在空间中用于手术阶段识别的工作。

查看原文 ↗ 技术论文多模态

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 李飞飞发布:全球首个多模态世界模型 热度 9 【ComfyUI漫剧工作流】AI漫剧变天了!ComfyUI+Seedance2.5,手把手教你从0到1全流程自动化制作AI漫剧!稳定出片! 热度 9 【精翻】C4D 如何将 AI 模型转化为电影级 3D 动画 热度 9 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9