发布日期:2026-06-04
6月1日,天津大学医疗机器人与智能系统研究院开展2026年第十二期研究生阅读报告分享会,5名研究生依次进行了阅读报告分享。
研究院2023级博士研究生陈子昂围绕《面向微创手术机器人的术中异常检测算法研究》展开分享。针对医学图像中病灶定位、组织密度比较、解剖结构判断等任务高度依赖视觉证据,而中间区域标注昂贵且难以规模化的矛盾,清华大学、阿里巴巴达摩院、湖畔实验室、浙江大学等单位合作提出了MedVR框架。
MedVR将医学VLM建模为可调用图像工具的强化学习智能体,使其在推理过程中交替进行文本思考和图像操作。其核心机制包括EVR和CCA:EVR利用模型生成工具调用时的 token熵识别不确定位置,并在高不确定节点分叉探索多个候选区域;CCA聚合成功推理轨迹中的共识区域,生成无需人工标注的伪监督信号,从而对有效视觉工具调用进行信用分配。实验表明,MedVR在多个医学VQA基准上取得领先表现,在OmniMedVQA、VQA-RAD、SLAKE、PathVQA等任务中展现出较强性能与跨域泛化能力。消融实验进一步证明,单纯加入Zoom-in工具并不足以提升效果,EVR与CCA的协同才是关键。该工作的重要启示在于,医学多模态推理不能只依赖语言链条,而应转向“证据行动链条”,让模型在不确定时主动取证,并通过可验证结果学习更可靠的视觉推理策略。

研究院2024级博士研究生张冰聪分享了论文《LapSurgie: humanoid robots performing surgery via teleoperated handheld laparoscopy》。由于传统手术机器人价格高昂且依赖专门改造的基础设施,难以在低资源地区普及,美国加州大学研究团队转而探索能直接适应人类工作环境的人形机器人并取得突破性的研究成果,提出了首个基于人形机器人的腹腔镜手术远程操作框架“LapSurgie”。
在该系统中,医生通过立体视觉控制台远程操作,系统利用逆向映射控制策略和远程运动中心(RCM)约束,使机器人能精准控制常规的手动腕式腹腔镜器械。针对14名参与者的对比实验表明,人形机器人平台的操作准确率与行业标杆dVRK系统相当,显著优于传统手动操作,专业医生甚至在该平台上取得了最低的错误率,并大幅降低了操作者的体力和认知负担。尽管因硬件和控制复杂度导致手术耗时目前仍长于dVRK,但本研究已初步证实了人形机器人执行高精度微创手术的可行性,未来有望为扩大高质量机器人医疗服务的普及范围提供一种灵活、低成本的解决方案。

研究院2024级硕士研究生李玉龙进行了题为《踝关节镜跨模态影像定位导航研究》的报告分享。在踝关节镜相关研究中,患者足踝表面可提供整体实时三维姿态,关节镜视频可呈现关键部位实时细节,CT/MRI可提供完整解剖结构。三类信息的跨模态融合,有助于提升术中整体感知能力,提高手术效率,并降低学习成本。
目前,研究系统主要包括术前患者特异性CT重建与分析、术中实时双目视觉跟踪系统、踝关节镜下语义与阶段识别,同时引入基于个体解剖学的踝关节旋转轴约束,以提升术中姿态估计稳定性。在术中跟踪方面,研究构建了足踝关键点、关节镜标记、双目相机和数字孪生空间之间的同步映射方案,并开展Ankle-Pose网络研究。初步结果显示,该方法在关键点定位和轻量化部署方面具备较好潜力,可为虚拟骨骼运动驱动和术中可视化辅助提供基础。在语义与阶段识别方面,以距骨软骨清理+微骨折术为切入场景,与医学专家共同定义观察、探查、清理、微骨折、后处理五个阶段,并基于近20例镜下手术记录开展初步实验,为后续研究提供数据支撑。

研究院2024级硕士研究生魏鹏飞分享了论文《LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment》。文章提出了一种名为LIDEA的人到机器人模仿学习框架,旨在解决机器人学习中数据稀缺的问题,让机器人能够直接从海量的人类视频中高效学习。LIDEA设计了双阶段的传递性特征蒸馏管道,通过“人类到伪机器人”以及“伪机器人到真实机器人”的两步蒸馏,模型成功将人类和机器人的视觉特征映射到了一个共享的潜在空间中,实现了视觉语义级别的等效对齐。
为了防止不同形态的几何体干扰机器人的深度感知,LIDEA采用了一种与形态无关的“过滤与填充”机制,可直接从观测点云中剔除人手或机械臂的专属几何特征,并在场景中统一填入虚拟夹爪作为交互代理,有效避免了直接混合数据带来的负迁移。在真实世界的机械臂操作任务中,利用LIDEA框架,人类演示数据能够成功替代高达80%的昂贵机器人数据,极大地提升了数据利用效率。此外,借助人类视频中极其丰富的交互模式,该策略在面对未见过的物体和强烈的视觉干扰时,展现出了远超纯机器人数据训练的分布外(OOD)泛化鲁棒性,为低成本、大规模的通用机器人学习提供了极具价值的解决方案。

研究院2024级硕士研究生魏少昂围绕《基于多边交互增强图卷积网络的脉络膜新生血管分割》进行报告分享。湿性年龄相关性黄斑变性(AMD)是导致视力丧失的重要原因,准确提取CNV病灶对疾病诊断和疗效评估至关重要。针对现有分割方法在多设备数据下泛化能力不足的问题,相关研究团队提出了MTG-Net的深度学习模型,实现了对CNV区域和血管结构的精准双重分割。
在四种OCTA设备混合的数据集中进行实验的结果显示,MTG-Net的区域和血管分割Dice分数均优于现有主流方法,证明了其在复杂多源数据下的高精度。采用“三设备训练、一设备测试”的策略进行跨设备验证时,模型在面对全新、未见过的设备数据时依然表现优异,具备极强的跨设备泛化能力。在临床应用层面,MTG-Net能将分割结果转化为病灶面积、血管密度和无血管区域面积等关键量化指标。对26例患者抗VEGF治疗前后的对比分析显示,指标存在显著的统计学差异,且变化趋势与临床影像观察到的病灶改善情况高度一致。总体而言,该研究不仅在算法上兼顾了高精度与强泛化性,更重要的是将人工智能技术转化成了实用的临床工具,为湿性AMD的病情随访和抗VEGF疗效评估提供了客观、可靠的定量依据。

文献来源:
[1]Jiang Z, Guo H, Fang C, et al. Medvr: Annotation-free medical visual reasoning via agentic reinforcement learning[J]. arXiv preprint arXiv:2604.08203, 2026.
[2]Liang Z, Liang X, Atar S, et al. LapSurgie: humanoid robots performing surgery via teleoperated handheld laparoscopy[J]. arXiv preprint arXiv:2510.03529, 2025.
[3]Jialun Li, Long Bai, Xiaoxiao Yang, and Hongliang Ren. Next-generation surgical navigation: Marker-less multi-view 6DoF pose estimation of surgical instruments. IEEE Transactions on Medical Imaging, 43(5):1842–1853, 2024.
[4]Xu Y, Lin B, Zhan X, et al. LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment[J]. arXiv preprint arXiv:2604.10677, 2026.
[5]Chen T, Zhang D, Chen D, et al. Neovascularization Segmentation via a Multilateral Interaction-Enhanced Graph Convolutional Network[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025.