首页

新闻动态

当前位置: 首页 > 新闻动态 > 正文

我院科研团队在ECCV2026发表论文:提出类人直觉深度感知框架HIDA,攻克遮挡目标完整分割难题

作者:    来源:    发布时间:2026-08-06    点击量:

近日,农业农村部养殖装备重点实验室(以下简称“实验室”)传来喜讯:团队在第19届欧洲计算机视觉国际会议(European Conference on Computer Vision, ECCV 2026)上发表题为《HIDA: A Human-Intuition-Guided Depth-Aware Framework for Zero-Shot Amodal Segmentation》的研究论文。该论文由伟德国际1946bv官网作为第一完成单位,标志着我校首次以第一单位身份在计算机视觉领域顶级国际会议上亮相,实现了历史性跨越。

直面视觉“盲区”:让机器学会“脑补”遮挡之物

在现实图像中,目标物体常被其他物体遮挡,传统分割模型仅能识别其可见部分。而非模态分割(Amodal Segmentation)则更进一步——它不仅定位可见区域,更力图推断被遮挡的完整轮廓,还原物体的“全貌”。这一能力对于智能养殖中的个体识别、行为分析,以及自动驾驶、机器人交互等场景均具有深远意义。

研究团队从人类视觉认知中汲取灵感:人即使只看到物体的局部,也能凭直觉补全其整体形状。基于此,团队创新性地提出了HIDA框架——一种直觉引导的零样本非模态分割方法。HIDA仅需目标可见边界框,即可预测完整掩膜,无需任何额外标注或训练样本,实现“零样本”泛化。

HIDA框架零样本非模态分割效果

HIDA框架的整体技术流程图


技术内核:双基础模型协同,轻量网络动态路由

HIDA的核心架构融合了两个冻结的视觉基础模型与一个轻量化的可训练分割网络。首先,基础模型分别生成目标可见区域先验和伪深度图,引导对目标中心的自适应裁剪,有效抑制背景噪声,强化遮挡边界特征。随后,在轻量Vision Transformer编码器中,独创性地引入具有遮挡感知能力的Token路由软混合专家模块(Token-Routing Soft MoE)。该模块综合利用伪深度信息、可见掩码边界和中间层视觉Token,构建空间路由信号,并通过Token级别的Softmax门控为多个轻量专家动态分配权重。得益于此,图像不同区域可根据局部遮挡程度和边界不确定性,自适应地选择最优特征表征路径,显著提升了模型对遮挡边界、不可见区域及复杂轮廓的建模精度。

实验结果显示,HIDA在COCOA-cls、KINS和D2SA三大非模态分割公开数据集上均表现卓越,无论在全监督还是零样本设置下,均达到当前最优性能,充分验证了该框架的鲁棒性与通用性。

ECCV与CVPR、ICCV并称计算机视觉领域“三大顶会”,每两年举办一届。本届ECCV 2026将于2026年9月8日至13日在瑞典马尔默举行,会议共收到有效投稿10,473篇,最终录用2,883篇,录用率为27.5%。

该论文的第一完成单位为伟德国际1946bv官网,实验室智能科学与技术专业博士研究生李鹏为第一作者,李泊副教授为通讯作者。共同作者包括同专业博士研究生王克林、北京交通大学博士研究生陈冰川、北京交通大学侯亚丽副教授,以及实验室沈明霞教授。

研究代码已开源,欢迎访问:https://github.com/lipenghuai/HIDA

此次ECCV论文的发表,是实验室在计算机视觉前沿研究领域的一次突破,同时也为遮挡场景下的养殖装备视觉感知积累了核心技术储备。未来,团队将深入探索类人视觉推理与农业生产链的衔接,着力推动农业领域智能技术的创新与落地。