高级搜索

留言板

尊敬的读者、作者、审稿人, 关于本刊的投稿、审稿、编辑和出版的任何问题, 您可以本页添加留言。我们将尽快给您答复。谢谢您的支持!

姓名
邮箱
手机号码
标题
留言内容
验证码

面向抓斗轨迹稳定提取的空间与时序协同优化方法

陈晓玉 张凤卓 陈杨 刘文远 孔德明

陈晓玉, 张凤卓, 陈杨, 刘文远, 孔德明. 面向抓斗轨迹稳定提取的空间与时序协同优化方法[J]. 电子与信息学报. doi: 10.11999/JEIT260512
引用本文: 陈晓玉, 张凤卓, 陈杨, 刘文远, 孔德明. 面向抓斗轨迹稳定提取的空间与时序协同优化方法[J]. 电子与信息学报. doi: 10.11999/JEIT260512
CHEN Xiaoyu, ZHANG Fengzhuo, CHEN Yang, LIU Wenyuan, KONG Deming. A Spatial-Temporal Collaborative Optimization Method for Stable Grab Trajectory Extraction[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260512
Citation: CHEN Xiaoyu, ZHANG Fengzhuo, CHEN Yang, LIU Wenyuan, KONG Deming. A Spatial-Temporal Collaborative Optimization Method for Stable Grab Trajectory Extraction[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260512

面向抓斗轨迹稳定提取的空间与时序协同优化方法

doi: 10.11999/JEIT260512 cstr: 32379.14.JEIT260512
基金项目: 河北省自然科学基金资助项目(No.F2025203055)
详细信息
    作者简介:

    陈晓玉:女,副教授,研究方向为信号设计与计算机视觉

    张凤卓:女,硕士生,研究方向为计算机视觉、视频目标分割

    陈杨:男,高级工程师,研究方向为港口机械与智能化装备技术研发及工程管理

    刘文远:男,教授,研究方向为计算机图形学、人工智能

    孔德明:男,教授,研究方向为计算机视觉、目标跟踪

    通讯作者:

    孔德明 demingkong@ysu.edu.cn

  • 中图分类号: TN911.73; TP391.41

A Spatial-Temporal Collaborative Optimization Method for Stable Grab Trajectory Extraction

Funds: The Natural Science Foundation of Hebei Province (No.F2025203055)
  • 摘要: 在港口散货装卸作业中,抓斗作为门座式起重机的关键执行部件,其连续轨迹提取易受尺度变化、局部遮挡、边界退化和帧间形态波动等因素影响。为此,该文提出一种面向抓斗轨迹稳定提取的空间与时序协同优化方法。该方法从空间表征增强与时序一致性约束两个层面展开:前者通过多尺度特征交互和边界细节增强,提高复杂背景与遮挡条件下抓斗区域的分割完整性;后者在分割表征层引入时序一致性约束,减弱局部误分、边界波动和短时漏检对轨迹连续性的影响,并通过联合优化目标实现端到端训练。实验结果表明,该方法在DAVIS2016、SegTrackV2和实际门座式起重机抓斗数据集上均表现出较优综合性能,其中在DAVIS2016上区域相似度J和轮廓精度F分别达到74.79%和74.70%,在实际抓斗数据集上平均绝对误差MAE和均方根误差RMSE较YOLOv8-seg分别下降约55.3%和52.6%,漏检率Miss rate由2.95%降至0.56%。遮挡实验进一步表明,该方法能够减弱轨迹抖动与短时中断,在复杂港口作业场景下具有较强的连续目标提取能力。同时,改进后模型推理速度保持在33fps以上,具备实时应用潜力。
  • 图  1  方法整体框架图

    图  2  分割定性对比结果图

    图  3  轨迹误差分布箱线图

    图  4  遮挡实验对比结果图

    图  5  遮挡实验折线图

    表  1  抓斗数据集分割性能对比实验结果(%)

    方法JFMask mAP50-95
    YOLOv8-seg89.4597.8388.24
    YOLO11-seg84.6393.6185.85
    YOLO12-seg84.8494.1485.73
    YOLO26-seg78.5887.2286.01
    本文方法90.0598.5688.54
    下载: 导出CSV

    表  2  公开数据集分割性能对比实验结果(%)

    方法DAVIS2016数据集SegTrackV2数据集
    JFMask mAP50-95JFMask mAP50-95
    YOLOv8-seg69.3869.0547.5447.5353.4482.23
    YOLO11-seg64.4062.5128.3945.5851.3076.14
    YOLO12-seg69.8568.0731.1645.1650.1176.37
    YOLO26-seg64.8063.8427.7441.5146.8273.86
    本文方法74.7974.7051.2147.6553.4882.10
    下载: 导出CSV

    表  3  模型复杂度比较

    方法Params(M)FPSInference Time(ms)
    YOLOv8-seg11.790535.8027.93
    YOLO11-seg2.842842.7823.38
    YOLO12-seg2.821037.0926.96
    YOLO26-seg3.053135.9127.84
    本文方法11.837833.2430.08
    下载: 导出CSV

    表  4  DAVIS2016数据集轨迹稳定性对比实验结果

    方法 MAE
    (pixel)
    RMSE
    (pixel)
    Mean jitter
    (pixel)
    Miss rate
    (%)
    YOLOv8-seg 38.43 56.58 37.59 7.87
    YOLO11-seg 61.75 82.17 46.96 6.54
    YOLO12-seg 37.38 55.03 31.93 7.73
    YOLO26-seg 50.49 77.23 57.97 9.58
    本文方法 32.11 49.26 31.04 4.05
    下载: 导出CSV

    表  5  抓斗数据集轨迹稳定性对比实验结果

    方法 MAE
    (pixel)
    RMSE
    (pixel)
    Mean jitter
    (pixel)
    Miss rate
    (%)
    YOLOv8-seg 6.74 7.13 1.66 2.95
    YOLO11-seg 7.20 7.88 3.82 13.74
    YOLO12-seg 14.81 16.04 3.02 7.73
    YOLO26-seg 9.50 11.42 8.99 18.19
    本文方法 3.01 3.38 1.52 0.56
    下载: 导出CSV

    表  6  抓斗数据集遮挡鲁棒性总体对比实验结果

    方法J(%)F(%)MAE(pixel)RMSE(pixel)Miss rate(%)Max consecutive miss (frames)
    YOLOv8-seg61.6770.2236.38156.4122.9552
    YOLO11-seg43.8051.3448.26133.6537.0085
    YOLO12-seg48.4056.5974.97185.7526.1056
    YOLO26-seg57.1064.8732.19102.4228.0287
    本文方法63.5172.4233.28102.3817.5447
    下载: 导出CSV

    表  7  抓斗数据集消融实验结果

    BaselineSRETCONSJ(%)F(%)MAE(pixel)RMSE(pixel)Miss rate(%)Mask mAP50-95(%)
    89.4597.836.747.132.9588.24
    89.4997.815.335.433.6788.40
    89.3997.785.335.762.8988.43
    90.0598.563.013.380.5688.54
    下载: 导出CSV

    表  8  TCONS关键参数敏感性实验结果

    参数取值J(%)F(%)MAE(pixel)RMSE(pixel)Miss rate(%)
    $ {\lambda }_{\text{tcons}} $0.289.5397.803.023.101.11
    0.390.0598.563.013.380.56
    0.489.9198.074.174.350.67
    $ \gamma $0.689.9098.223.163.530.89
    0.790.0598.563.013.380.56
    0.889.7097.953.063.431.00
    $ {E}_{\text{w}} $089.3997.793.023.391.34
    590.0598.563.013.380.56
    1089.0097.593.824.191.22
    $ G $3090.0898.413.754.120.56
    5090.0598.563.013.380.56
    7090.1098.443.133.500.56
    下载: 导出CSV
  • [1] HE Kaiming, GKIOXARI G, DOLLÁR P, et al. Mask R-CNN[C]. Proceedings of the 2017 IEEE International Conference on Computer Vision, Venice, Italy, 2017: 2980–2988. doi: 10.1109/ICCV.2017.322.
    [2] CAELLES S, MANINIS K K, PONT-TUSET J, et al. One-shot video object segmentation[C]. Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2017: 5320–5329. doi: 10.1109/CVPR.2017.565.
    [3] OH S W, LEE J Y, XU Ning, et al. Video object segmentation using space-time memory networks[C]. Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision, Seoul, Korea (South), 2019: 9225–9234. doi: 10.1109/ICCV.2019.00932.
    [4] CHENG H K and SCHWING A G. XMem: Long-term video object segmentation with an Atkinson-Shiffrin memory model[C]. 17th European Conference on Computer Vision – ECCV 2022, Tel Aviv, Israel, 2022: 640–658. doi: 10.1007/978-3-031-19815-1_37.
    [5] MONNIER Q, POULI T, and KPALMA K. Survey on fast dense video segmentation techniques[J]. Computer Vision and Image Understanding, 2024, 241: 103959. doi: 10.1016/j.cviu.2024.103959.
    [6] XU Guoping, UDUPA J K, YU Yajun, et al. Segment anything for video: A comprehensive review of video object segmentation and tracking from past to future[J]. Neurocomputing, 2026, 682: 133439. doi: 10.1016/j.neucom.2026.133439.
    [7] HOU Zhiqiang, LI Fucheng, DONG Jiale, et al. Video object segmentation based on dynamic perception update and feature fusion[J]. Image and Vision Computing, 2024, 150: 105156. doi: 10.1016/j.imavis.2024.105156.
    [8] WANG Jingxin, ZHANG Yunfeng, BAO Fangxun, et al. Video object segmentation by multi-scale attention using bidirectional strategy[J]. Image and Vision Computing, 2024, 148: 105136. doi: 10.1016/j.imavis.2024.105136.
    [9] KIM J, KIM J, and HONG S. G-TRACE: Grouped temporal recalibration for video object segmentation[J]. Image and Vision Computing, 2024, 147: 105050. doi: 10.1016/j.imavis.2024.105050.
    [10] HOU Zhiqiang, WANG Chenxu, MA Sugang, et al. Lightweight video object segmentation: Integrating online knowledge distillation for fast segmentation[J]. Knowledge-Based Systems, 2025, 308: 112759. doi: 10.1016/j.knosys.2024.112759.
    [11] LIU Yong, YU Ran, YIN Fei, et al. Learning high-quality dynamic memory for video object segmentation[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47(5): 3452–3468. doi: 10.1109/TPAMI.2025.3532306.
    [12] SUN Maojin and SUN Minghui. STSim-Mamb: A spatiotemporal similarity learning framework for unsupervised video object segmentation[J]. Image and Vision Computing, 2026, 169: 105945. doi: 10.1016/j.imavis.2026.105945.
    [13] KAZEMI E S, TOUBAL I E, RAHMON G, et al. Domain generalization for multiple video object segmentation and tracking using transformers and smart memory[J]. International Journal of Computer Vision, 2026, 134(5): 206. doi: 10.1007/s11263-026-02742-1.
    [14] LU Hannan, TIAN Zhi, WEI Pengxu, et al. Integrating instance-level knowledge to see the unseen: A two-stream network for video object segmentation[J]. Neurocomputing, 2024, 602: 127878. doi: 10.1016/j.neucom.2024.127878.
    [15] 侯志强, 董佳乐, 马素刚, 等. 基于多尺度特征增强与全局-局部特征聚合的视频目标分割算法[J]. 电子与信息学报, 2024, 46(11): 4198–4207. doi: 10.11999/JEIT231394.

    HOU Zhiqiang, DONG Jiale, MA Sugang, et al. Video object segmentation algorithm based on multi-scale feature enhancement and global-local feature aggregation[J]. Journal of Electronics & Information Technology, 2024, 46(11): 4198–4207. doi: 10.11999/JEIT231394.
    [16] 陈雷, 杨吉斌, 曹铁勇, 等. 一种基于Transformer特征金字塔的自蒸馏目标分割方法[J]. 电子与信息学报, 2025, 47(2): 551–560. doi: 10.11999/JEIT240735.

    CHEN Lei, YANG Jibin, CAO Tieyong, et al. A self-distillation object segmentation method based on Transformer feature pyramid[J]. Journal of Electronics & Information Technology, 2025, 47(2): 551–560. doi: 10.11999/JEIT240735.
    [17] WOO S, PARK J, LEE J Y, et al. CBAM: Convolutional block attention module[C]. 15th European Conference on Computer Vision – ECCV 2018, Munich, Germany, 2018: 3–19. doi: 10.1007/978-3-030-01234-2_1.
    [18] LIN T Y, DOLLÁR P, GIRSHICK R, et al. Feature pyramid networks for object detection[C]. Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2017: 936–944. doi: 10.1109/CVPR.2017.106.
    [19] LIU Shu, QI Lu, QIN Haifang, et al. Path aggregation network for instance segmentation[C]. Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, Salt Lake City, USA, 2018: 8759–8768. doi: 10.1109/CVPR.2018.00913.
    [20] 丁建睿, 张听, 刘家栋, 等. 融合邻域注意力和状态空间模型的医学视频分割算法[J]. 电子与信息学报, 2025, 47(5): 1582–1595. doi: 10.11999/JEIT240755.

    DING Jianrui, ZHANG Ting, LIU Jiadong, et al. Medical video segmentation algorithm integrating neighborhood attention and state space model[J]. Journal of Electronics & Information Technology, 2025, 47(5): 1582–1595. doi: 10.11999/JEIT240755.
    [21] LI Jun, SUN Lijuan, REN Hengyi, et al. Learning effective feature representation for video object segmentation via memory[J]. Knowledge-Based Systems, 2024, 299: 112020. doi: 10.1016/j.knosys.2024.112020.
    [22] WANG Hui, ZHAO Yuqian, ZHANG Fan, et al. Multi-scale spatio-temporal memory network for semi-supervised video object segmentation[J]. Neurocomputing, 2025, 642: 130487. doi: 10.1016/j.neucom.2025.130487.
    [23] MIAO Bo, BENNAMOUN M, GAO Yongsheng, et al. Temporally consistent referring video object segmentation with hybrid memory[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2024, 34(11): 11373–11385. doi: 10.1109/TCSVT.2024.3419119.
    [24] HOU Zhiqiang, CUI Hao, WANG Chenxu, et al. Frequency-aware fusion for improved video object segmentation[J]. Neurocomputing, 2025, 656: 131585. doi: 10.1016/j.neucom.2025.131585.
    [25] PERAZZI F, PONT-TUSET J, MCWILLIAMS B, et al. A benchmark dataset and evaluation methodology for video object segmentation[C]. Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, USA, 2016: 724–732. doi: 10.1109/CVPR.2016.85.
    [26] LI Fuxin, KIM T, HUMAYUN A, et al. Video segmentation by tracking many figure-ground segments[C]. Proceedings of the 2013 IEEE International Conference on Computer Vision, Sydney, Australia, 2013: 2192–2199. doi: 10.1109/ICCV.2013.273.
  • 加载中
图(5) / 表(8)
计量
  • 文章访问数:  26
  • HTML全文浏览量:  25
  • PDF下载量:  3
  • 被引次数: 0
出版历程
  • 收稿日期:  2026-04-24
  • 修回日期:  2026-07-01
  • 录用日期:  2026-07-01
  • 网络出版日期:  2026-07-23

目录

    /

    返回文章
    返回