MOT Challenge

关注
义项:多目标跟踪评测基准

MOT Challenge是面向单摄像头多目标跟踪(Multiple Object Tracking, MOT)的标准化评测基准与竞赛平台, 于2014年底发布[1]。它向不同跟踪方法提供统一的地面真值、评测指标、脚本和预计算检测结果, 使各方法在相同条件下比较, 从而把跟踪器本身的性能与检测等其他因素分开[2]。基准以行人跟踪为主, 先后发布MOT15、MOT16、MOT17等版本[1], 已成为多行人跟踪的标准评测[3]。

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

MOT Challenge针对的是单摄像头多目标跟踪问题, 即在一段视频中同时定位多个目标, 并让每个目标的身份在整段视频中保持一致[1]。基准会给出每一帧的目标检测结果, 要求算法把不同帧中的检测关联到同一身份, 输出完整的目标轨迹[2]。评测主要使用MOTA(多目标跟踪精度)与IDF1(身份F1分数), 前者综合漏检、误检与身份切换等错误, 后者刻画身份保持的准确程度[4][5]。其中MOTA可写为 $MOTA = 1 - (Σ(FN + FP + IDSW)) / Σ GT$, 式中FN、FP、IDSW与GT分别对应漏检、误检、身份切换和真实目标的数量[6]。

背景

在MOT Challenge出现之前, 单摄像头多目标跟踪领域缺少统一的量化评测标准[2]。当时使用较多的PETS数据集在结果比较上存在困难: 研究者常只选取其中部分序列, 采用不同的检测输入与评测脚本, 不同方法的结果因此不易直接比较, 也容易产生过拟合[7]。PETS团队大约每年组织一次研讨会集中评测, 条件虽然一致, 但周期较长, 不利于在ICCV、CVPR等会议上及时使用[7]。MOT Challenge的提出正是为了收集已有与新数据, 建立标准化的多目标跟踪评测框架[1]。

内容

MOT Challenge由数据集、评测服务器和网站界面三部分组成, 面向所有人开放[7]。每个序列分为训练集和测试集: 训练集同时提供检测结果与地面真值, 用于调整算法; 测试集只提供检测结果, 算法结果提交后由服务器集中评测并公开[8]。基准以行人跟踪为核心, 因为行人是跟踪研究中被研究最多的对象, 相关应用从机器人导航延伸到自动驾驶[1]。它提供统一的标注、指标、脚本与预计算检测结果, 让各方法在相同条件下比较, 以隔离跟踪器本身的性能[2]。

首个版本于2014年10月发布, 包含11个训练序列和11个测试序列, 测试序列不对外公开, 并附有检测结果与评测脚本[9]。2016年发布的MOT16由14个更长、更拥挤的序列组成, 采用更严格的标注规则, 并给出每个目标的可见度[1][9]。2017年的MOT17沿用MOT16的视频序列, 提高了标注一致性, 并为每个序列提供DPM、Faster R-CNN和SDP三种检测结果, 使不同跟踪器在相同检测输入下比较[10]。此后基准又推出面向拥挤场景的MOT20等版本[11]。

评测结果以多个指标联合呈现, 除MOTA与IDF1外, 还包括MOTP、召回率、精确率、每帧误检数、假阳性、假阴性、真实轨迹数以及大部分跟踪(MT)等[5]。其中大部分跟踪指真实轨迹被跟踪结果覆盖超过80%的目标[12]。此外还有面向跟踪与分割任务的MOTSChallenge数据集, 包含4个序列、2862帧和228条轨迹, 规模小于KITTI MOTS[13]。

影响与争议

该基准已被确立为多行人跟踪的标准评测, 在其发布后相关方法的准确率提升超过10%[3]。截至2020年, 提交到基准的跟踪结果累计692项[9]。其主论文对在MOT15、MOT16和MOT17上评测过的73个、74个和57个已发表跟踪器做了归类与误差分析, 归纳出跟踪器的常见弱点并讨论后续方向[14][9]。在指标方面, 早期评测沿用来自CLEAR MOT的MOTA等度量, 后续文献则以HOTA等更高阶指标为跟踪器排序, 以更全面地衡量跟踪性能[7][15]。

该基准的发起者也对其评测提出过疑问, 包括当时的序列是否已对跟踪方法过于简单、方法是否只是过拟合、以及已有方法是否被评价不足[7]。为此, 后续版本引入了不同视角、不同光照和不同拥挤程度的序列, 以提高评测的难度与代表性[7]。

参见

  • 多目标跟踪 —— 本词条所评测的核心任务, 关注视频中多个目标的持续定位与身份保持。

  • 行人检测 —— 为多目标跟踪提供逐帧检测输入的相关任务。

  • CLEAR MOT —— 提供MOTA等多目标跟踪常用评测指标。

  • HOTA —— 后续提出的多目标跟踪高阶评测指标。

  • International Journal of Computer Vision —— 该基准主论文发表的期刊。

参考资料

  1. s11263-020-01393-0 . acm-stag.literatumonline.com [引用日期2026-09-27]
  2. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  3. MOT16: A Benchmark for Multi-Object Tracking . cvlibs.net [引用日期2026-09-27]
  4. **MOTChallenge . arxiv.org [引用日期2026-09-27]
  5. semanticscholar.org 上的网页 . semanticscholar.org [引用日期2026-09-27]
  6. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  7. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  8. 102931_LE_2020_archivage(PDF) . univ-tours.fr [引用日期2026-09-27]
  9. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  10. README.md · ling1016/MOT17 at main . huggingface.co [引用日期2026-09-27]
  11. s11263-020-01393-0 . acm.org [引用日期2026-09-27]
  12. [0099] 选取标准的MOTChallenge数据集MOT15、MOT16和MOT17对本发明提出的方法进行评估 . googleapis.com [引用日期2026-09-27]
  13. Porzi_Learning_Multi-Object_Tracking_CVPR_2020_supplemental(PDF) . thecvf.com [引用日期2026-09-27]
  14. semanticscholar.org 上的网页 . Semantic Scholar [引用日期2026-09-27]
  15. Tesi definitiva Mancusi Gianluca(PDF) . unimore.it [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T15:46:28Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
多目标跟踪 MOTA IDF1 行人跟踪 KITTI CLEAR MOT HOTA 多目标跟踪 行人检测 CLEAR MOT HOTA International Journal of Computer Vision
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。