新出论文总结

本文档主要记录新出的论文(包括大量ArXiv预印本),主要是学习思路和方法,其具体水平还有待时间检验。

目录

简称发表信息核心贡献描述具体信息传感器其他
RobMOT+ArXiv 2025.5提出动态调整运动模型的思路查看3D+2DKITTI
DIMMArXiv 2025.5IMM改进,强化学习计算转换矩阵,各个方向进行拆分查看3D强化学习
MLA-MOTTITS2026多级关联+质量感知轨迹修正,系统解决预测/关联/漂移三大问题查看LiDARKITTI
PB-MOTIROS2025旋转椭圆IoU兼顾效率与精度,自车运动解耦改善关联查看LiDARKITTI
PD-SORTTCE2025伪深度作为2D MOT第三运动维度,提升遮挡鲁棒性查看cameraDanceTrack/MOT17/20
Co-MOT-titsTITS2025提出改进的GNN进行运动建模-。未开源查看LiDAR-
MMTrackerAAAI2025?查看camera-
MambaTrackACMMM2025引入Mamba模型取代KF查看camera-
MCTrackArxiv2025效果最好的开源追踪器查看LiDAR+camera-
ERMOTTII2025一种更新策略,未开源查看camera-
MMFJDTRAL2025检测追踪融合框架,效果似乎不太好查看LiDAR+camera-
sambamotrICLR2025mamba结构的E2EMOT查看camera-
DINOMOTRAL2025引入DINOv2特征提取模块查看camera-
HybridTrackRAL 2025kf+数据驱动查看LiDAR-
RobMOTTITS2025针对检测器的kf+新的生命机制查看LiDAR-
TrackTrackCVPR2025以轨迹为核心进行管理查看camera-
LA-MORTCVPR2025E2E,解决检测与关联竞争查看camera-
OASORTCVPR2026遮挡感知的SORT查看camera-

论文详情

TOWARDS ACCURATE STATE ESTIMATION: KALMAN FILTER INCORPORATING MOTION DYNAMICS FOR 3D MULTI-OBJECT TRACKING {#RobMOT+}

  • 发表信息: ArXiv 2025.5
  • 未开源

核心贡献描述

说是动态模型,不如说是动态调整模型的参数。作者首先使用一个基座运动模型:Jerk模型(一直建模到加加速度)。然后给速度,加速度,加加速度一个权重,通过调整权重来实现模型的动态调整。 而权重的获得,理想情况下是通过目标真实运动状态的差分(及高级差分)获得的。但是真实状态不可得,作者使用去噪的观测值来近似真实状态,从而计算出差分。此外,并非简单差分就是权重,还设置了一个高斯分布,以及归一化来获得权重。

学习收获

作者的运动模型,实质上就是CV,CA,JERK。但是没有考虑到转向模型。不过思路可以借鉴学习,也就是通过后续的真值来动态调整运动模型。 对比作者的上一篇工作,提升真的不高。


DIMM: Decoupled Multi-hierarchy Kalman Filter for 3D Object Tracking

  • 发表信息: ArXiv 2025.5
  • 未开源

论文框架

核心贡献描述

主要提出了两个大的创新点。首先作者的baseline是IMM(交互多模型滤波器)。它指出IMM存在的两个大问题:首先是3维各个方向的运动状态可能是不相同的,而IMM是把各个方向的状态耦合在一起的。其次,IMM在更新模型概率时,是用的观测的值作为真值来计算误差,从而更新概率,这里就引入了观测噪声的问题。 针对第一个问题,作者提出了将3维各个方向的状态进行拆分。每个维度上分别做CV,CA,CK模型的IMM。作者提到这样做扩大了解的空间。但是我认为这个说法有一定的问题。假如说三个模型的状态向量不存在平行,那么他们就是三维空间的一组基向量,一样是可以表示任意的三维状态的。而拆分成基坐标系,就相当于把基向量换成了标准正交基而已。但是,我也同意作者的部分观点:这样确实扩大了解的空间:由于固定模型,所以状态向量的变化范围是受限的,而拆分后,每个维度的状态向量可以独立变化,从而扩大了状态向量的变化范围。这个部分我觉得还可以更进一步,沿着作者的思路走:各个方向上的运动是不一样的。

方向拆分解空间变大

针对第二个问题,作者提出了使用强化学习的方法来学习生成概率矩阵。 其中值得借鉴的是奖励的设置。不同于将和真值的误差作为奖励,作者将“模型的误差”和”普通IMM的误差“之间的差值作为奖励。这样缓解了观测噪声的问题。当学习模型比传统方法好的时候,奖励为正,否则为负。

学习收获

  1. 各个方向运动不同。拆分的方法可以试试效果先。
  2. 学习奖励的设计。

3D Multi-Object Tracking Driven by Multi-Level Association and Intelligent Filtering

  • 发表信息: IEEE TITS, Vol.27 No.1, January 2026
  • 未开源

核心贡献描述

针对3D MOT中预测、关联、修正三个环节的缺陷,提出三个配套模块形成闭环:

AESSP(自适应估计平滑状态预测):用加速度差分动态估计下一时刻加速度:$\hat{a}^j_{t+1} = \xi a^j_t - a^j_{t-1}$,再用平滑因子融合预测速度与估计速度,抑制预测噪声。本质仍是线性外推,但比纯CV/CA更贴近真实运动。

MLTIA(多级轨迹集成引导关联):按检测和轨迹的置信度各分高/低两类,进行4级级联匹配(高×高用3D IoU,低×高用3D GIoU,依此类推)。轨迹置信度由KF协方差矩阵量化,遮挡目标复现时的置信度变化规律也作为辅助相似度。

QIFTC(质量感知智能滤波轨迹修正):计算检测框与轨迹预测方向的角度偏差 θ,超过阈值则判定为漂移检测,对中心坐标、尺寸、朝向角分别用指数衰减函数回归修正,再送入KF更新,避免误差积累。

学习收获

  1. 多级关联的思路本质是ByteTrack的扩展,但以置信度双维度划分(检测+轨迹)比单维更细致,遮挡轨迹的处理更系统。
  2. QIFTC的角度偏差检测漂移的思路值得借鉴:用预测方向和观测方向的一致性作为质量信号,比纯置信度更能感知几何异常。
  3. 行人类HOTA仅53%,说明方法对尺寸小、运动随机的目标泛化性弱,主要价值在车辆跟踪。超参数多(C、ω、α、β、τ),工程成本不低。

PB-MOT: Pose-aware Association Boosted Online 3D Multi-Object Tracking

  • 发表信息: IROS 2025, Hangzhou
  • 未开源

核心贡献描述

3D MOT关联面临复杂性-精度困境:IoU精度高但计算重,距离类方法快但忽略朝向。同时自车运动与目标运动耦合导致KF预测偏差。提出四个模块:

旋转椭圆IoU(RE-IOU):以旋转椭圆等高线建模目标框,等高线形状由长宽比 γ 和速度自适应旋转角 θ_rot 控制,用**切比雪夫多项式(4阶)**近似三角函数大幅降低计算复杂度,最终精度接近GIoU,速度接近欧氏距离。

扩展代价函数:在RE-IOU基础上乘入朝向代价 $\mathcal{O}$(检测与预测朝向余弦差)和存在代价 $\mathcal{E}$(轨迹历史关联成功率),同时加权双阈值重标定后的检测置信度。

自车运动解耦(EM):从SLAM/GPS获取帧间自车相对位姿变换,将前帧轨迹转换到当前坐标系,再用CV+KF预测目标绝对运动。

自适应轨迹管理(ATM):区分静止目标和运动目标,静止目标采用更慢的存在代价衰减,避免遮挡时被错误删除。

KITTI在线方法:HOTA 81.94%,AssA 85.55%,MOTA 91.32%,CPU速度 2402.76 FPS

学习收获

  1. RE-IOU是本文最实质的贡献:兼顾效率和精度,切比雪夫近似的工程创意值得学习,HOTA vs GIoU提升+1.265%证明其有效。
  2. 自车运动解耦在动态驾驶场景中必要性高,FRAG减少31.85%是直接证明。静止/运动目标分类管理轨迹寿命的思路也值得参考。
  3. 2402 FPS仅含跟踪算法本身(不含3D检测器),实际系统参考价值有限;依赖SLAM/GPS在室内或GPS遮挡区域失效。旋转椭圆在朝向接近0°/90°时等高线形状与真实框吻合度下降。

PD-SORT: Occlusion-Robust Multi-Object Tracking Using Pseudo-Depth Cues

  • 发表信息: IEEE Transactions on Consumer Electronics, Vol.71 No.1, February 2025
  • 代码公开

核心贡献描述

2D MOT遮挡场景下,目标边界框重叠导致纯位置信息无法区分不同目标,提出将伪深度作为第三运动维度引入KF状态:

伪深度建模:通过"补充视角"无需深度传感器估计伪深度:$pd = 2 \times IMG_h - Y_b$(图像高度两倍减去框底部y坐标),对目标移出边缘的情况鲁棒。将 $pd$ 和深度速度 $v_{pd}$ 加入KF状态向量。

深度体积IoU(DVIoU):将2D IoU扩展为体积IoU,引入伪深度作为第三维:$V = w \cdot h \cdot pd$,遮挡时2D重叠但深度不同的目标可被有效区分。

量化伪深度测量(QPDM):将帧内深度范围等分为若干区间,用区间编号代替原始深度值,减少部分遮挡引起的深度估计误差传播。

相机运动补偿(CMC):稀疏光流+RANSAC估计仿射变换,校正运动相机引起的位置偏移,同时修正KF状态和历史观测坐标。

DanceTrack:HOTA 58.2%(+3.6 vs OC-SORT),AssA 42.1%(+1.9),IDF1 57.5%(+2.9)。

学习收获

  1. 核心思路有意义:在纯2D场景中将深度信息引入运动状态是首次尝试,无需深度传感器。DanceTrack +3.6 HOTA证明在外观高度相似+非线性运动+密集遮挡场景下深度线索确实有效。
  2. DVIoU混合了像素坐标和伪深度量纲,物理意义上不严格,需精细调参;伪深度核心假设(相机在地面以上、目标在同一地平面)在坡道、楼梯或大俯仰角相机下失效。
  3. MOT17/20提升仅+0.6~0.7 vs DanceTrack的+3.6,说明方法价值集中在非线性运动+遮挡的特定场景,行人直线行走场景提升有限。

Co-MOT: Exploring the Collaborative Relations in Traffic Flow for 3D Multi-Object Tracking

🌟 基本信息

  • 未开源
  • 发表信息:IEEE Transactions on Intelligent Transportation Systems ( Volume: 26, Issue: 4, April 2025)
  • 其他:注意有两个简称Co-MOT的方法,为了避免混淆,这里使用Co-MOT-tits来表示,是使用GNN修正KF的方法。另一种是E2E方法。

MambaTrack: A Multi-Modal Multi-Object Tracking Framework with a Novel Kalman Filter

🌟 基本信息

  • 开源地址:https://github.com/JackWoo0831/Mamba_Trackers (非官方实现)
  • 发表信息:ACMMM 2025

🎯 核心内容

  • 将Mamba模块引入追踪器,取代卡尔曼滤波器从而达到更好的非线性预测效果。

💡 学习收获

  • 该文章仅仅添加了Mamba模块,其它都使用的SORT基本框架。但是其效果非常好,说明Mamba模块确实有很好的效果。

🎨 TODO

  • 实现Mamba模块,并添加到SORT中。
  • 具体理解Mamba原理。

DINO-MOT: 3D Multi-Object Tracking With Visual Foundation Model for Pedestrian Re-Identification Using Visual Memory Mechanism

🌟 基本信息

  • 开源地址:未开源
  • 发表信息:RAL2025 基本框架

🎯 核心内容

  • 将DINOv2特征提取器引入MOT
  • 它并非采用的传统REID的方法,而是使用视觉LUT来矫正追踪的情况。
  • 文章采用了两条线来完成追踪任务。主线依旧是传统的TBD框架,并且算是各方法的大成者,不同目标设置不同模型、不同参数、不同的关联矩阵和阈值。此外,另一条线就是重识别,利用LUT模块来纠正IDSW。主要思路是,如果提取到的特征和LUT库中的非常相似,那么这就是同一个目标,如果之前匹配错了此时会进行纠正。

HybridTrack: A Hybrid Approach for Robust Multi-Object Tracking

🌟 基本信息

  • 开源地址:https://github.com/leandro-svg/HybridTrack
  • 发表信息:IEEE Robotics and Automation Letters,2025,07 基本框架

🎯 核心内容

  • 设计了一个前端MLP网络,后端KALMANNET的新型滤波器

RobMOT: 3D Multi-Object Tracking Enhancement Through Observational Noise and State Estimation Drift Mitigation in LiDAR Point Clouds

🌟 基本信息

  • 开源地址:未开源
  • 发表信息:TITS2025 基本框架

🎯 核心内容

  • 采用了一种新的检测数据提取方式。就是更宽松了,放入一些低置信度但是也可能是真检测的结果。
  • 针对每种检测器提出了一个精修的卡尔曼滤波器。经过数据统计,发现检测器的误差呈现出一个高斯分布,所以新增了一个噪声参数来进行补偿。
  • 轨迹验证机制:用来消除幽灵轨迹。大致就是一个轨迹有一个评分机制,如果评分高于阈值就认定为是真实轨迹。是一种降低误检的机制。
  • 提出了一种新的轨迹生命管理策略,通过协方差来决定轨迹的存活与否,通过目标的不确定度来决定是否继续跟踪。这框架确实和之前大不相同。

Focusing on Tracks for Online Multi-Object Tracking

🌟 基本信息

  • 开源地址:未开源
  • 发表信息:2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

🎯 核心内容

本文最大的特点就是不再是过去全局优化(匈牙利算法),而是以轨迹为中心进行设计,聚焦每个轨迹的局部匹配精度和可靠初始化,适配多目标跟踪中轨迹与检测结果的强关联性。

  • 数据关联:Track-Perspective-Based Association(TPA)
    • 全面使用了检测结果。本文使用到的检测结果包括 NMS后的高置信度结果、NMS后的低置信度结果、NMS排除但是置信度高的结果。如此一来,数据关联的候选集就非常丰富。然后作者的匹配方法其实是一个贪婪算法。检测和轨迹都是当前集合最优(互相)的时候认为是匹配。然后集合缩小,重复直到所有都低于阈值。
  • 轨迹初始化:Track-Aware Initialization(TAI)
    • 由于检测结果的候选非常多,自然追踪器误检的情况会变多,作者就专门就此提出了一种初始化方法。其实就是一个NMS,在匹配任务完成后,围绕“匹配的轨迹”和“置信度非常高的检测”为中心做NMS,以排除误检。

💡 学习收获

本文的方法也是非常的简单。我认为提点的最大原因在于检测结果收录的更多了。所有模块都是围绕这一点展开的。


LA-MORT: LA-MOTR: End-to-End Multi-Object Tracking by Learnable Association

🌟 基本信息

  • 开源地址:https://github.com/PenK1nG/LA-MOTR
  • 发表信息:2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR) 基本框架

🎯 核心内容

  • 提出了一个端到端的多目标追踪框架LA-MORT,解决了检测与关联之间的竞争问题。
  • 文章认为现有的E2E方法

Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Tracking

  • 发表信息: CVPR 2026
  • 未开源:未开源 基本框架

核心贡献描述

主动寻找是否遮挡,然后根据遮挡来调整关联代价函数以及更新策略。 寻找遮挡的方法(OAM)是:(1)通过离底边的距离判断深度(2)根据深度判断是否遮挡,计算遮挡的程度(IOU),再用高斯映射弱化背景遮挡问题 通过遮挡程度调整代价函数(OAO),遮挡程度越高,关联代价越大,优先级靠后 根据遮挡程度优化更新策略(BAM),遮挡程度越高,更相信预测值,弱化观测值的影响

学习收获

显式地找遮挡情况,这个想法值得深入。以及它找遮挡的方法也相当有启发性。


模板

  • 发表信息:
  • 未开源

核心贡献描述

学习收获