尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

CVPR 2025 | JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems

CVPR 2025 | JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems CVPR 2025 | JTD-UAV面向反无人机系统的多模态大语言模型增强型联合跟踪与描述框架01.论文信息论文题目JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems论文作者 Yifan WangJian Zhao等发表单位北京未来区块链与隐私计算高精尖创新中心北京航空航天大学人工智能学院等发表会议\期刊CVPR 2025代码链接无02.论文创新点提出无人机跟踪与意图理解新任务UTIU首次提出 UAV Tracking and Intent UnderstandingUTIU 任务将传统 Anti-UAV 中的目标定位跟踪扩展到运动状态理解和行为意图推理。不仅关注无人机“在哪里”还进一步理解无人机运动状态悬停、快速机动、改变方向等无人机行为意图是否接近建筑、人群等。实现从 目标定位Tracking → 行为理解Understanding 的任务升级。提出 MLLM 增强的联合跟踪与描述框架 JTD-UAV设计 JTD-UAVJoint Tracking and Description Framework将无人机跟踪算法与多模态大语言模型MLLM结合。通过轨迹信息增强 MLLM 的时序理解能力使模型能够生成无人机运动状态描述和回答行为相关问题。构建首个无人机跟踪与意图理解数据集 TDUAV提出 TDUAV 数据集用于支持 UAV Tracking and Intent Understanding 任务。数据集包含1328 个无人机视频序列超过 163K 帧热成像标注数据3000 个视觉问答VQA样本。同时提供边界框跟踪标注UAV motion caption无人机运动描述UAV Motion VQA无人机运动视觉问答。填补了现有 Anti-UAV 数据集只能提供目标位置而缺少高层行为理解标注的问题。提出面向无人机运动理解的视觉特征压缩与建模方法针对无人机目标尺寸小、运动速度快以及视频序列较长的问题设计自适应分辨率编码特征压缩与投影模块。将长视频中的无人机运动信息压缩为适合 LLM 输入的视觉 token降低计算成本同时保留关键运动语义。03.方法如图所示 JTD-UAV框架可划分为三个阶段。首先采用目标检测与跟踪算法获取目标的的位置信息。随后将该位置信息与视频数据融合进行编码。为了更有效地对无人机的运动状态进行建模同时减少冗余信息并降低计算复杂度引入了一种特征压缩与无人机运动建模机制。该机制利用可学习的查询Learnable Queries从视频中提取无人机的运动信息。最后将提取出的特征输入至大语言模型中以生成有关无人机运动状态的描述与交互。P(t)P(t)P(t)为时间ttt处目标的位置信息V(t)V(t)V(t)为时间ttt处的视频数据QQQ为可学习的查询LLL为大语言模型可以将融合后的数据I(t)I(t)I(t)定义为I(t)fencode(P(t),V(t))I(t) f_{\text{encode}}(P(t), V(t))I(t)fencode​(P(t),V(t))其中fencode(⋅)f_{\text{encode}}(\cdot)fencode​(⋅)为编码函数。特征压缩与无人机运动建模机制可表示为M(t)fextract(fcompress(fencode(P(t),V(t))),Q)M(t) f_{\text{extract}}(f_{\text{compress}}(f_{\text{encode}}(P(t), V(t))), Q)M(t)fextract​(fcompress​(fencode​(P(t),V(t))),Q)其中fcompress(⋅)f_{\text{compress}}(\cdot)fcompress​(⋅)为特征压缩函数fextract(⋅)f_{\text{extract}}(\cdot)fextract​(⋅)为提取函数。最终生成的有关无人机运动状态的描述与交互表示为D(t)L(fextract(fcompress(fencode(P(t),V(t))),Q))D(t) L(f_{\text{extract}}(f_{\text{compress}}(f_{\text{encode}}(P(t), V(t))), Q))D(t)L(fextract​(fcompress​(fencode​(P(t),V(t))),Q))3.1. 无人机检测与跟踪采用目标跟踪算法来获取无人机在视频中的位置信息。该无人机跟踪算法由全局检测分支用于检测无人机目标和局部跟踪分支用于在视频流中持续定位目标组成。利用无人机目标检测算法具体为 YOLOv8 对整段视频中的无人机进行全局检测。一旦检测到无人机目标该算法就会启动局部跟踪对已检测到的无人机保持连续监视直至其不再可见。如果局部跟踪器失配并返回拒绝跟踪的结果模型会自动重新激活全局检测器以便在后续视频帧中继续检测无人机。局部跟踪框架由一个主干网络构成并辅以多级关联解耦模块。多阶段主干网络负责提取并融合模板区域Template Area与搜索区域Search Area的特征。在主干网络的每个阶段利用卷积层生成图块嵌入将图像图块映射为特征 Token。将源自模板与搜索区域的 Token 进行拼接并输入至关联解耦模块中进行特征提取与匹配。最终该框架实现对目标位置与尺度的估计。3.2. 特征压缩与建模受限于模型的上下文窗口以及视频序列的较长时间跨度原始视频数据不适合直接输入模型。为应对这一挑战设计了一种以自适应分辨率编码与压缩为核心特征的创新机制。该机制擅长从无人机运动视频中提取信息从而在语言特征空间中实现更高阶的语义视觉表示。采用自适应分辨率编码来处理不同尺度的无人机特征以确保准确的特征表示。通过从无人机运动视频中提取并自适应压缩特征增强模型描述无人机运动行为的能力。3.3. 无人机运动行为的描述文本生成在通过特征压缩与学习层处理后获得了相应的无人机运动行为特征。随后将这些特征与编码后的指令信息进行拼接输入至大语言模型LLM中LLM 最终输出无人机的运动状态表示为LConcat(Fu,Φenc(Fc))L \text{Concat}(F_u, \Phi_{\text{enc}}(F_c))LConcat(Fu​,Φenc​(Fc​))其中Φenc(⋅)\Phi_{\text{enc}}(\cdot)Φenc​(⋅)表示指令编码过程FuF_uFu​与FcF_cFc​分别代表压缩后的特征与指令编码特征。跟踪与描述生成的联合训练方法。在单次推理阶段目标跟踪算法首先获取无人机的位置信息。该信息经过特征压缩与建模后输入至 LLM 中。随后计算 LLM 的损失与目标跟踪损失并将两者结合。最终的损失函数公式为LαLLLMβLOT\mathcal{L} \alpha \mathcal{L}_{\text{LLM}} \beta \mathcal{L}_{\text{OT}}LαLLLM​βLOT​α\alphaα和β\betaβ分别为平衡大语言模型LLM损失与目标跟踪Object Tracking损失贡献度的权重系数。总损失由两部分组成目标框回归损失跟踪损失与 LLM 损失。LLM 损失函数公式如下LLLM−1N∑i1NyLLM,ilog⁡(y^LLM,i)\mathcal{L}_{\text{LLM}} -\frac{1}{N} \sum_{i1}^{N} y_{\text{LLM},i} \log(\hat{y}_{\text{LLM},i})LLLM​−N1​i1∑N​yLLM,i​log(y^​LLM,i​)其中yLLM,iy_{\text{LLM},i}yLLM,i​表示位置iii处的真实标签Ground Truthy^LLM,i\hat{y}_{\text{LLM},i}y^​LLM,i​表示位置iii处的预测概率分布NNN为描述文本的长度。04. TDUAV全新基准TDUAV是目前用于无人机检测、跟踪与意图理解的最全面的数据集。如表 1 所示TDUAV 在规模和复杂度上均超越了现有数据集包含 1,328 个序列和 16.3 万帧图像。无人机的平均尺寸仅为 32×21 像素占 26较小的目标尺寸使得检测和跟踪更具挑战性。如图所示展示了 TDUAV 在丘陵、城镇、森林和建筑物等场景下的具体案例。基于现有的反无人机数据集如 Anti-UAV 系列 构建数据集。如图 所示通过聚焦于无人机运动和环境的不同方面如背景设定、运动方向、速度以及整体总结的多个阶段显著提升了描述文本Captions和视觉问答VQA回答的准确性与质量。通过结合 GPT-4 等大语言模型以及人工审核确保了高质量的数据输出大幅改善了无人机行为描述的精确度与交互性为高级反无人机应用提供了有力支持。首个用于联合跟踪与意图理解的数据集TDUAV 是首个专门针对无人机跟踪与意图理解双重任务设计的数据集。它独到地聚焦于复杂环境中无人机行为的预测而这一任务在此前的机制中被普遍忽视。该数据集涵盖了意图识别、场景识别以及包含无人机形态与意图在内的综合运动状态描述等任务。这使得 TDUAV 成为在各种场景下理解与预测无人机意图的宝贵资源。与现有数据集的对比虽然像 USC Drone和 MAV-VID这类数据集仅专注于跟踪但 TDUAV 提供了意图预测所需的标注。即便是像 Anti-UAV这样全面的数据集也缺乏高阶行为分析所需的深度。TDUAV 填补了这一空白同时提供跟踪与意图数据使其成为实际应用场景下的理想选择。多模态提高鲁棒性。除了 RGB可见光数据外TDUAV 还包含了热成像红外模态这对于夜间作业等低能见度条件至关重要。这种多模态特性增强了数据集的通用性使其能够支持更广泛的无人机相关任务涵盖从安全监控到自主导航的多个领域。结论无人机研究的新基准。TDUAV 通过为联合跟踪与意图理解提供全面的解决方案树立了全新的基准。其庞大的规模、精细的标注以及对多模态的支持使其成为推动无人机研究及实际应用发展的宝贵资源。05. 实验分析5.1. 实现细节目标检测与跟踪分支的 YOLOv8s模型在 AntiUAV 训练集上进行训练而跟踪模型则在 AntiUAV数据集以及四个通用跟踪数据集包括 LaSOT、TrackingNet 、GOT10K 和 COCO上共同训练。随后在 TDUAV 数据集上对目标检测与跟踪分支以及多模态大语言模型进行联合训练。对于多模态大语言模型冻结了视觉编码器的权重并对特征压缩与建模层以及大语言模型层的权重进行训练。在训练过程中我们使用 AdamW 优化器 将学习率设置为 1e-5并配合余弦学习率调度策略。模型的性能展示如图所示。5.2. 对比实验在 DTUAV 数据集上的定量分析 DTUAV 数据集上评估了多模态大语言模型MLLMs的性能重点关注无人机检测与跟踪任务。如表所示JTD-UAV 在所有三个子集上的表现均持续优于其他模型。BLEU 得分用于衡量生成的描述文本与人工参考文本的匹配程度它在评估 n-gram 精确度的同时引入了简短惩罚Brevity Penalty。JTD-UAV 在所有 BLEU 级别BLEU-1 至 BLEU-4上均持续取得更优的评估结果这表明即使在复杂场景下该模型也具备生成准确且符合上下文语义的无人机行为描述的卓越能力。在表 4 中使用 SPICE基于语义命题的图像描述评估和 ACC准确率指标对模型进行了进一步对比。与侧重于 n-gram 重合度的 BLEU 不同SPICE 通过将生成文本和参考描述均转换为场景图Scene Graphs进而比较这些场景图的相似度从而衡量图像描述与参考描述之间的语义一致性。在其他无人机数据集上的对比为了进一步验证其有效性在两个主流的反无人机数据集即 DUT Anti-UAV [76] 和 Anti-UAV [32]上对 JTD-UAV 进行了评估。DUT Anti-UAV 数据集包含 20 段视频而 Anti-UAV 数据集包含 91 段热成像视频重点关注 RGB可见光数据可能不足的场景。在通用跟踪数据集上训练的基线 JTD-UAV 方法在 DUT Anti-UAV 数据集上达到了 0.612 的准确率在 Anti-UAV 数据集上JTD-UAV 则取得了 0.633 的准确率。5.3. 消融实验这些实验对模型进行了系统化评估提供了对其贡献的全面理解。实验结果表明与基线模型相比方法在性能以及无人机运动行为描述和视觉问答VQA任务中均取得了显著提升。在无人机运动行为描述任务中BLEU 得分提高了 2.43%SPICE 得分提升了 3%展现出了更强的文本生成与描述能力。在视觉问答VQA任务中观察到了 7.73% 的平均性能提升这表明模型在理解力与回答准确性方面取得了大幅突破。06. 个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。
返回列表