【论文解读】复数CVNet:跳过 FFT,Jetson 上 2.75 ms 如何完成雷达手势识别?
作者介绍胡庭恺西南大学电子信息工程学院计算机科学与技术专业在读博士研究生主要研究方向为无监督毫米波雷达SAR成像长期致力于毫米波雷达与深度学习的交叉融合研究尤其关注技术成果的工程转化能力与商业化落地潜力。亦在探索AI Agent技术在电子信息工程领域的赋能场景与应用实践。很多雷达手势系统“网络很快整机却不快”因为 Range-Doppler、微多普勒等特征图前面还堵着 FFT、加窗和杂波处理。这篇工作选择直接吃 FMCW 原始复值 ADC 立方体用 (21)D 复值卷积在时域学空时特征并把 Monte Carlo Dropout 与 Deep Ensemble 接进不确定性估计。结果是 10 类手势 99.38% 准确率、仅约 6.75k 参数在 Jetson Nano 上端到端 2.75 ms相对多种 FFT 管线总时延快 4× 到 86×。代码和数据已公开边缘雷达交互如果还在为预处理延迟买单值得认真看这套 FFT-free 路线。原论文信息论文标题Complex-Valued (21)D Convolutional Neural Networks for Real-Time Hand Gesture Recognition on Edge Devices with FMCW Radar发表日期2026年7月发表单位PHENIKAA UniversityShibaura Institute of TechnologyVietnam National University, Hanoi期刊IEEE Transactions on Aerospace and Electronic Systems原文链接https://doi.org/10.1109/TAES.2026.3709269开源代码https://github.com/thetuantrinh/Hand-Gesture-Recognition.git通讯作者Minhhuy LePHENIKAA University手势网络很快系统却仍在等 FFT近距人机交互里FMCW 雷达能在暗光、遮挡和隐私敏感场景下工作。工程上拖后腿的常常不是最后那层分类头而是特征图流水线。一次识别若先做多维 FFT、再拼 Range-Doppler / 微多普勒 / 角度图预处理就可能吃掉十几到上百毫秒。论文复现对照里有的 3D RDI 预处理到约 164 ms而分类网络本身可能只有数毫秒。难点很具体⚡ 预处理税高窗长、FFT 长度、重叠率都会改变端到端延迟。 信息被提前切块只保留幅度谱时相位关系容易在前端就丢。️ 噪声下要敢不敢用交互系统不仅要类别还要知道何时不置信。现有路线的典型困境FFT 特征 CNN/LSTM精度高但边缘总延迟受前端绑定。轻量频谱 CNN模型可压小仍难绕开 FFT。已有 Fourier-free 尝试方向对但精度、参数量或可部署性还不够齐。这篇文章工作的目标很明确把雷达手势识别做成真正可在边缘实时跑的端到端复值网络并补上不确定性。从“先变频谱再识别”到“复值网络直读 ADC”作者把系统主线改成原始中频复信号直接进网络。关键判断与其在前端用 FFT 人工切出距离-速度图不如让复值卷积同时利用幅度与相位在时域学出手势的空时结构。FFT-free 输入雷达是 TI AWR124377–81 GHz带宽 4 GHz3Tx×4Rx。每帧 128 chirps、每 chirp 64 ADC 点帧率 20 fps。一个样本堆 20 帧约 1 s原始复数据手势距离主要在 10–50 cm。跳过 FFT 也意味着噪声和杂波没有被经典前端“洗干净”所以网络必须更会从原始域分出有用运动。复值运算复卷积按复数乘法展开实虚交叉项随后接复批归一化和 C-ReLU。分类时对复特征幅度做 Softmax。这样相位不是事后拼接通道而是卷积归纳偏置的一部分。(21)D 因式分解控参数完整 3D 复卷积参数更贵。作者拆成STCV在快时间-慢时间平面抽空间/距离-多普勒相关结构TCCV再沿通道-时间融合天线维信息。同设定下(21)D CVNet 约 6.75k 参数传统 3D CNN 约 17.04k参数量大约少 2.53×准确率反而从 97.93% 到 99.38%。不确定性不是附加题训练和推理可启用 Monte Carlo Dropout也可训练多个独立模型做 Deep Ensemble。噪声恶化时多通行推断用来压低盲目自信。算法怎么跑起来数据与标签10 类下压、上拉、逆时针、顺时针、放大、缩小、左、右、无手、静止举手UKN。处理后总样本约 388098 人训练、2 人验证按人划分避免同人泄漏。前向主路径输入复立方体后残差块内重复“复卷积 → 复 BN → C-ReLU”并用 (21)D 分解降低 3D 核成本全局池化后输出 10 类。硬件资源落点计算从“多维 FFT 实值 CNN”改成“纯网络 MAC”。论文在 Jetson NanoFP16、batch8测到约 7.28 GMACs / 14.55 GFLOPs网络端到端 2.75 ms。FFT 管线的延迟大头往往在预处理不在分类头把预处理删掉整机才从“看起来实时”变成“测下来实时”。不确定性推断MC-D同一模型多次 dropout 前向平均概率方差/熵作不确定度。DEL多模型独立训练后平均校准通常更好成本也更高。99.38% 只是分数2.75 ms 才是系统故事干净验证集上(21)D CVNet 准确率 99.38%。混淆矩阵里多数类别在 98.1%–100%UKN 约 98.1%。同数据复现对照中不少 FFT 特征方法可到 98% 左右但参数量与总延迟通常更高传统 3D CNN 直吃原始数据也有 97.93%仍低于复值 (21)D。公开 BGT60 相关集合上方法报到 94.05%高于文中 ResNet-18 对照的 90.78%。真正拉开差距的是边缘总时延Jetson Nano本方法预处理0 ms总时延2.75 ms约 364 FPS对照 FFT 管线总时延常见约11.8 ms 到 166 ms论文概括为整体快约4×–86×功耗侧文中提到约 4.5 W、GPU 利用率约 20.3% 的测量口径说明它不是靠堆算力硬推。噪声方面作者给验证集加 AGWN扫 -5 到 20 dB。干净/高 SNR 时三种推断都接近 99%、ECE 约 0.023噪声加重后MC-D 与 DEL 相对单次前向大约有 3%–16% 的准确率收益DEL 校准更好。 工程可行性翻译雷达 20 fps 时帧周期 50 ms。2.75 ms 推理只占帧周期约 5.5%就算加上采集搬运仍有预算做滑动窗口、投票或安全互锁。和“分类 1 ms、FFT 30–150 ms”的系统相比用户体感延迟会完全不同。代价是MC-D/DEL 的多通行会成倍吃时延实时闭环里更适合“平时单次前向低置信再触发多通行复核”。从实验室采集到噪声应力测试采集在室内完成手距雷达 10–50 cm天线罩用低损耗介质塑料。图中可见实验布置与类别样本分布。需要保持冷静的边界噪声是可控加性高斯白噪声不是完整多径、电机干扰或雷达互扰距离包络偏近距远距手势未充分验证当前是片段分类不是连续手势切分与在线词表扩展。即便如此作者把总延迟测到 Jetson Nano并把代码数据公开已经比很多“只报 GPU 准确率”的工作更接近工程。边缘雷达交互“删掉 FFT”之后若模组算力有限、交互又要求低时延FFT-free 复值网络提供了一条可验证路径把延迟预算从预处理夺回给系统逻辑。可迁移方向包括笔记本/白电近距隔空手势0.1–0.5 m辅助机器人床旁短距指令并结合不确定度做“不确信就请求重复”其他短距 FMCW 时域学习任务如近距存在检测或简单动作开关。更大的判断是当边缘芯片算力不再宽裕时雷达感知的优化重点会从“更漂亮的中间特征图”转向“哪些经典前端步骤其实可以被可学习算子替换”。作者三问1. 不做 FFT网络如何还能分出手势中频复信号里已经编码了散射点的距离相位与运动引起的时变。复值卷积保留实虚耦合(21)D 结构再分别挖空时图案和通道关系。FFT 是一种固定基变换这里改由数据学习更任务化的时域滤波器。2. 2.75 ms 是否意味着任意边缘芯片都能实时只说明在 Jetson Nano、FP16、论文设定下测到了这个数。换到 MCU 或更小 NPU算子支持、内存带宽和复数量化方案都会变。它证明的是“总链路可以不再被 FFT 绑架”不是“所有硬件都自动 2.75 ms”。3. 有了不确定性产品就能安全上线吗它提供了拒识和二次确认的信号尤其在低 SNR 时有增益。但当前噪声模型偏合成真实误触发成本还要结合连续手势、背景人体和多径场景重测。不确定度是安全机制的输入不是安全机制本身。作者测评学术/科研价值★★★★☆把复值网络、(21)D 分解、FFT-free 雷达前端和不确定性估计收到同一边缘 HGR 框架并用统一数据重跑多种 SOTA证据扎实。代码数据公开进一步抬高复现价值。噪声类型和远距/连续手势仍偏窄理论分析少于系统贡献。工业/工程价值★★★★★少见地把“预处理时延”当成一等指标并在 Jetson Nano 给出端到端 2.75 ms 与功耗/利用率口径。对边缘交互这比再涨 0.5 个点准确率更关键。距工业量产还差连续识别、远距、真实干扰和更低功耗器件移植。商业/产品价值★★★★☆一句话可传达雷达手势不必先做完 FFT 再识别边缘端可以几毫秒级出结果。消费电子、智慧座舱近距控制和护理机器人都可能是付费场景且开源降低评估成本。商品化仍要补手势词表扩展、误触发率与外观/结构集成验证。可能的问题距离主要 10–50 cm桌面/座舱远一些的交互未充分覆盖。噪声实验以 AGWN 为主真实多径与硬件损伤不足。片段式 10 类分类不等于连续手势系统。MC-D/DEL 提升稳健性的同时会增加推断成本。复值算子在部分 NPU/MCU 工具链上支持仍不完整。主要参考文献Trinh, T. T., Tan, P. X., Van, K. N., Tram, P. V. B., Nguyen, X., Dang, K. N., Le, M. (2026). Complex-Valued (21)D Convolutional Neural Networks for Real-Time Hand Gesture Recognition on Edge Devices with FMCW Radar. IEEE Transactions on Aerospace and Electronic Systems. https://doi.org/10.1109/TAES.2026.3709269本文仅代表个人理解及观点不构成任何论文审核或项目落地推荐意见具体以相关组织评审结果为准。论文内容如有理解偏差以原文为准。欢迎就论文内容交流探讨理性发言哦关于 SuperRadar 社区SuperRadar是深圳承泰科技股份有限公司核心 Sponsor 的开放社区聚焦感知、AI算法、多传感器融合、机器人、智能交通、工业安全、低空经济等方向致力于通过开放技术基座、开发者工具、场景实践和生态共创推动毫米波雷达感知技术进步与智能感知行业发展。GitHubhttps://github.com/super-radar官网https://www.superradar.cn联系小助手superradar01