一、从“能跑”到“跑得快”:YOLO在Apple生态的部署痛点把训练好的YOLO模型从PyTorch的.pt格式导出到CoreML,在iPhone或Mac上跑起来——这件事本身并不难。但“能跑”和“跑得快”之间,隔着整整一个Apple Neural Engine的距离。在2026年的今天,Apple Silicon(M系列芯片和A系列芯片)已经成为了端侧AI推理的重要阵地。然而,大量开发者仍然在使用PyTorch的MPS后端跑YOLO推理,或者用默认配置导出CoreML模型后惊讶地发现——推理速度还不如在CPU上跑。问题出在哪里?第一个坑:CoreML的ComputeUnit配置。在Ultralytics v8.4.75发布之前(2026年6月21日),CoreML导出后的模型默认使用的计算单元配置可能导致Python进程直接崩溃,报错信息往往是“MLIR pass manager failed”。这个坑让无数Mac开发者深夜崩溃。第二个坑:MPS后端的兼容性问题。训练时使用device=mps,验证时mAP值与CUDA后端相差可达2.6倍。推理时虽然能用,但性能远未达到Apple Silicon的硬件上限。第三个坑:模型架构本身的开销。传统的YOLO模型依赖NMS(非极大值抑制)后处理,这个步骤在导出到CoreML时要么丢失、要么需要用自定义层补上,增加了部署复杂度。