副模组 LQ50 实战:把 35B 大模型塞进一块 M.2 加速卡是什么体验
副模组 LQ50 实战把 35B 大模型塞进一块 M.2 加速卡是什么体验边缘端跑大模型这件事过去听起来像把大象塞进冰箱。但最近把后摩 LQ50 插进 AIBOX PRO 跑了一圈之后我的感受是只要软件栈跟得上35B 以内的模型在边缘盒子里落地已经不再是 PPT 能力了。一、为什么给 AIBOX PRO 配 LQ50先看副模组定位AIBOX PRO 用的是主-副异构架构主模组 RK3588/RK3576 负责调度、多媒体编解码和丰富的 IO副模组走 PCIe 高速互联专门负责 AI 推理算力输出。规格书里列得很清楚副模组支持 RK1828、RK1820 和后摩 LQ50 等多种加速卡。我简单理解这个分工就是主模组当班长副模组当体育委员一个统筹任务一个输出算力。角色模组定位典型能力主模组RK3588任务调度 / 编解码 / IO6 TOPS INT88K 编解码副模组RK1828轻量 AI 推理5 GB DRAM20 TOPS可跑 ≤7B 模型副模组后摩 LQ50大模型推理48 GB LPDDR5160 TOPS可跑 ≤35B 模型LQ50 是一块 2280 规格的 M.2 M-KEY 卡AIBOX PRO 内部正好有两个这样的槽位。也就是说单卡是 48 GB / 160 TOPS双卡就是 96 GB / 320 TOPS这个扩展空间对边缘设备来说已经相当夸张了。二、硬件上手一张 M.2 卡48 GB 显存第一次把 LQ50 插进 AIBOX PRO 时有点不真实感这么一张跟 NVMe SSD 差不多大的卡背面塞着 48 GB LPDDR5 和一颗 M50 存算一体芯片。它不需要外接电源直接靠 M.2 供电和 PCIe 通信对整机集成非常友好。AIBOX PRO 整机尺寸是 160 mm × 111 mm × 61 mm全铝合金外壳带风扇。这个体积塞下 RK3588 1 块 LQ50再加一个扩展位对于需要本地跑大模型的机器人、工业质检、智能安防等场景来说体积和接口都是及格的。装机后第一件事是确认设备被识别。Linux 下用lspci能看到后摩设备Windows 下则走后摩提供的驱动安装包。驱动装完后SMI 工具可以直接读到芯片温度、功耗和固件版本这套工具链对排障很友好。三、软件栈后摩大道不是单一工具而是一整条流水线后摩给 M50 系列配的是后摩大道软件平台它是一套从底层固件到上层推理的完整栈。根据软件平台概览整个栈大致可以分成四层芯片固件与驱动层芯片固件、Linux/Windows/Android 驱动、HMDML 设备管理库、SMI 系统管理接口、HmUpdateTool 固件升级工具。模型量化、编译与推理层HMQuantool 量化工具、TCIM 模型编译器、TCIM Runtime 推理引擎、Profiler 性能调试工具。开发环境与工具基于 Ubuntu 24.04 的 Docker 标准镜像、Windows MSVC Runtime SDK、Android Native 运行时、部署环境检测工具和模型评测工具集。应用软件开发套件后摩揽月 AI 开发套件包含 HLIE 推理框架、HLAW 中间件等。要在 LQ50 上跑一个大模型标准流程是三步量化用 HMQuantool 做 PTQ 量化。对 LLM 来说通常调用LLMConverter.from_pretrained()配合Qwen2ConvertConfig或Qwen2VLConvertConfig之类的模型配置把 fp16/bf16 模型转成后摩内部格式。精度上常用w4a8权重 4-bit激活 8-bit在显存和精度之间取得平衡。编译用 TCIM 把量化后的模型编译成.hmm执行文件。TCIM 基于 MLIR会做算子融合、异构计算单元映射、内存规划和执行路径优化。推理TCIM Runtime 加载.hmm提供 C 和 Python API。对于 LLM还支持 MTP 多 token 投机解码、Prefix Caching 等加速手段。四、实测数据单卡能跑多远光聊流程没意思直接看官方 M50 模型性能数据。测试环境是 Ubuntu 24.04 Docker 镜像、Intel i7-12700 主机、IPU 核频率 1400 MHz。单卡对应的是 LQ50 M.21 颗 M50 芯片双卡对应 LQ50 Duo2 颗 M50 芯片。模型参数量量化精度芯片数Decode (tps)Qwen3.50.8Bw8a16187.79Qwen3.52Bw8a16145.38CoPaw-Flash9Bw4a8120.52Gemma 426B-A4B (MoE)w4a8127.10Gemma 431B (dense)w4a8210.38Qwen3-next80B-A3B (MoE)w4a8223.40几个让我印象深刻的点MoE 架构在边缘端是降维打击Gemma 4 的 26B-A4B MoE 在单卡上就能跑到 27 tps而同系列的 31B dense 模型必须上双卡才勉强跑到 10 tps。同样 30B 级别MoE 的内存效率和吞吐都更好。w4a8 是大模型的甜点精度4-bit 权重能显著降低显存占用8-bit 激活又比纯 INT4 更稳。看数据也知道官方 benchmark 里大模型基本默认 w4a8。单张 LQ50 的甜点区间是 7B~35B小到 Qwen3.5-2B 的 45 tps大到 26B-A4B MoE 的 27 tps单卡都能舒服地跑超过 35B 的 dense 模型或更大的 MoE 就需要双卡了。五、双 LQ50 的想象空间AIBOX PRO 有两个 M.2 M-KEY 槽位这是它最被低估的设计。单卡 48 GB双卡就是 96 GB单卡 160 TOPS双卡就是 320 TOPS。更关键的是 TCIM Runtime 支持单模型多设备部署能通过芯片间互联做 Pipeline Parallel 和 Tensor Parallel。这意味着可以把一个 80B 级别的 MoE 模型拆开跑在两张 LQ50 上。Qwen3-next 80B-A3B 在双卡上 Decode 能到 23.4 tps这个水平放在边缘盒子里已经很能打了。所以我的判断是如果你现在只需要跑 14B 以内的模型单卡 LQ50 足够如果你未来要跑 30B~80B 的 MoE或者想同时跑多个模型AIBOX PRO 的双 M.2 槽位就是预留的升级路径。六、功耗与散热不是只有跑分规格书上 RK3588 1×LQ50 的典型功耗是 8.4W12V/700mA最大功耗 28.8W12V/2400mA。实测跑 LLM 推理时功耗会动态变化Prefill 阶段短时冲高Decode 阶段相对平稳。后摩提供了功耗和热管理工具支持 DVFS 动态调频。我的实战经验是日常服务场景用默认 DVFS 就够了兼顾性能和功耗对首 token 延迟敏感的场景可以把 IPU 核锁在最高频率AIBOX PRO 机箱自带风扇长期满载建议竖放或留足通风空间用 SMI 随时看结温和功耗比盲调靠谱。七、踩坑与建议量化精度别盲选小模型可以用 w8a16 保精度大模型必上 w4a8否则 48 GB 也扛不住。校准数据要贴近业务HMQuantool 的 PTQ 对校准集敏感别拿跟实际输入分布差太远的数据凑数。开发环境首推 Docker后摩提供的 Ubuntu 24.04 Docker 镜像里工具链齐全比自己从零配环境稳得多。双卡注意 PCIe 带宽AIBOX PRO 主副模组通过 PCIe 互联超大模型 Prefill 阶段的卡间通信会吃掉一部分吞吐跑 benchmark 时要把这个因素算进去。SMI 是排障神器固件版本、驱动版本、温度、功耗一条命令全看到很多问题不用猜。八、总结LQ50 适合谁适合要在边缘端本地跑 7B~35B 级别 LLM/VLM数据不能上云必须本地推理对功耗和体积敏感未来有扩展到双卡、跑更大 MoE 的需求。不太适合只跑 CV 小模型RK1828 性价比更高完全不能接受量化精度损失需要 CUDA/OpenVINO 之类的通用 GPU 生态。整体体验下来LQ50 给 AIBOX PRO 的定位非常明确它不是为了替代服务器 GPU而是把35B 以内大模型的本地推理能力塞进一个边缘盒子里。对机器人、工业边缘、智能安防这些场景来说这种主控大模型推理卡的异构方案可能是目前最务实的落地路径之一。参考资料AIBOX PRO 规格书后摩 M50 软件平台文档 developer.houmoai.com