突破长上下文瓶颈:72GB桌面端显卡加持下的智能体效能评测
AI 正在从“聊天时代”迈向“ Agent 时代”。我们正在迎来一个多模态、长上下文、深度推理的Agent智能体时代。未来的 AI 不仅能够回答问题还能调用工具、理解复杂任务、保持长期上下文记忆并自主完成多步骤推理与执行。这一趋势正在重塑 AI 基础设施需求无论是百万级 Token 长上下文处理、多智能体协同运行还是 RAG 知识库检索、多模态推理与本地模型微调。相较于单纯的计算性能显存容量与显存带宽正成为本地 AI 部署的关键瓶颈。如何选择一个高效的硬件平台我们打算做一系列的 AI 大模型性能测试来评估及验证新一代 NVIDIA Blackwell 显卡对大模型的支持尤其是对Agentic AI应用场景下的支持与性能表现。给大家在部署 Agentic AI 方案时提供必要的参考与推荐信息。硬件测试平台硬件平台我们选择了Dell Precision 7960 Tower旗舰级别的塔式工作站可以支持我们从单张 GPU、双卡 GPU、到四卡双宽 GPU的性能验证同时内存还能最大扩展到 4TB DDR5保障较大参数量的模型也能稳定加载稳定执行从轻量级到重负载的推理任务实现更全面地推理实验与性能验证。GPU 选型选择了 NVIDIA Blackwell 架构的顶级专业显卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB)也是目前最新款的桌面端专业卡。Blackwell 架构在 AI 推理方向的技术创新是极具突破性的。采用第五代 Tensor Core引入 FP4 精度直接拉升了大模型推理任务的运行效率以及整体基础设施的利用效能。PCIe 5.0 极大提高了 CPU 与 GPU 间的数据吞吐效率GDDR7 显存带来了超高的显存带宽。显存容量的再次攀升也使得桌面端显卡逐步能够承载更大规模的推理任务。NVIDIA RTX PRO™ 5000 Blackwell (72GB) 是 Blackwell 架构桌面显卡中从显存容量、计算能力、稳定性等各维度上能力全面、性能非常强劲的一款显卡尤其对于Agent 执行复杂任务来说超大显存可以原生承载更大规模的模型支持长上下文、多模型并行加载同时又有很强的可靠性和成本优势。NVIDIA RTX PRO™ 5000 Blackwell图片来源于 NVIDIA在 Dell Precision 7960 Tower 平台上分别搭载单卡、双卡和四卡的 NVIDIA RTX PRO™ 5000 Blackwell (72GB)即可拥有 72GB、 144GB、 288GB 的 GPU 显存容量我们在此硬件配置下分别适配不同的模型与智能体场景来全面地验证 Blackwell 显卡在不同智能体任务负载下的表现。模型选择智能体应用中选择合适的模型需要综合考虑任务复杂度、响应速度、效率与并发等需求。我们测试中选择了不同规模大小的模型。测试采用原生模型精度作为基准并未进行额外的后训练或微调以此反映模型在真实场景下的表现验证在 Blackwell 平台的性能输出。测试模型软件环境NVIDIA Driver: 580.xCUDA Toolkit: 12.8vLLM: 0.20.0PyTorch: 2.10场景选择与测试指标我们测试采用vllm推理框架选用三类梯度场景覆盖从基础交互、主流落地到极限生产力的场景。为了贴合实际 Agent 的使用习惯测试用例中的输入 token 数量设置为 4K、20K、40K符号主流的智能体使用情况。测试场景短对话4K 输入/ 200 输出基准性能摸底验证日常推理任务的稳定性。智能体任务20K 输入/ 200 输出模拟完整的 Agent 闭环任务包含 Prompt 指令约束、工具调用调度、RAG 检索文本拼接、多轮对话记忆、简单数据解析等复合操作。验证日常 Agent 工作流性能。超长上下文40K 输入/ 200 输出智能体任务高阶场景包括长文档分析、长日志运维研判、多轮智能体连续复盘、自动化代码编写等任务。对于显存容量、带宽、缓存调度能力要求极高。能够验证硬件在极端任务情况下的性能边界。测试指标首字延迟 (TTFT)收到请求到输出首个 Token 的时间。P50 吞吐率1/ITL即平均每用户每秒生成 Token 的数量 (tokens/s)取中位数。总吞吐率单位时间内的系统总吞吐率峰值即所有用户在单位时间内秒的吞吐率之和。智能体应用场景实测与分析接下来我们对各个模型进行了多场景的测试以 DeepSeek-V4-Flash-284B-NVFP4 模型为例来看看具体的测试数据。DeepSeek V4 Flash-284B-NVFP4参数量 284B精度 NVFP4加载全部参数至少占用 160GB 显存大小。所以我们配合的测试平台Dell Precision 7960 塔式工作站 四张 NVIDIA RTX PRO™ 5000 Blackwell (72GB)显卡总显存为 288GB完美支持 DeepSeek V4 Flash 原生模型的运行。测试场景 A短对话4K 输入 200 输出测试数据报告使用 P50 中位数指标包括 median_ttft首字时延和 median_itlToken 间延迟吞吐率通过 1/median_itl 计算得出最高吞吐和平均吞吐代表 token 的总吞吐量通过获取测试期间所有 1 秒窗口的吞吐量来计算最大值和平均值。性能趋势图 (P50)吞吐量时序图并发 8并发 16性能分析随着并发数增加用户的首字时延快速增加。NVIDIA RTX PRO™ 5000 Blackwell (72GB) 四卡并行时可以比较好地支持 DeepSeek V4 Flash 短对话场景的 8-16 个并发。测试场景 B智能体任务20K 输入 200 输出性能趋势图 (P50)吞吐量时序图并发 4并发 8性能分析智能体应用的首字时延对用户体验影响不会特别大。在此场景中我们更关注吞吐率。在四卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 的支持下智能体任务的并发在 8-16 之间体验良好。测试场景 C超长上下文40K 输入 200 输出性能趋势图 (P50)吞吐量时序图并发 4并发 8性能分析超长上下文对于首字时延关注略小。即使是这样较为复杂的智能体场景四卡 NVIDIA RTX PRO™ 5000 Blackwell72GB还是可以支持到 4-8 个的并发。考虑到 KV cache 的加持实际的并发用户数量还可以再多保守估计 10 个用户是没有问题的。综合实测结果根据上述方法我们依次测试了其他模型并根据测试结果整理了相应的模型使用推荐及硬件适配建议。智能体应用性能优化测试除了硬件配置还有一些关键的优化实践可以让智能体应用效率大幅提升更好地释放硬件性能。我们同样基于这台 Dell Precision 7960 塔式工作站特别进行了 3 项性能拓展测试NVFP4 精度优化对比KV Cache TurboQuant 性能增益MTP 性能增益专项测试拓展测试一NVFP4 性能跃升得益于Blackwell的张量计算支持Blackwell 架构显卡支持 NVFP4 精度可以在几乎不影响模型效果的前提下相比 FP8将模型权重显存占用减少约 75%有效支撑翻倍的上下文长度或批处理大小。对于以长上下文处理为核心痛点的智能体应用来说 NVFP4 的价值尤为突出。DeepSeek v4 在发布时即支持 NVFP4在主流模型中NVFP4 已经逐渐成为推理应用中的一个重要方向。为了验证 NVFP4 带来的性能提升我们选用了 Qwen3.6-35B-A3B、Gemma-4-26B-A4B 两个模型分别进行 FP16 与 FP4 精度下的性能对比测试。测试场景短对话4K 输入/ 500 输出、智能体任务 (20K 输入/ 500输出)、超长上下文场景 (40K 输入/ 500 输出) 。测试指标吞吐率、首字时延。Qwen3.6-35B-A3B (FP16 vs NVFP4)Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比GPU:2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的首字时延对比GPU:2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)根据 Qwen3.6-35B-A3B 的测试结果我们可以看到NVFP4 相比 FP16首字时延降低约 18-20%。最高吞吐量在中高并发8-64区间提升显著约为 22%-45%。在高负载的长上下文场景中首字时延与最高吞吐量效率提升都非常明显。Qwen3.6-35B-A3B 模型在 NVFP4 的加持下综合性能提升 20%-45%。并发数在 8 以上的时候可以获得最佳收益。Gemma-4-26B-A4B (FP16 vs NVFP4)Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比GPU:NVIDIA RTX PRO™ 5000 Blackwell (72GB)Gemma-4-26B-A4B模型在 FP16、FP4 精度下不同场景的首字时延对比GPU:NVIDIA RTX PRO™ 5000 Blackwell (72GB)在 Gemma-4-26B-A4B 模型测试中可以发现NVFP4 相比 FP16 的首字时延降低约 22-35%长上下文场景中的降幅更大34% 以上。最高吞吐量的提高同样显著。在高负载的长上下文场景中综合性能提升约为 40%-130%NVFP4 带来的性能收益非常高。综合以上模型的测试我们认为在 Blackwell 平台上NVFP4 精度能大幅提升 Agent 应用的长上下文处理效率。基于此开发者可将其作为推理任务的优选方案以充分发挥硬件潜能有效应对高并发、长序列的复杂场景。拓展测试二KV Cache TurboQuant 性能增益当前大模型之所以占用大量的显存根本的原因就是 KV Cahce 非常占用资源所以业界就有了动态 KV Cache 量化压缩的做法以节约显存。我们采用 NVIDIA TurboQuant KV Cache 量化方案采用双卡 NVIDIA RTX PRO™ 5000 Blackwell72GB GPU主要针对 Qwen 3.6-35B-A3B 模型 (use via --kv-cache-dtype turboquant_k8v4: FP8 keys 4-bit values, 2.6x, 1.17% PPL)对其优化前与优化后的智能体使用场景进行测试以评估 TurboQuant 带来的性能增益。测试场景短对话场景4K 输入 200 输出、智能体任务场景20K 输入 200 输出与超长上下文场景40K 输入 200 输出。Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的吞吐率对比GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的首字时延对比GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)通过对比 TurboQuant 有无开启的情况我们发现KV Cache TurboQuant 主要优化的是 Prefill 阶段的性能能够一定程度降低首字时延这点在智能体任务与超长上下文场景中的增益最为明显。但在高并发场景下会带来吞吐率的下降建议控制在 32 并发以内获得最佳性能。拓展测试三MTP 性能增益Multi-Token-Prediction (MTP) 是为提高大模型推理的吞吐率而提出的方法。我们采用Qwen 3.6-27B模型基于双卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) GPU在以上相同的智能体应用场景中展开对比测试。Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的吞吐率对比GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的首字时延对比GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)MTP 在轻负载下是提速利器在低并发场景下开启 MTP 可获得最佳收益例如在短对话和智能体任务场景中并发数在 8 以内可获得 12%-60% 的吞吐率提升。在重负载场景或超高并发的情况下则建议关闭 MTP。不止于性能经过多轮完整测试验证Dell Precision T7960 工作站搭配 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 展现出了超强的智能体推理能力突破超长上下文的性能瓶颈并发性能出色而且办公室使用非常友好。即使在 GPU 满载的情况下机器噪音可以控制在50 分贝以内显卡温度保持在85 度实现办公室静音运行。对于成长中的开发团队来说性价比也极具吸引力。从单卡轻量起步到四卡超大模型配置灵活可调轻松覆盖不同场景。无需重金投入就能在桌面端部署顶级模型推动 Agent 应用开发这样的选择何乐而不为