尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

构建企业私有RAG大模型: (可商用)DeepSeek-V3开源部署,真的强吗?

构建企业私有RAG大模型: (可商用)DeepSeek-V3开源部署,真的强吗? 前言本章将聚焦当前备受瞩目的开源模型 DeepSeek-V3。作为一款自称超越所有开源模型甚至在部分能力上超过闭源模型的产品DeepSeek-V3展现了惊人的潜力。不过从 RAG 系统的实际需求来看采用 DeepSeek-V3 似乎有些“大材小用”它更适合应用于数学与代码等需要强推理能力的场景。下表是DeepSeek-V3官网给出基础模型的测试打分从这份测试报告中可以看到DeepSeek-V3 在代码Code和数学Math领域全面超越了几款主流开源模型尤其是阿里的 Qwen2.5-72B。值得注意的是Qwen2.5-72B 本身已是一款强大的模型尤其在 Code 和 Math 上表现不俗而报告中显示 DeepSeek-V3 的性能超越了它这无疑为业界带来了一次令人瞩目的技术突破进一步巩固了其在高复杂性任务中的领先地位。DeepSeek-V3介绍我们提出了 DeepSeek-V3这是一个强大的混合专家 (MoE) 语言模型总共有 671B 个参数每个 token 激活 37B。为了实现高效的推理和经济高效的训练DeepSeek-V3 采用了多头潜在注意力 (MLA) 和 DeepSeekMoE 架构这些架构在 DeepSeek-V2 中得到了彻底的验证。此外DeepSeek-V3 开创了一种无辅助损失的负载平衡策略并设置了多 token 预测训练目标以获得更强大的性能。我们在 14.8 万亿个多样化和高质量的 token 上对 DeepSeek-V3 进行了预训练然后进行监督微调和强化学习阶段以充分利用其功能。综合评估表明DeepSeek-V3 优于其他开源模型并实现了与领先的闭源模型相当的性能。尽管性能出色但 DeepSeek-V3 仅需要 2.788M H800 GPU 小时即可完成完整训练。此外它的训练过程非常稳定。在整个训练过程中我们没有遇到任何无法恢复的损失峰值或执行任何回滚。摘自DeepSeek-V3官网根据 DeepSeek-V3 官网说明V3 在以下三个方面实现了显著改进架构设计、预训练方法以及训练后优化。这些提升使其在多个任务中展现了更强的性能和更广泛的适用性。架构创新负载平衡策略和训练目标在 DeepSeek-V2 高效的架构之上我们首创了一种无辅助损失的负载平衡策略最大限度地减少了因鼓励负载平衡而导致的性能下降。我们研究了多标记预测 (MTP) 目标并证明它有利于模型性能。它还可以用于推测解码以加速推理。预训练实现终极训练效率我们设计了FP8混合精度训练框架并首次在超大规模模型上验证了FP8训练的可行性和有效性。通过算法、框架和硬件的协同设计我们克服了跨节点 MoE 训练中的通信瓶颈几乎实现了完全计算-通信重叠。这大大提高了我们的训练效率并降低了训练成本使我们能够在不增加额外开销的情况下进一步扩大模型规模。我们以仅 2.664M H800 GPU 小时的经济成本在 14.8T token 上完成了 DeepSeek-V3 的预训练得到了目前最强的开源基础模型预训练之后的后续训练阶段仅需 0.1M GPU 小时。训练后来自 DeepSeek-R1 的知识提炼我们引入了一种创新方法将长思维链 (CoT) 模型特别是 DeepSeek R1 系列模型之一中的推理能力提炼到标准 LLM尤其是 DeepSeek-V3中。我们的流程巧妙地将 R1 的验证和反射模式融入 DeepSeek-V3并显著提高了其推理性能。同时我们还控制了 DeepSeek-V3 的输出样式和长度。DeepSeek-V3部署DeepSeek-V3 可以使用以下硬件和开源社区软件在本地部署DeepSeek-Infer 演示我们为 FP8 和 BF16 推理提供了一个简单、轻量级的演示。SGLang完全支持 BF16 和 FP8 推理模式下的 DeepSeek-V3 模型并即将推出多令牌预测功能。LMDeploy支持本地和云部署的高效 FP8 和 BF16 推理。TensorRT-LLM目前支持 BF16 推理和 INT4/8 量化即将支持 FP8。vLLM支持具有 FP8 和 BF16 模式的 DeepSeek-V3 模型实现张量并行和流水线并行。AMD GPU支持在 BF16 和 FP8 模式下通过 SGLang 在 AMD GPU 上运行 DeepSeek-V3 模型。华为Ascend NPU支持在华为Ascend设备上运行DeepSeek-V3。接下来将详细讲解如何使用 SGLang 和 vLLM 高效部署 DeepSeek-V3 的具体步骤。SGLang部署DeepSeek-V3GPU建议8 个 NVIDIA H200 GPU。如果您没有具有足够大内存的 GPU请尝试多节点张量并行。安装和启动如果启动服务器时遇到错误请确保权重已下载完成。建议提前下载或多次重启直到下载完所有权重。使用 Docker推荐# Pull latest image# https://hub.docker.com/r/lmsysorg/sglang/tagsdocker pull lmsysorg/sglang:latest# Launchdocker run--gpusall--shm-size 32g-p30000:30000-v~/.cache/huggingface:/root/.cache/huggingface--ipchost lmsysorg/sglang:latest \ python3-m sglang.launch_server--model deepseek-ai/DeepSeek-V3--tp8--trust-remote-code--port30000对于高 QPS 场景添加--enable-dp-attention参数以提高吞吐量。使用 pip# Installationpip installsglang[all]0.4.1.post5--find-links https://flashinfer.ai/whl/cu124/torch2.4/flashinfer# Launchpython3-m sglang.launch_server--model deepseek-ai/DeepSeek-V3--tp8--trust-remote-code对于高 QPS 场景添加--enable-dp-attention参数以提高吞吐量。使用 OpenAI API 发送请求importopenai clientopenai.Client(base_urlhttp://127.0.0.1:30000/v1,api_keyEMPTY)# Chat completionresponseclient.chat.completions.create(modeldefault,messages[{role:system,content:You are a helpful AI assistant},{role:user,content:你真的那么强吗},],temperature0,max_tokens64,)print(response)vLLM部署DeepSeek-V3vLLM v0.6.6 支持 NVIDIA 和 AMD GPU 上 FP8 和 BF16 模式的 DeepSeek-V3 推理除了标准技术外vLLM 还提供_管道并行性_让您可以在通过网络连接的多台机器上运行此模型。介绍管道并行单 GPU无分布式推理如果您的模型适合单 GPU则可能不需要使用分布式推理。只需使用单 GPU 运行推理即可。单节点多 GPU张量并行推理如果您的模型太大无法放入单个 GPU但可以放入具有多个 GPU 的单个节点则可以使用张量并行。张量并行大小是您要使用的 GPU 数量。例如如果您在单个节点中有 4 个 GPU则可以将张量并行大小设置为 4。多节点多 GPU张量并行加流水线并行推理如果您的模型太大无法放入单个节点则可以将张量并行与流水线并行结合使用。张量并行大小是您希望在每个节点中使用的 GPU 数量流水线并行大小是您希望使用的节点数量。例如如果您在 2 个节点中有 16 个 GPU每个节点 8 个 GPU则可以将张量并行大小设置为 8将流水线并行大小设置为 2。简而言之您应该增加 GPU 数量和节点数量直到您有足够的 GPU 内存来容纳模型。张量并行大小应该是每个节点中的 GPU 数量管道并行大小应该是节点数量。安装和启动通过查阅 vLLM 的 issue 列表可以发现目前 vLLM 对 DeepSeek-V3 的支持仅处于基础运行阶段性能尚未达到预期。因此暂不提供安装和启动的详细指南。待 vLLM 的增强计划完成后我们会及时更新相关内容并提供完整的部署说明。部署推荐建议企业采用SGLang部署DeepSeek-V3写在最后DeepSeek-V3 在代码和数学领域表现突出对于关注这些方向的企业来说无疑是一大喜讯。毕竟这两项能力在市场上有着广阔的应用前景而以往具有高性能的模型大多为闭源且高成本。DeepSeek-V3 的出现以开源形式提供了强大的能力不仅降低了门槛也为创业和技术创新提供了更多可能性。它的发布在大模型领域引发了不小的轰动为行业带来了更多选择和活力。题外话在 DeepSeek-V3 提供的聊天门户中我尝试了一段 Prompt 的生成出于好奇将这段 Prompt 分别用于测试文心一言、豆包、Kimi、元宝和通义等模型。结果如何你们一定想不到建议大家亲自尝试一下。Prompt如下帮我写 1 个面向年轻女性宣传一款内衣的品牌营销slogan简洁吸睛富有创意字数要求150字。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表