
DeepSpeed Windows 安装实战单卡训练、LoRA 微调与 7B 推理一次跑通【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeedds_report在 PowerShell 里跑不出来build_win.bat一敲就cl: 不是内部或外部命令DeepSpeed 是微软的深度学习优化库核心能力是 ZeRO 显存优化与 3D 并行。Windows 上装不装得成卡点通常只有两处编译器工具链和预编译算子。按下面的步骤走你能在这台 Windows 机器上跑通单卡训练、LoRA 微调和 CPU 卸载推理三个场景每一步都有可对照的量化指标。环境速查不满足时的报错与校验命令组件版本约束不满足时的典型报错校验命令操作系统Windows 11 23H222631.3880 实测官方兼容矩阵以 Win11 为准winverPython3.10 ~ 3.11高版本下pip报依赖解析失败python --versionPyTorchtorch2.0.0CUDA 版CUDA error或torch.version.cuda为 Nonepython -c import torch; print(torch.version.cuda)MSVC 生成工具仅源码编译需要cl: 不是内部或外部命令cl依赖清单见 requirements/核心项torch、pydantic、einops、hjson、ninja等Windows 打包规则见 MANIFEST_win.in。主路径pip 装预编译轮子预编译算子已打进 Windows 版包不需要本地 CUDA 工具链这是默认推荐路径。pip install deepspeed0.19.6✅ 预期输出Successfully installed deepspeed-0.19.6deepspeed --version✅ 预期输出deepspeed.info: torch version 2.x.x及deepspeed version 0.19.6ds_report✅ 预期输出PyTorch行显示版本号、CUDA行显示yes、DS_BUILD_OPS相关算子模块全部可 import 加载。ds_report是 Windows 下由 ds_report.bat 提供的批处理入口不需要额外装依赖。备选路径源码编译 wheel适用于需要自定义算子组合的场景⚠️ 前提是已安装 Visual Studio C 生成工具且CUDA_PATH指向 CUDA Toolkit 根目录否则build_win.bat第一步就失败。git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed .\build_win.bat pip install dist\*.whl⚠️ 与主路径的差异build_win.bat 会显式置空 8 个构建开关DS_BUILD_AIO、DS_BUILD_CUTLASS_OPS、DS_BUILD_SPARSE_ATTN、DS_BUILD_DEEP_COMPILE等即稀疏注意力、CUTLASS 推理、DeepCompile 等算子在 Windows 编译产物中是禁用的随后执行python -m build --wheel --no-isolation产出 wheel装法与 pip 路径一致装完照样用ds_report校验。功能验证三个最小用例的量化指标以下命令取自官方 Windows 测试记录RTX A2000 4GB / Win11 23H2 / 训练侧 PyTorch 2.3.0、Transformers 4.41.2。示例脚本来自 DeepSpeedExamples 社区仓库clone 后进入对应目录执行示例目录说明见 examples/。 用例一单卡训练 CIFAR-10验证目标DeepSpeed 引擎接管单卡训练。deepspeed cifar10_deepspeed.py --deepspeed预期指标5 个 epoch 收敛后10000 张测试图平均精度 59%分类别为 cat 100%、frog 65%、ship 60%、bird 56%dog 44% 为最弱类。 用例二LoRA CPU offload 微调 OPT-125M验证目标HuggingFace 模型经 DeepSpeed 引擎微调显存超限部分卸载到 CPU。deepspeed training\step1_supervised_finetuning\main.py --model_name_or_path facebook/opt-125m --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora --print_loss --zero_stage 2 --deepspeed --dtype bf16 --offload --output_dir output预期指标63 步内 loss 从 22.975 降到 5.125Batch Size 16、Sequence Length 512吞吐 0.20~0.25 TFLOPS每步 latency 约 19.7s可稳定迭代超过 590 步。 用例三4GB 显存跑 Llama-2-7B 推理验证目标ZeRO-Inference 把 12.247 GB 权重卸载到 CPU 内存小显存卡完成 token 生成。deepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload预期指标decode 吞吐 12.961 token/sprefill 吞吐 107.071 token/s单条样本 decode 耗时 153.875s总耗时 157.857sGPU 峰值显存 2.747 GB模型 size 12.247 GB、cache size 1.250 GB。排障速查表编译与版本问题三连查典型报错片段根因修复动作cl: 不是内部或外部命令缺 MSVC 工具链安装 Visual Studio 2022 C 生成工具后重开终端CUDA_HOME not set或 wheel 构建失败CUDA_PATH未配置set CUDA_PATHC:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1pip报torch版本冲突依赖解析失败先python -c import torch; print(torch.__version__)再按 requirements/requirements.txt 对齐后重试目录写入报Access denied非管理员终端以管理员身份重开 PowerShell 再执行延伸与下一步多 GPU 分布式与权重量化加速仍在官方开发计划中当前 Windows 版聚焦单卡场景。继续深入可看官方 Windows 发布说明blogs/windows/08-2024/README.md入门教程docs/_tutorials/getting-started.md示例目录examples/Issue 入口仓库 Issues 页面【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考