尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Windows 装 DeepSpeed 不再难:从 pip 安装到 ZeRO-Inference 的完整教程

Windows 装 DeepSpeed 不再难:从 pip 安装到 ZeRO-Inference 的完整教程 Windows 装 DeepSpeed 不再难从 pip 安装到 ZeRO-Inference 的完整教程【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed在 Windows 的 PowerShell 里敲下deepspeed --help却只看到「不是内部或外部命令」如果你也这样这篇文章就是为你写的。过去 DeepSpeed 的核心能力ZeRO、流水线并行、MoE基本只属于 Linux 用户Windows 用户要么绕道 WSL要么租一台云端虚机。现在不一样了本文带你完整走一遍 Windows 下安装与使用 DeepSpeed 的路径——环境自检、选一条安装路线装起来、用ds_report验证最后上手 CIFAR-10 训练和 Llama-2-7B 推理。读完你就有一台能跑 DeepSpeed 的 Windows 机器。环境自检先对照这 4 项 ✅它们都是 Windows 跑 DeepSpeed 的前置条件缺哪项先补哪项检查项要求系统Windows 11 23H2 及以上推荐Python3.x任意主流发行版PyTorch带 CUDA 支持的版本且 CUDA 版本与显卡驱动匹配GPU单张 NVIDIA 显卡即可官方实测环境为 RTX A2000 4GB 显存注意该能力从 DeepSpeed 0.14.5 版本起提供pip list看到的版本更低时先执行pip install -U deepspeed升级。官方实测环境可对照 README.md 核对。安装路线选择两条路二选一只想用起来走路线 A想折腾源码走路线 B。路线 Apip 一键装 DeepSpeed适合大多数人PowerShell 里一行搞定pip install deepspeed和 Linux 的区别在于Windows 的 wheel 已预编译全部算子不需要CUDA SDK 或 C 编译器整个包也就几十 MB。下面的终端输出就是成功状态结尾会看到Successfully installed deepspeed-0.14.5路线 BDeepSpeed 源码编译 Windows适合两类人需要未发布版本新特性的人、想动手改算子的人。克隆仓库后直接跑构建脚本git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed build_win.bat脚本会关闭 AIO、GDS、Sparse-Attention 等非必要算子后编译把 wheel 产物放到dist/目录再用pip install装上dist/里的 wheel 即可。编译大约需要十来分钟嫌慢的话就回路线 A省心。验证与排障ds_report 验证安装是否成功装完不等于能跑执行ds_report做一次全面体检它会自报机器配置、CUDA、NCCL 等关键信息ds_report输出类似下图、GPU 和 CUDA 版本、各库信息都齐全时说明 DeepSpeed 在 Windows 上的安装是成功的高频问题排障报错了先看这张表三行都是社区里最高频的坑症状可能原因修复方法源码编译报缺编译器/链接器错误未安装 Visual Studio 的 C 工作负载安装 VS 2019 及以上并勾选「使用 C 的桌面开发」工作负载细节见 advanced-install.md运行时报 CUDA 相关错误PyTorch 的 CUDA 版本与当前环境不匹配执行python -c import torch; print(torch.version.cuda)查看版本再对齐 PyTorch 安装版本训练/推理直接崩提示显存不足模型装不下 GPU 显存打开 CPU offload如--cpu-offload或调小 batch size、序列长度动手实践安装确认后直接跑两个真实场景。脚本都来自 DeepSpeedExamples 仓库先把它 clone 下来再执行。场景一CIFAR-10 快速训练用training/cifar目录下的脚本一行启动deepspeed cifar10_deepspeed.py --deepspeed约 500 步训练后测试集精度在 59% 左右终端会打印各类别plane、car、bird…的准确率明细——这就是 DeepSpeed 引擎下单 GPU 训练的基本形态场景二ZeRO-Inference Windows4GB 显存跑 Llama-2-7B最出效果的一步 ⚡️ZeRO-Inference 把模型权重卸载到 CPU 内存让只有 4GB 显存的机器也能做 Llama-2-7B 生成deepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload从图中可以看到模型体积约 12.2GB峰值显存占用仅 2.7GB生成结果与吞吐统计都正常。用这套组合拳原本装不进显存的模型在 Windows 上也能推起来展望与社区入口目前 Windows 已支持单 GPU 的训练、微调与推理多 GPU 与权重量化已在路线图上。遇到其他问题欢迎去项目仓库提 Issue或参考 CONTRIBUTING.md 提交贡献。第一次跑通最费劲之后就顺了。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表