SimAI 1.5构建高精度AI训练模拟的终极开源工具【免费下载链接】SimAI项目地址: https://gitcode.com/gh_mirrors/si/SimAISimAI 1.5是业界首个面向大规模AI训练和推理的全栈高精度模拟器为研究人员和开发者提供了前所未有的深度洞察能力。这个开源项目不仅能够模拟完整的LLM训练过程还能精确分析推理场景下的多请求处理帮助您在设计阶段就能预测系统性能瓶颈。 为什么需要AI训练模拟在真实的AI集群上进行实验成本高昂且风险巨大。一次错误的架构决策可能导致数百万美元的硬件投资失误。SimAI通过精确的模拟技术让您在代码编写之前就能分析不同并行策略TP/PP/DP的性能影响评估通信算法优化的端到端收益验证网络拓扑设计的合理性预测大规模推理场景下的资源需求SimAI架构图展示从工作负载生成到执行引擎的完整流程 三大核心模拟模式1. 快速分析模式SimAI-Analytical如果您需要快速验证架构设计思路SimAI-Analytical是最佳选择。它通过总线带宽抽象网络通信细节在单台服务器上就能完成复杂的性能分析。./bin/SimAI_analytical -w example/workload_analytical.txt -g 9216 -g_p_s 8 -r test- -busbw example/busbw.yaml实际应用场景对比不同MoE模型中专家数量对训练性能的影响优化TP/EP/PP参数平衡探索不同扩展规模下的并行参数性能研究不同GPU性能下的性价比带宽配置2. 全栈仿真模式SimAI-Simulation当您需要深入研究通信细节时SimAI-Simulation提供了基于NS3的高保真网络模拟。这种模式能够精确再现实际训练环境中的通信行为。# 创建网络拓扑 python3 ./astra-sim-alibabacloud/inputs/topo/gen_Topo_Template.py -topo Spectrum-X -g 128 -gt A100 -bw 100Gbps -nvbw 2400Gbps # 运行模拟 AS_SEND_LAT3 AS_NVLS_ENABLE1 ./bin/SimAI_simulator -t 16 -w ./example/microAllReduce.txt -n ./Spectrum-X_128g_8gps_100Gbps_A100 -c astra-sim-alibabacloud/inputs/config/SimAI.conf研究领域集体通信算法设计与优化网络协议性能评估创新网络架构探索拥塞控制算法研究3. 多请求推理模拟SimAI 1.5新增了端到端的多请求推理模拟能力支持Prefill/Decode分离的复杂场景。这一功能基于Microsoft Vidur的调度组件能够精确模拟现代推理服务的真实负载。时间分布饼图直观展示计算、通信和管道并行延迟的占比️ 模块化架构设计SimAI采用模块化设计核心组件可灵活组合AICB- AI计算基准测试套件SimCCL- 集体通信模拟库astra-sim-alibabacloud- 训练框架模拟ns-3-alibabacloud- 网络模拟引擎vidur-alibabacloud- 推理调度组件 七种应用场景组合SimAI的强大之处在于其组件的灵活组合支持七种不同的应用场景场景描述组件组合AICB测试套件在GPU集群上运行通信模式测试AICBAICB/AIOB工作负载生成推理/训练的计算/通信模式AICB集体通信分析将集体通信操作分解为点对点通信集合SimCCL无GPU集体通信在非GPU集群上执行RDMA集体通信流量AICB SimCCL astra-sim-alibabacloudSimAI分析模式在任何服务器上进行快速AICB工作负载分析AICB astra-sim-alibabacloudSimAI仿真模式在任何服务器上进行全栈模拟AICB SimCCL astra-sim-alibabacloud ns-3-alibabacloud多请求推理模拟使用单台GPU服务器进行完整的多请求推理模拟AICB SimCCL vidur-alibabacloud astra-sim-alibabacloud️ 快速部署指南环境准备# 克隆仓库 git clone https://gitcode.com/gh_mirrors/si/SimAI.git cd ./SimAI/ # 初始化子模块 git submodule update --init --recursive git submodule update --remote # 编译分析模式 ./scripts/build.sh -c analytical # 编译仿真模式NS3 ./scripts/build.sh -c ns3网络拓扑配置SimAI支持多种网络拓扑配置包括DCN、HPN、Spectrum-X等现代数据中心架构HPN 7.0拓扑8 GPU单服务器配置400Gbps A100网卡您可以使用内置的拓扑生成工具快速创建自定义网络配置python3 ./astra-sim-alibabacloud/inputs/topo/gen_Topo_Template.py -topo Spectrum-X -g 128 -gt A100 -bw 100Gbps -nvbw 2400Gbps 性能优化技巧1. 总线带宽自动计算SimAI-Analytical支持自动总线带宽计算无需手动配置复杂的busbw.yaml文件./bin/SimAI_analytical -w ./example/workload_analytical.txt -g 9216 -nv 360 -nic 48.5 -n_p_s 8 -g_p_s 8 -r example-2. 通信算法优化通过SimCCL模块您可以深入分析NCCL通信算法的性能瓶颈模拟完成日志显示通信环、算法协议和资源使用情况3. 推理调度策略对于多请求推理场景vidur-alibabacloud提供了先进的调度算法# 使用Docker构建推理模拟环境 docker build -t image:latest . docker run --gpus all -it --rm image:latest注意对于Hopper架构的GPU需要在Dockerfile中添加ENV FLASH_MLA_DISABLE_SM1001环境变量。 实际应用案例案例1MoE模型并行策略优化某研究团队使用SimAI-Analytical分析DeepSeek-MoE模型在不同专家数量下的训练性能。通过对比32专家、64专家和128专家的配置他们发现在特定网络带宽下64专家配置的端到端训练时间最优通信开销随专家数量增加呈非线性增长通过调整TP/PP比例可将训练速度提升23%案例2数据中心网络架构验证某云服务商在设计新一代AI集群时使用SimAI-Simulation验证了三种不同的网络拓扑DCN单ToR架构- 成本最低但扩展性有限DCN双ToR架构- 提供更好的容错性HPN双平面架构- 最高性能适合大规模训练DCN双ToR架构在成本和性能间取得平衡案例3推理服务容量规划某在线服务提供商使用SimAI的多请求推理模拟功能预测了Llama 3 70B模型在不同并发请求数下的服务能力确定了最优的批处理大小验证了Prefill/Decode分离架构的可行性规划了GPU资源扩容策略 最佳实践配置配置模板astra-sim-alibabacloud/inputs/config/SimAI.conf核心配置参数包括网络带宽和延迟设置GPU类型和数量配置并行策略参数通信算法选择工作负载生成example/workload_analytical.txt工作负载文件定义了模拟任务的详细参数模型结构和层数批量大小和序列长度并行维度和通信模式性能监控vidur-alibabacloud/assets/SimAI提供了丰富的可视化工具帮助您分析模拟结果端到端请求时间分析帮助识别系统瓶颈 社区与贡献SimAI拥有活跃的开源社区定期举办技术研讨会和线上交流活动。项目已被NSDI25 Spring接收相关论文提供了详细的技术实现和性能评估。核心优势开源免费Apache 2.0协议模块化设计易于扩展支持最新AI模型DeepSeek、Qwen3-MoE、Qwen3-Next活跃的社区支持和持续更新 下一步行动快速体验从最简单的分析模式开始了解SimAI的基本功能深度定制根据您的具体需求组合不同的模块组件贡献代码参与开源社区共同完善AI训练模拟生态学术研究基于SimAI开展创新性研究推动AI系统优化SimAI正在重新定义AI系统设计的范式——从经验驱动转向模拟驱动。无论您是AI系统研究员、基础设施工程师还是算法开发者SimAI都能为您提供强大的工具支持帮助您在虚拟环境中验证想法降低实验成本加速创新进程。立即开始您的AI训练模拟之旅探索无限可能【免费下载链接】SimAI项目地址: https://gitcode.com/gh_mirrors/si/SimAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考