深度剖析 AMD GFX1250:架构革新、功能升级,能否挑战英伟达市场地位?
与 RDNA4 的相似之处与消费级架构最大相似处是有由两对 SIMD32 阵列组成的 WGP且每个 CU 有四个 SIMD与 GCN 和 CDNA 架构相同。软件无需区分 WGP 中的两个 CUAMD 似互换使用相关术语。缓存层级变化使这种区分对编译器无意义因整个 WGP 共享向量 L0 缓存。与 RDNA 不同GFX1250 仅在 Wave32 模式下运行此前 CDNA GPU 只能运行 Wave64 模式程序移植可能出现异常内核需重新评估。此外GFX1250 每个 SIMD 可运行 20 个波前比 RDNA4 多四个。尚不清楚这些特性是否是 AMD GPU 发展方向未来 AMD GPU 可能锁定 Wave32 模式“WGP”架构或逐渐淘汰但短期内不会发生。与 RDNA4 类似GFX1250 具备“WMMA”支持是其大部分机器学习能力来源。RDNA4 动态 VGPR 分配功能缺失模式切换功能存在但分配新寄存器指令为无操作。(C)DNA 架构的变化GFX125X 最大变化之一是SIMD 中每个波前可从寄存器文件寻址多达 1024 个向量通用寄存器VGPR相比之前 CDNA 架构和 RDNA 系列 GPU 是重大改进。未来可能应用于下一代 GPU IP但短期内不会实现。每个波前最大可寻址本地内存LDS为 320kB是 CDNA4 的两倍远超 RDNA 的 64kB。GFX125X 将 LDS 和向量 L0 缓存合并为 WGP 缓存WGP$GFX1250 拥有 448KB 单一结构可按需分配。GFX1250 支持打包 fp32 操作向量宽度是 RDNA 的两倍。此外它继承了 CDNA 架构更多且更强大的 SDMA 单元。图形支持英伟达和英特尔加速器保留了一些图形硬件而 GFX125x 与之不同无导出指令、图像纹理指令、BVH光线追踪指令、向量参数插值指令不支持 MTBUF类型化缓冲区指令、MUBUF无类型缓冲区指令、LDS 参数和参数直接加载。GFX125x 更像纯计算加速器移除图形功能或节省芯片空间去除无用功能较为合理。张量运算MI455X 的核心特性在于 AI 能力张量单元是关键AMD 结合 RDNA4 简单编程模型与 CDNA4 高性能和强大功能。在 RDNA4 上WMMA 操作 M N K 16但 4 位操作 K 32。GFX1250 保持 M N 16K 值与 CDNA4 相同i4 操作 K 值保持在 RDNA4 水平i4 在大型 AI 推理场景不再流行。GFX1250 稀疏 WMMA 操作每条指令工作量比密集操作少。RDNA4 和 CDNA4 分别支持特定格式矩阵GFX1250 支持 CDNA4 和 RDNA4 中除 fp64 外的所有数据类型还支持 OCP MX 风格缩放。此外新增指令允许在 LDS 中转置子矩阵这些指令的 fp4/fp6 版本有特性标志可能预示功能会出现在消费级 GPU 上。与 CUDA 兼容集群这是 AMD 对英伟达“线程块集群”的回应可将集群调度到特定着色器引擎未来可能应用于图形硬件。除访问集群信息外AMD 引入集群级加载功能允许在集群内其他工作组访问 LDS类似英伟达的集群共享内存。英伟达称此为“分布式共享内存”AMD 版本工作方式类似但英伟达实现中同步开销高AMD 首次实现效果未知。屏障GFX1250 增加对集群级屏障的支持提供屏障到达内联函数还实现了完整的监视器允许在特定缓存行被逐出 L2 缓存时通知波前。目前不清楚这些功能用途但 GPU 程序员或能发现实用场景。除 RDNA4 已有屏障GFX1250 还支持 16 个命名屏障对象可能是为兼容性添加。超越函数AMD 为硬件添加对双曲正切tanh的支持单元得到改进增加对 bf16 的支持fp32 操作延迟从 RDNA4 的 9 个周期降低到 GFX1250 的 8 个周期。协作原子操作有了 GFX1250可使用内联函数对全局内存进行 32x4B、16x8B 和 8x16B 的原子加载和存储实际是 128B 原子内存操作。硬件层面是常规加载或存储操作能确保在总线上正确传输。此功能或用于加速 RPCS3 的 Cell 模拟目标可能是加速 ROCm 集体通信库。CDNA 支持的 LL128 格式改为与英伟达相同这些操作无法通过 PCIe 进行但可通过 CXL 和 UALink 使用英伟达也有类似限制。张量数据移动英伟达称此功能为“张量内存加速器”早期 CDNA 版本已有一定程度支持现在增加更多张量相关特性。基本版本允许在不使用 VGPR 的情况下将数据从全局内存加载到 LDS。因涉及类型不透明不清楚张量版本具体能力代码和文档也不清晰其能力可能与英伟达的 tcgen05.cp 类似只是数据传输位置不同。向量内存的显式预取GFX1250 增加对向量内存的显式预取功能AMD 终于添加此在许多老 CPU 上有的功能英伟达从 Fermi 架构就支持。GPU 很少寄存器不足可提前加载数据隐藏延迟但推理内核或能从该功能获得微小性能提升。数据依赖在 AMD GPU 和加速器中硬件大多能自动识别数据依赖关系但某些情况需手动处理。GCN 及后续 CDNA 架构有三个计数器用于等待操作完成分别是 VM_CNT、LGKM_CNT、EXP_CNTCDNA 中未使用。这些计数器存在不同类型指令无序返回问题可能需插入更多等待操作。AMD 为 RDNA4 重新设计指令集有更多细粒度计数器如 LOADcnt、STOREcnt 等。与 GFX1250 之前架构相比RDNA4 在更多情况下可避免显式暂停核心。在 GFX125x 中无 SAMPLEcnt、EXPcnt、BVHcnt 图形等待计数器但有 ASYNCcnt、TENSORcnt、Xcnt 新计数器Xcnt 可保证 XNACK 重放期间的原子性。总结GFX1250 是一次很好的改进AMD 在功能上追赶英伟达的 Hopper 和 Blackwell 架构希望凭借 MI455X 和 HeliosAMD 不仅在理论性能上超越英伟达还能在实际性能上挑战其市场地位。