尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

国内首个全国产十万卡AI集群曙光8000正式投用,落户郑州超算节点

国内首个全国产十万卡AI集群曙光8000正式投用,落户郑州超算节点 国内首个全国产十万卡AI集群曙光8000正式投用落户郑州超算节点2026年7月10日中科曙光在郑州宣布国内首个全国产十万卡AI超集群—曙光8000登峰正式落成投用同步接入国家超算互联网郑州核心节点。上线首周这套集群就实现了满载运行日均处理作业数突破15万个。在国产算力讨论了多年“卡脖子”“替代难”的当下这套十万卡规模、全链路国产化的超集群落地意义远不止“又多了一套大算力”。它证明了一件事国产算力已经从单点技术突破走到了体系化、规模化落地的阶段。十万张加速卡没有一张进口GPU从芯片、服务器、网络、存储到散热、软件栈、应用生态全链路自主可控。这样的规模和完成度放在五年前是不敢想的。图1曙光8000登峰全国产十万卡AI超集群真机来源中科曙光官方一、全栈全国产到底“国产”到什么程度很多人对“全国产集群”的理解还停留在“用了国产芯片”的层面。但曙光8000的国产化是从底层芯片到上层应用的全链条覆盖每一个核心环节都没有海外卡脖子的风险。1. 算力底座海光全系列芯片十万张零进口GPU曙光8000的算力核心全部采用海光系列国产芯片通用计算用海光C86系列多核CPUAI加速用海光深算四代DCU整集群十万张加速卡没有一张进口GPU是真正意义上的纯国产算力底座。更关键的是这套芯片体系深度兼容CUDA生态大幅降低了原有大模型、科研代码的迁移改造成本。过去国产算力最大的痛点不是“算不动”而是“软件跑不起来”。大量AI代码都是基于CUDA写的换国产芯片要重写成本极高。曙光8000解决了这个核心痛点兼顾了国产化安全和工程落地实用性。同时这套集群支持FP64到INT8全精度计算既能跑高精度的科学计算、工业仿真也能做大模型训练和AI推理不是只能做单一任务的专用集群。2. 高速互联自研scaleFabric网络打破十万卡通信墙超大规模集群的性能瓶颈从来都不是单卡算力而是卡与卡之间的通信。十万张卡要协同工作数据传输慢一毫秒整体训练效率就会打很大的折扣。过去这个领域一直被海外的InfiniBand技术垄断国内集群要么买授权要么性能上不去。曙光8000采用了自研的scaleFabric类IB原生RDMA高速网络端口带宽达到400Gbps端到端延迟低于1微秒实现了十万卡规模下的无损互联。这是国内首次在十万卡级集群上用上自研的高速互联网络彻底打破了海外在这个领域的垄断。举个直观的例子传统万卡集群跨节点通信延迟通常在几微秒甚至十几微秒规模到十万卡之后通信损耗会让整体算力利用率掉到50%以下。而曙光8000靠自研的网络协议和硬件把十万卡规模下的通信延迟控制在了微秒级保证了集群的整体算力利用率。3. 存储与散热核心技术全部自研大模型训练对存储的要求极高海量数据要快速读写不然算力就会闲着等数据。曙光8000配套的ParaStor分布式存储系统在2026年全球IO500榜单中拿到了生产型全节点和10节点性能双榜第一完全能支撑十万卡集群的海量数据读写需求。散热则是十万卡集群的物理瓶颈。十万张加速卡满负荷运行总功耗是一个惊人的数字传统风冷根本压不住。曙光8000采用了全球领先的浸没式相变液冷技术把服务器整个泡在绝缘的冷媒液体里靠液体相变带走热量。这套液冷方案能支撑单机柜MW级的功率密度全年自然冷却条件下PUE低至1.04几乎接近理论极限。同时冷媒是国产的余热还能回收利用真正做到了绿色高效。图2曙光8000全链路技术架构示意图来源中科曙光官方二、十万卡的难度远不止“把卡堆起来”很多人会说不就是把一万卡复制十份吗有什么难的实际上集群规模从万卡到十万卡所有的工程问题都是指数级上升的不是简单的数量叠加。1. 超智融合不是两套系统拼在一起传统的算力中心超算和智算是分开的一套集群跑科学计算用FP64高精度另一套跑AI训练用FP16/INT8低精度。两套系统物理隔离资源利用率很低经常一边闲得慌一边不够用。曙光8000走的是“超智融合”的原生架构没有物理分区同一个集群既能跑科学计算也能跑大模型训练资源可以动态调度。这在工程上难度非常大要解决异构算力协同、精度切换、任务调度等一系列问题但是带来的收益也很明显集群整体资源利用率能提升30%以上。现在很多科研和产业场景本身就是科学计算和AI结合的比如新药研发既要做分子动力学模拟又要跑AI模型预测。过去要在两套集群之间来回导数据效率很低现在在曙光8000上可以一站式完成。2. 高密度与可靠性十万卡的工程挑战曙光8000采用了全球首创的高密度机柜结构单个计算单元的算力密度比行业主流超节点提升了20倍也就是说同样的机房空间能放下20倍的算力。这背后是供电、散热、结构设计等一系列工程能力的突破。更难的是可靠性。十万张卡每天都会有几张卡出现故障怎么做到故障不影响整个集群的运行曙光8000有一套智能运维和调度系统能自动检测故障隔离故障节点把作业迁移到健康的节点上用户几乎感知不到故障。上线首周就满载运行日均处理15万个作业这个数据本身就说明了这套系统的稳定性已经达到了商用级别。如果系统不稳定是不敢这么快满载的。3. 全链路协同不是拼凑是自研优化过去很多国产集群是把不同厂商的国产硬件拼在一起兼容性差性能损耗大。曙光8000不一样从芯片、服务器、网络、存储到散热、软件栈全都是曙光体系内自研的从底层就做了协同优化性能损耗比拼凑的系统小很多。这种全链路的自研能力才是大规模集群最核心的竞争力。单卡性能可以慢慢追但是系统级的工程能力是要靠一个个项目堆出来的没有捷径可走。图3曙光浸没式相变液冷系统内部示意图三、产业意义国产算力的规模化时代来了曙光8000的落地标志着国产算力进入了一个新的阶段从过去的“单点技术突破”走到了“体系化、规模化落地”的阶段。它的价值远不止郑州多了一套大算力。1. 接入全国算网算力变成普惠服务曙光8000不是某个企业自用的集群它已经接入了国家超算互联网面向科研高校、企业甚至个人用户开放提供普惠的算力服务。过去十万卡级的大算力只有头部互联网公司和少数科研机构能用得起中小团队根本碰不到。现在通过超算互联网哪怕是一个小创业团队也能按需使用十万卡级的国产算力大大降低了AI创新的门槛。2. 应用生态已经跑通不是空架子很多人担心国产集群“有算力没应用”这个问题在曙光8000上已经得到了解决。目前在十万卡核心节点上已经完成了300余项超智融合应用的优化覆盖大模型、机器人、汽车、创新药、新材料、量子计算、天文气象等二十多个领域。也就是说这套集群不是摆样子的是真的在解决实际的科研和产业问题。有了应用生态国产算力才能真正形成正循环用的人越多生态越好成本越低用的人就更多。3. 带动全产业链升级十万卡的规模对上游产业链的带动作用是巨大的。从芯片设计、晶圆制造到服务器组装、液冷设备再到软件栈开发整个国产算力产业链都会因为大规模的订单而快速迭代成本也会随着规模上升而下降。过去国产芯片最大的问题是没有大规模应用迭代慢成本高。现在有了十万卡甚至未来更多的大规模集群订单国产芯片的迭代速度会越来越快性能和成本都会快速追上海外产品。4. 客观看待差距走自己的路当然我们也要客观看到差距单卡性能和海外最顶尖的产品相比还有不小的距离高端软件生态也还需要时间完善。但是国产算力走的不是和海外一样的路不是单纯堆单卡性能而是靠系统级创新、全链路协同优化来补短板。就像昇腾靠系统级创新做出了全局统一内存架构曙光靠全链路自研做出了十万卡的全国产集群。我们的优势在系统工程、在产业链完整性、在巨大的国内市场这些都是海外厂商比不了的。曙光8000的落地可以说是是国产算力发展路上的一个里程碑。也给了我们更多的信心国产算力不仅能做出来还能做到十万卡的规模还能稳定运行还能支撑实际的科研和产业应用。过去我们总说国产算力“能用但不好用”现在这个情况正在快速改变。从万卡到十万卡从单点突破到全链路国产化从实验室样机到规模化商用国产算力的进步速度比很多人想象的要快。可以预见接下来几年会有更多十万卡、甚至百万卡级的全国产算力集群落地支撑国内的AI、科学计算和产业数字化发展。算力是数字经济的底座有了自主可控的大规模算力底座我们的数字经济才能走得更稳、更远。作者张星河zen每天一份高质量研报持续聚焦芯片半导体、AI基础设施、AI智能硬件、具身智能、光通信等硬科技方面的行业分析、技术研究与分享。欢迎您的关注
返回列表