尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI服务器非隔离总线转换器解析:Osprey系列高效48V转12V方案

AI服务器非隔离总线转换器解析:Osprey系列高效48V转12V方案 做数据中心电源的朋友看到OmniOn Power这次推的Osprey系列非隔离总线转换器应该会下意识点头AI服务器供电链路里最让人头疼的“48V到12V”这一段终于有厂商认真做高度定制化的高效方案了。这几年行业基本达成共识GPU服务器从12V母线往48V中间母线架构迁移但中间那级总线转换到底怎么做才划算一直没个标准答案。传统隔离型bus converter能做到94%-96%效率但体积、成本、热都压不下来再往上堆功率板子散热和PCB空间直接报警。Osprey直接走“非隔离”路线就是冲着效率、功率密度和成本这三件事来的。这篇文章就围绕这条技术路线展开为什么非隔离总线转换器在AI服务器里站得住脚、Osprey这类产品内部到底怎么实现高效率和低损耗、实际选型和系统集成该怎么测怎么调以及我踩过的几个坑。适合正在做GPU服务器主板供电方案、算力机柜配电架构的硬件工程师也适合想搞清楚48V供电链路下一步往哪走的同行参考。1. 为什么AI服务器需要新型非隔离总线转换器1.1 AI服务器电源架构的演变12V到48V先说清楚背景。传统x86服务器的电源链路很简单PSU把市电整流成12V通过铜排或者线缆送到主板CPU、内存、硬盘、风扇各自在板上用POL把12V降到1V左右或者12V直供。整机功耗小的时候这套架构没什么问题功率都在1kW到2kW徘徊12V扛个一百多安培电流铜皮和连接器都还吃得消。AI服务器一出来情况全变了。单颗GPU的功耗从300W一路涨到700W甚至1kW一台8卡GPU服务器整机功耗轻轻松松破10kW个别配置冲到15kW以上。这时候再拿12V做主要传输母线电流会大到什么程度10kW除以12V接近830A。830A的电流要在机箱里走铜排得用多厚连接器接触电阻稍微大一点损耗就是几十瓦起步。更别提线缆的物理柔性和机箱空间根本不允许。所以业界往48V迁原因简单到不需要计算器同样10kW48V下电流只有208A降到了1/4而铜损是按电流平方算的理论上直接降到1/16。这个账太划算了。OCP的48V机架规范、新一代GPU服务器、液冷整机柜方案全部是在这个逻辑上建立的。1.2 中间母线架构总线转换器的舞台48V上板之后问题来了没有哪个主芯片能直接吃48V。GPU core要0.8V左右HBM显存要1.2V到1.8VDDR要1.1VNVMe和风扇要12V网卡和BMC要3.3V。你不能让每一路POL都直接从48V往0.8V降那样对开关管耐压、占空比精度、环路设计都是灾难。于是中间母线架构成了必然选择。48V先由一级“总线转换器”统一降压到一个中间电压通常是12V或者略高一点然后12V母线再分几路给不同的POL和负载。这个节奏跟传统服务器很像但区别在于这一级总线转换器的性能直接影响整个板级的效率和热量分布。早期大家用的是隔离型总线转换器原边副边有变压器隔开安规上稳妥技术也成熟。但它的缺点同样明显变压器本身要占很大的体积漏感和铁损铜损加起来效率普遍卡在94%到96%。在AI服务器这个功率密度下一年电费算下来差几个点就是几千块的成本板级空间更是寸土寸金。1.3 Osprey系列的定位与设计目标OmniOn Power这名字听起来新但技术底子是Lineage Power和ABB的电源产品线一路传下来的在板级电源领域是老玩家了。这次推出Osprey系列非隔离总线转换器明摆着就是瞄着AI服务器主板和机柜供电节点去的目标就是把“48V转12V”这一级的效率、功率密度和成本同时做到位。从产品定位看Osprey系列走的是固定比例转换路线大概率是4:1也就是48V进、12V出。面向场景是GPU服务器、AI训练集群和超大规模数据中心的板级电源层。设计目标很清晰峰值效率做到98%左右持续输出电流做到上百安培封装尺寸比同等功率的隔离型方案小一截同时支持数字遥测方便整机做电源监控和能效管理。这个定位卡得很准。AI服务器里PSU本身已经是隔离的二次隔离在安全性上并不是必需品那为什么不用非隔离方案把性能抠出来Osprey就是在回答这个问题。2. 非隔离总线转换器核心技术解析2.1 隔离与非隔离的本质差异很多人一听到“非隔离”就担心安全问题这其实是对系统架构理解不够造成的。隔离型转换器里有一个变压器原边和副边不共地靠磁场耦合传能量优点是从根源上切断了输入侧的共模噪声和故障电流传导路径缺点是变压器的损耗和体积摆在那里。非隔离型转换器没有变压器输入输出共用一个参考地通过开关管和电感或电容网络完成电压变换省掉了变压器的铁损、铜损和漏感损耗体积和成本也随之下降。放在AI服务器这个具体场景里安全性靠的还是前级PSU。PSU内部已经有变压器隔离并且过了各种安规认证到主板的48V本来就是安全隔离后的直流母线这时候再在板上加一级隔离属于重复建设。说得直白点你已经在小区大门口做了安检楼道里就不需要再设一道安检闸机了。所以“非隔离”在这个位置不是妥协是优化。2.2 固定比例转换为什么Osprey走这条路总线转换器有两个路线稳压型regulated和固定比例型fixed-ratio。稳压型通过反馈环路调节占空比把输出稳定在12V无论输入怎么变。听起来更省心但反馈环路带来延迟动态响应天生受限还要牺牲一点效率去换调整能力。而固定比例型没有反馈环路输出和输入保持一个固定的比例关系状态切换极快效率可以顶到最高点。AI服务器的负载特性特别适合固定比例方案。GPU在计算和空闲之间切换时负载电流是毫秒级甚至微秒级的突变。稳压型bus converter在这种阶跃面前会有一个环路调整过程电压波动明显固定比例转换器没有这个包袱输出电容直接兜住瞬态它的响应速度几乎只受物理寄生参数限制比任何反馈环路都快。另一个重要原因是效率工作点。固定比例转换器可以精心设计开关时序让开关管工作在零电压开关或零电流开关区间不管负载轻重开关损耗都能压得很低。稳压型为了调占空比开关工作点只能在有限范围内接近最优全工况平均效率自然落下来。Osprey把峰值效率做到98%附近靠的就是这种“放弃调节能力、换取效率”的取舍逻辑。2.3 效率、功率密度与热设计的三难平衡任何电源设计都在效率、功率密度、热这三个角里做平衡非隔离总线转换器也一样。高频化能把磁性元件和电容缩小功率密度上去了但开关损耗跟着涨高电流需要更多铜来降电阻损耗但铜一多体积就大热设计上风冷散热到一定功率密度就不够用了必须上冷板或热管。Osprey这种产品要达到98%效率内部大概率用了软开关技术把开关损耗压到极低水平。同时非隔离本身没有变压器磁性元件就只有一个高频电感占板面积和高度都能控制得很小。封装上这类产品常见SMD表贴形式可以直接表贴在主板上甚至竖向安装只占很小一块PCB面积正好迎合AI服务器主板前面板和加速卡插槽密集排列的布局需求。热方面有个基本认知效率损失就是热量。2000W输出下97.5%效率意味着50W热耗98.5%效率只有30W热耗。看起来只差1个点实际上热设计难度差距巨大——50W需要走散热器、风道甚至冷板30W靠PCB铜皮和自然对流就能顶掉大半。Osprey这类非隔离产品之所以能在高功率密度下保持可管理的热就是因为那1到2个百分点的效率优势才是热设计的前提。3. 选型评估与系统集成实操3.1 看数据表先看这些关键参数真到了选型阶段光看“峰值效率98%”是不够的。一套AI服务器主板的供电方案落地要盯的参数远不止这一项。我把实际项目中用得最多的几个参数整理成表方便对照参考。参数典型值为什么关键输入电压范围40V – 60V48V母线在电源切换和浪涌时会有波动范围太窄容易触发欠压或过压保护输出电压/变比12V 4:1固定比例决定后级POL的输入范围怎么选太宽不好太窄更不行持续输出电流100A – 130A决定一片Osprey能撑起几路GPU供电直接影响并联数量峰值效率≥98%热耗和电费的直接来源但要对照效率曲线看全范围负载调整率±2%以内影响12V母线电压尾巴间接影响POL的降压比封装尺寸SMD或1/8砖决定主板布局和散热器安装方式数字接口PMBus / I2C没有遥测的bus converter在整机监控里很难受保护功能OCP/OTP/OVP/UVLO保护项越全系统级故障越不容易扩散效率曲线值得单独说。很多模块标的是峰值效率但实际负载通常不会一直停在峰值点。你要在数据表里找10%、25%、50%、75%、100%负载下的效率值画一条曲线出来跟你的负载场景对齐。GPU服务器在训练任务里显卡基本跑满推理负载可能只有30%到60%如果一款模块峰值效率很高但30%负载效率掉到94%那你整机的平均能效优势就没那么大。3.2 与下游POL的协同设计固定比例总线转换器有一个容易被忽略的联动问题它输出的“12V”不是严格稳定的12V。输入48V时输出12V输入53V时输出就成了13.25V输入42V时又掉到10.5V。这意味着后级POL的输入电压范围必须要覆盖这个波动区间否则某些工况下直接触发欠压保护或者过压保护。实际项目里我一般会先把整个母线电压链路的预算算一遍。48V母线本身的波动范围根据PSU规格和线缆压降来确定比如44V到54V然后乘上Osprey的变比1/4得到12V母线范围是11V到13.5V。POL的输入范围至少要在10V到14V之间才能覆盖如果选型的POL说输入范围只有11V到13V那就要重新评估是不是要把Osprey换成带部分调整能力的产品或者降低母线前段的波动。这个协同设计还需要考虑POL的输入电容。如果POL输入侧有大容量的陶瓷电容加上前级bus converter的输出电感会形成LC谐振电路。电感与电容的谐振频率如果在1MHz以内刚好落在开关纹波的频段附近就可能出现输入电压振荡表现为POL输入端的电压纹波异常大甚至引发误保护。解决方式不外乎三个调整输出电容数量和位置来改变谐振点、增加阻尼电阻、或者选用带可调节输出的总线转换器把母线电压稳住。3.3 PCB布局和热管理的实践经验非隔离总线转换器的输入输出电流都很大PCB布局做不好效率再高也被铜皮损耗吃掉。我做过一个项目第一版布局把Osprey放在主板角落从输入连接器到模块走了很长的窄铜皮结果满载时模块效率正常但整板实测端到端效率掉了1.2%多出来的损耗全变成了铜皮发热。经验是两个第一输入和输出的大电流路径尽量短粗直接用加宽的顶层铜皮加过孔阵列不要依赖细走线第二模块尽量靠近负载端也就是靠近GPU的POL区域减少12V母线的传输距离但与此同时要注意别太靠近GPU本体的热源否则散热器还没把模块的热带走先被GPU的热辐射烤透了。散热这块风冷机箱里模块顶部要留出足够的风道高度不能让周围的电容或连接器挡住气流。液冷方案就更简单直接模块底部通过导热垫贴合冷板。但要注意导热垫的厚度和压缩率太厚热阻大太薄又把PCB顶变形元件脚位和焊点会有应力。输入输出电容的布置也有讲究。输入侧靠近模块脚位放几个高频陶瓷电容负责吸收开关动作产生的高频噪声输出侧除了陶瓷电容还要放一定容量的铝电解或钽电容用来兜住瞬态大电流。分布位置要贴近模块输出引脚不要隔着一大片铜皮才放否则等效串联电阻和电感会把瞬态性能吃掉。4. 实际测试中的常见问题与排查4.1 效率测试被线损骗了效率测试是评估Osprey这类模块最先做的项目但也是最容易测出“假数据”的环节。用万用表直接在模块端子上测电压测出来的电压包含了接触电阻和线缆压降输入功率偏高、输出功率偏低算出来的效率永远比真实值低。有一次我测一块标称98%的模块随便用普通夹子线一接测出来只有96.8%当时差点以为模块虚标其实是测量方法的问题。正确的做法是四线开尔文接法。输入输出各用两根线一根走电流、一根走电压采样电压采样线接在模块端子本体上把导线压降排除在外。功率用功率分析仪同步采样不能简单用万用表的平均值去乘瞬时值因为开关噪声会引入计算误差。测试点要覆盖10%、25%、50%、75%、100%几个负载点满载时模块温度会升高效率会略微下降这个下降趋势本身也是评估热稳定性的参考。4.2 母线电压振荡与瞬态过冲在实际系统里固定比例总线转换器暴露最多的问题就是母线电压振荡。前面提到过它没有反馈环路输出阻抗特性跟稳压型不一样相当于一个低阻抗电压源加上LC网络。当后级POL的输入电容足够大LC网络的品质因数Q值太高时就可能在特定频率下产生谐振尖峰。排查这种问题我习惯先不做任何修改用示波器在12V母线终端抓波形看振荡频率和幅度。然后用阻抗分析仪看输入侧的频响找到谐振峰。这类问题通常不需要改PCB调整输出电容的数量就可以改变谐振点或者换更大ESR的电容类型来增加阻尼问题就能压下去。瞬态过冲是另一个常见现象。用电子负载在Osprey输出端做电流阶跃比如从10A跳到100A再跳回来输出端会出现下冲和过冲幅度取决于输出电容储能量和回路寄生电感。如果过冲超过POL输入范围会直接误触发POL的OVP。处理方式是增加输出电容并把电容尽可能放在负载突变点附近也就是POL输入脚旁边。4.3 可靠性验证别只看满载老化很多工程师拿到新模块先满载跑个24小时老化温度热成像测一遍觉得没问题就放过了。实际上长期可靠性验证的重点不在满载老化而在瞬态热循环和电压应力。GPU服务器典型负载是脉冲式电子负载电流在数分钟内反复拉高拉低模块内部的结温热循环远比稳定满载老化更考验焊点和电容寿命。我建议有条件的情况下做几组针对性测试一是负载循环测试模拟AI任务的实际负载曲线持续时间至少72小时期间持续监控模块表面温度和环境温度二是输入电压拉偏测试把输入电压分别在40V和60V电压点跑满载因为固定比例模块在输入偏高时输出也偏高输出侧器件承受的电压应力最大三是振动测试板级电源模块安装在风扇旁边时振动疲劳也不可忽视。另外输出电容的选型直接影响寿命。陶瓷电容对温度和直流偏压都有降额特性温度过高或者偏压太大实际电容量会明显缩水。如果模块规格书里标了输出电容满足多少寿命但实际工作环境长期超过85度那就要按降额曲线重新核算一遍。这个细节不查产品量产后出问题的概率极大。5. 后续还能往哪个方向扩展Osprey系列这种非隔离总线转换器我在实际项目里越用越觉得这种产品形态大概率不是终点而是一个承上启下的节点。往上走48V直接到GPU核心电压1V左右的转化方案已经在实验室里出现但受限于功率密度、热管理和高频磁性材料问题还没法全面接管整个供电链路。往回收中间母线架构仍然是最稳的工程方案而Osprey们把这个架构中的核心环节做厚了。在实际的AI服务器项目中我现在的习惯是把总线转换器、POL、电容矩阵、散热方案放在一起做系统级仿真而不是各选各的。这样从数据表到整机都能对得上后期调试量能少很多。如果你正好在做类似项目我建议从效率曲线和瞬态响应两个维度先评估Osprey这类模块再决定要不要把整条链路都押在非隔离方案上。至少到目前为止我在GPU服务器主板上用这个思路做下来的项目供电链路的热点、损耗、以及调试过程中的意外都比上一代隔离方案少了不少。
返回列表