智算科普|算力单位通俗解读:FP16、FP8、BF16、TFLOPS到底怎么看?
选GPU只看算力数字大错特错。精度后缀才是关键同样的显卡FP8算力是FP16的两倍。脱离精度谈算力就是在耍流氓。一、五种浮点精度各司其职1. FP32单精度4字节—— 精度最高但AI已弃用FP32是传统的单精度浮点数精度最高、数值不会丢失但代价是运算慢、显存占用大。如今在大模型训练中已被基本淘汰只在科学仿真、流体计算、传统3D渲染等专业场景中保留一席之地。2. FP16半精度2字节—— 老一辈的训练主力FP16的速度是FP32的4到8倍显存也减半但容易出现数值溢出。在V100那个年代它是模型训练的主力但训练大模型时必须配合Loss Scaling来防止梯度爆炸用起来比较折腾。3. BF16脑浮点2字节—— 大模型训练的绝对主流BF16的指数范围跟FP32对齐虽然尾数少但数值稳定性极强几乎不会溢出也不需要额外缩放。如今GPT、Llama这些主流大模型训练都标配BF16。A100、H100、B200全系都原生支持Tensor Core BF16加速——这是目前训练场景的第一选择。4. FP88位浮点1字节—— 推理场景的新宠FP8分E4M3和E5M2两种标准速度是FP16的2到4倍显存占用只有FP16的四分之一。H100和B200的Blackwell架构都原生支持FP8加速主要用于大模型推理和混合精度训练FP8计算FP16权重更新。5. FP44位浮点0.5字节—— 极致压缩仅限推理FP4是Blackwell架构B200新增的原生支持极致省显存、带宽利用率拉满但精度损耗明显。它只能用于边缘端的量化推理绝对不能用来训练模型。B200的FP4峰值算力能达到FP16的4倍。二、算力单位换算别被数字唬住FLOPS就是每秒浮点运算次数单位按千倍递进· 1 GFLOPS 10⁹ 次/秒· 1 TFLOPS 10¹² 次/秒· 1 PFLOPS 10¹⁵ 次/秒· 1 EFLOPS 10¹⁸ 次/秒记住三个要点· 厂商宣传算力必须标注精度否则没法横向对比。· B200标称的4.4 PFLOPS是FP8峰值FP16只有2.2 PFLOPS。· 真实业务持续算力通常只有峰值的60%到80%显存带宽和互联延迟会拖后腿。三、主流GPU算力参数速查2026年最新· RTX 4090FP32 82.6 TF | FP16 165.3 TF | 24GB显存 | 4nm· A100 80GBFP32 19.5 TF | FP16 312 TF | FP8 624 TF | 80GB | 7nm· H100 80GBFP32 51.3 TF | FP16 989 TF | FP8 1978 TF | 80GB | 4nm· H200FP32 51.3 TF | FP16 989 TF | FP8 1978 TF | 141GB | 4nm· B200FP16 2200 TF | FP8 4400 TF | FP4 8800 TF | 192GB | 4nm· MI300XFP32 163 TF | FP16 326 TF | FP8 652 TF | 192GB | 5nm· 昇腾910BFP16 313 TF | 64GB | 7nm补充提醒RTX 4090的FP16理论上限依赖Tensor Core实现B200的FP4算力依托稀疏加速仅推理有效昇腾910B的数据是官方峰值实际表现受软件调度影响。四、怎么选训练和推理分开看训练场景这样选· 70B参数以内的模型A100或昇腾910B就够了单卡多卡都行。· 100B到500B的大模型得上H100或H200还得配NVLink多卡互联。· 500B以上的超大参数只能选B200或MI300X拼的是高显存加高带宽。推理场景这样选· 高吞吐的线上推理H100或H200开FP8吞吐量能翻两三倍。· 要控制成本的批量推理RTX 4090或L40S用FP16或INT8性价比最高。· 边缘轻量化推理B200开FP4量化单卡能扛更多并发。集群规模参考100B模型用BF16训练大概需要256张H100总算力约250 PFLOPS70B模型用FP8推理32张H100就够了单卡能支撑2000以上的QPS。总结四句话· 科学计算用FP32大模型训练认准BF16推理场景FP8和FP4是王道。· 算力单位千倍递进GFLOPS TFLOPS PFLOPS EFLOPS。· 峰值算力看看就好真实落地能有六到八成就很不错了。· 选型记住口诀训练看BF16和FP8推理优先FP8和FP4精度后缀决定一切。版权声明本文为原创文章遵循 CC 4.0 BY-SA 版权协议转载请附上原文出处链接及本声明。参考资料《智算科普算力单位 FP16/FP8/FP4/BF16/TFLOPS 通俗解读》2026年7月。注产品参数信息截止至2026年7月具体数据请以官方最新公布为准。