AMD+Cerebras晶圆级推理服务器深度解析:拆分推理架构、5倍能效与实时AI赛道
引言2026年7月23日,在Advancing AI 2026大会上,AMD与Cerebras Systems宣布联合推出一款颠覆性的AI推理解决方案——将AMD Helios机架系统与Cerebras晶圆级引擎(WSE)整合为单一推理产品,首次将大模型推理的Prefill和Decode两个阶段拆分为专用硬件处理。这一架构变革直接瞄准了AI竞赛下半场的核心战场:实时推理效率。随着AI应用从批量处理转向实时交互——编码助手、实时客服、自主Agent、自动驾驶、人形机器人——每条推理请求的延迟已经从"越快越好"变成了"必须低于某个阈值"。AMD与Cerebras的联合方案,正是对这一趋势的精准回应。┌─────────────────────────────────────────────────────────────────────┐ │ AMD + Cerebras 拆分推理架构全景 │ ├─────────────────────────────────────────────────────────────────────┤ │ │ │ 用户输入 (Prompt) │ │ │ │ │ ▼ │ │ ┌──────────────────────────────────────────────────────────────┐ │ │ │ Stage 1: Prefill (提示词处理) │ │ │ │ ┌──────────────────────────────────────────────────────┐ │ │ │ │ │ AMD Helios 机架系统 │ │ │ │ │ │ - AMD Instinct GPU 集群 │ │ │ │ │ │ - 高吞吐量并行处理 │ │ │ │ │ │ - 大上下文窗口支持 │ │ │ │ │ │ - 批处理优化 │ │ │ │ │ └──────────────────┬───────────────────────────────────┘ │ │ │ └─────────────────────┼────────────────────────────────────────┘ │ │ │ KV Cache 传递 │ │ ▼ │ │ ┌──────────────────────────────────────────────────────────────┐ │ │ │ Stage 2: Decode (Token生成) │ │ │ │ ┌──────────────────────────────────────────────────────┐ │ │ │ │ │ Cerebras Wafer-Scale Engine (WSE-3) │ │ │ │ │ │ - 整块晶圆级芯片,无芯片间通信延迟 │ │ │ │ │ │ - 数十万核心 + 数十GB SRAM │ │ │ │ │ │ - 超低延迟Token生成 │ │ │ │ │ │ - 5倍 tokens/sec/watt │ │ │ │ │ └──────────────────────────────────────────────────────┘ │ │ │ └──────────────────────────────────────────────────────────────┘ │ │ │ │ │ ▼ │ │ 用户输出 (Generated Tokens) │ │ │ └─────────────────────────────────────────────────────────────────────┘一、技术背景:为什么需要拆分推理1.1 Prefill vs Decode:两种截然不同的计算模式大模型推理的两个阶段对硬件的要求完全不同:Prefill阶段(提示词处理):需要高计算吞吐量来并行处理数千个Token。这个阶段受计算能力(FLOPS)限制,可以充分利用GPU的大规模并行优势。Decode阶段(Token生成):逐个生成Token,每次生成都需要访问整个模型的权重和KV Cache。这个阶段受内存带宽限制,GPU的算力优势无法发挥,反而是芯片间通信延迟成为主要瓶颈。""" InferencePhaseAnalyzer.py 大模型推理阶段分析器 """fromdataclassesimportdataclassfromtypingimportList,Tupleimportmath@dataclassclassModelConfig:"""模型配置"""name:strnum_layers:inthidden_size:intnum_attention_heads:intvocab_size:intintermediate_size:int@propertydefparams_per_layer(self)-int:"""每层参数量"""# QKV + attention output + FFN gate/up/downqkv=3*self.hidden_size*self.hidden_size attn_out=self.hidden_size*self.hidden_size ffn_gate=self.hidden_size*self.intermediate_size ffn_up=self.hidden_size*self.intermediate_size ffn_down=self.intermediate_size*self.hidden_sizereturnqkv+attn_out+ffn_gate+ffn_up+ffn_down@propertydeftotal_params(self)-int:"""总参数量(含embedding)"""embedding=self.vocab_size*self.hidden_size layers=self.num_layers*self.params_per_layerreturnembedding+layers+self.hidden_size# + LM head@dataclassclassInferenceMetrics:"""推理度量"""model:ModelConfig batch_size:intprompt_tokens:intgenerate_tokens:intdefprefill_compute(self)-float:"""Prefill阶段计算量 (FLOPs)"""# 每层: 2 * batch_size * seq_len * (4 * hidden_size^2 + 2 * hidden_size * intermediate_size)seq_len=self.prompt_tokens params=self.model.total_params# 前向传播: 2 * params * tokensreturn2.0*params*seq_len*self.batch_sizedefdecode_compute_per_token(self)-float:"""Decode阶段每Token计算量 (FLOPs)"""# Decode阶段每次只生成1个Token# 但需要访问完整模型参数params=self.model.total_paramsreturn2.0*params*self.batch_sizedefprefill_memory_bandwidth(self)-float:"""Prefill阶段内存带宽需求 (bytes/s)"""# 加载模型权重 + 注意力计算weight_bytes=self.model.total_params*2# FP16kv_cache_bytes=self.batch_size*self.prompt_tokens*\ self.model.num_layers*2*self.model.hidden_size*2# K+Vreturn(weight_bytes+kv_cache_bytes)/1e9# GBdefdecode_memory_bandwidth(self)-float:"""Decode阶段内存带宽需求 (bytes/s)"""# Decode阶段是内存带宽瓶颈# 每次生成需要加载完整模型权重 + KV Cacheweight_bytes=self.model.total_params*2# FP16# KV Cache随序列长度增长kv_bytes=self.batch_size*(self.prompt_tokens+self.generate_tokens)*\ self.model.num_layers*2*self.model.hidden_size*2return(weight_bytes+kv_bytes)/1e9# GBdefanalyze_bottleneck(self)-dict:"""分析瓶颈"""prefill_flops=self.prefill_compute()decode_flops=self.decode_compute_per_token()prefill_bw=self.prefill_memory_bandwidth()decode_bw=self.decode_memory_bandwidth()# 典型GPU: A100 312 TFLOPS, 2TB/s HBM带宽gpu_compute=312e12gpu_bw=2e12prefill_comp_time=prefill_flops/gpu_compute prefil