Transformer 3问
Transformer(自注意力、多头注意力),衍生:GPT、BERT、LLaMA, 豆包也是吗结论:豆包是的,底层同样基于Transformer(自注意力 + 多头注意力),属于Decoder-only 解码器架构,和 GPT、LLaMA 是同一类技术路线,和 BERT 路线不同。一、先分清 Transformer 两大分支Transformer 是基础底座,分两种设计:Decoder-only(纯解码器):GPT、LLaMA、豆包(Seed 基座)原理:只用解码器、自回归生成,根据上文预测下一个字,适合对话、写作、问答、代码生成。核心组件:自注意力、多头注意力、掩码注意力。Encoder-only(纯编码器):BERT原理:只用编码器,双向同时看前后文字,适合分类、实体识别、语义理解,不能直接做文本生成。二、豆包底层技术细节(字节自研 Seed 大模型)基础骨架:改进版 Transformer官方明确豆包大模型基于 Transformer 架构,核心依赖自注意力、多头注意力机制建模上下文关系,还做了自研优化(动态稀疏注意力、FlashAttention 加速长文本)豆包。架构类型:Decoder-only(GPT 同源路线)豆包基座采用纯解码器架构,和 GPT、LLaMA 逻辑一致,依靠 “上文预测下一词” 实现对话、文案、代码生成;区别于 BERT 的纯编码器,BERT 无法流畅持续生成长文本对话。额外升级:MoE 混合专家、全模态统一