尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

GPT 系列模型采用单向自回归生成的原因是什么?这对其能力边界有何影响?

GPT 系列模型采用单向自回归生成的原因是什么?这对其能力边界有何影响? GPT 系列的单向自回归生成原因与能力边界一、为什么选择单向自回归生成1. 架构根源Decoder-Only TransformerGPT 系列采用Decoder-Only架构其核心约束是因果注意力掩码Causal Mask注意力矩阵下三角掩码: w1 w2 w3 w4 w1 [ ✓ ✗ ✗ ✗ ] w2 [ ✓ ✓ ✗ ✗ ] w3 [ ✓ ✓ ✓ ✗ ] w4 [ ✓ ✓ ✓ ✓ ] 每个位置只能 attend 到自身及之前的 token看不到未来这一设计直接决定了模型只能从左到右逐词生成即自回归AutoregressiveP(w1,w2,...,wT)∏t1TP(wt∣w1,w2,...,wt−1)P(w_1, w_2, ..., w_T) \prod_{t1}^{T} P(w_t \mid w_1, w_2, ..., w_{t-1})P(w1​,w2​,...,wT​)t1∏T​P(wt​∣w1​,w2​,...,wt−1​)2. 三个深层原因原因一生成任务的天然需求文本生成本质上是一个序列决策过程——逐词产出每一步都依赖之前已生成的内容输入提示: 今天天气 → P(真) 0.31 → P(很) 0.25 → P(不) 0.18 ... 选 真 → 今天天气真 → P(好) 0.45 → P(棒) 0.20 ... 选 好 → 今天天气真好单向自回归与生成过程天然对齐训练时的计算方式从前到后预测下一个词与推理时的生成方式从前到后逐词产出完全一致不存在训练-推理不一致问题。对比 BERT 的 MLM训练时能看到未来词但生成时无法使用——BERT 无法自回归地生成文本。原因二概率建模的理论统一性自回归将联合概率分解为条件概率的连乘这是概率论中最通用的序列建模框架P(序列)P(w1)⋅P(w2∣w1)⋅P(w3∣w1,w2)⋯P(wT∣w1,...,wT−1)P(\text{序列}) P(w_1) \cdot P(w_2|w_1) \cdot P(w_3|w_1,w_2) \cdots P(w_T|w_1,...,w_{T-1})P(序列)P(w1​)⋅P(w2​∣w1​)⋅P(w3​∣w1​,w2​)⋯P(wT​∣w1​,...,wT−1​)这种分解方式无需任何独立性假设不像 BERT 的 MLM 假设被遮盖词之间独立适用于任意长度的序列可以精确计算序列的概率用于评估文本流畅度、排序候选输出等原因三规模化扩展的天然适配GPT 系列的核心信念是“规模即一切”Scale is all you need。自回归框架在规模化方面有独特优势优势说明训练信号密度高每个位置都产生预测损失序列中 T 个 token 提供 T 个训练信号BERT 仅 ~15%零样本/少样本能力涌现同一个自回归目标可以统一所有任务——只需将任务转化为续写架构简洁可扩展单一 Decoder 堆叠无 Encoder-Decoder 交互扩展时只需增加层数和参数任务统一为续写: 翻译: 将以下英文翻译为中文: Hello → 你好 摘要: 文章: ... 请总结: → ... 问答: 问题: ... 答案: → ... 代码: def fibonacci(n): → if n 1: ...二、对能力边界的影响优势生成与涌现能力┌─────────────────────────────────────────────────────────┐ │ GPT 自回归生成的能力优势 │ │ │ │ ✅ 开放式文本生成续写、创意写作、对话 │ │ ✅ 任意长度的序列产出 │ │ ✅ 零样本/少样本任务泛化GPT-3 │ │ ✅ 思维链推理Chain-of-Thought │ │ ✅ 代码生成与补全 │ │ ✅ 多轮对话的上下文累积 │ └─────────────────────────────────────────────────────────┘思维链推理是自回归架构的独特优势——模型可以将推理过程展开为中间步骤逐步推导问题: 小明有3个苹果吃了1个又买了2个还有几个 自回归生成过程: 小明有3个苹果 → 记录初始状态 吃了1个剩3-12个 → 第一步推理 又买了2个224个 → 第二步推理 答案是4个 → 最终结论每一步推理都作为后续步骤的上下文这种**“边生成边思考”**的能力是双向模型难以实现的。局限单向性带来的能力边界局限一无法利用未来上下文填空任务: The capital of France is
返回列表