尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Scheduled Sampling 是为了解决 Teacher Forcing 的什么问题?其核心思想是什么?

Scheduled Sampling 是为了解决 Teacher Forcing 的什么问题?其核心思想是什么? Scheduled Sampling解决 Teacher Forcing 的 Exposure Bias 问题一、先理解 Teacher Forcing在序列生成任务如机器翻译、文本摘要中训练时通常使用Teacher Forcing策略训练时Teacher Forcing t1: 输入 sos → 模型预测 y₁ ↓ 但下一步输入用的是 真实值 y₁而非 y₁ t2: 输入 y₁ → 模型预测 y₂ ↓ 但下一步输入用的是 真实值 y₂而非 y₂ t3: 输入 y₂ → 模型预测 y₃ ...核心特点每一步的输入都是ground truth真实标签而非模型自己的预测。Teacher Forcing 的优势训练稳定收敛快每步输入都是正确的避免了错误累积可以并行化训练配合 mask 机制二、Teacher Forcing 的核心问题Exposure Bias暴露偏差问题本质训练时每步输入都是正确的 → 模型从未见过自己的错误输出作为输入 推理时每步输入是上一步的预测 → 一旦某步预测错误后续输入全部偏离分布 训练分布 ≠ 推理分布 → Exposure Bias具体示意训练阶段Teacher Forcing 正确 → 正确 → 正确 → 正确 → 正确 始终在干净输入上训练 推理阶段Free Running 正确 → 微小偏差 → 偏差放大 → 严重错误 → 完全跑偏 ↑ 错误开始累积模型从未学过如何从错误中恢复类比就像学生做题时老师总是在旁边纠正每一步Teacher Forcing但考试时老师不在了一旦某步算错后面全错因为学生从未练习过在错误状态下如何继续。三、Scheduled Sampling 的核心思想Scheduled Sampling计划采样由 Bengio 团队在 2015 年提出核心思想是在训练过程中逐步将真实标签输入替换为模型自身预测让模型从训练阶段就逐渐适应推理时的真实条件。采样概率调度训练进度 ──────────────────────────────────────→ 采样概率 p使用模型预测的概率 p 0 ──→ p 0.5 ──→ p 1.0 (纯Teacher (混合50%真实 (纯Free Running Forcing) 50%预测) 完全用自身输出) 训练初期 训练后期 保证稳定学习 逐步逼近推理条件每一步的决策在时间步 t生成输入 x_t 时 以概率 (1 - p) → 使用真实标签 y_{t-1} Teacher Forcing 以概率 p → 使用模型预测 y_{t-1} Free Running p 随训练进度按某种调度策略递增常见调度策略策略公式特点线性衰减p min(1, k/t)简单直接均匀过渡指数衰减p k^t前期慢、后期快反向 sigmoidp k / (k exp(t/k))平滑过渡最常用其中t为训练步数/epochk为控制衰减速度的超参数。四、完整对比┌──────────────────────────────────────────────────────────┐ │ 训练阶段输入来源 │ ├──────────────┬────────────────┬───────────────────────────┤ │ Teacher │ Scheduled │ Free Running │ │ Forcing │ Sampling │ (推理时) │ ├──────────────┼────────────────┼───────────────────────────┤ │ 始终用真实值 │ 逐步从真实值 │ 始终用模型预测 │ │ │ 过渡到预测值 │ │ │ p 0 │ 0 → 1 渐变 │ p 1 │ ├──────────────┼────────────────┼───────────────────────────┤ │ 训练稳定 │ 训练稳定 │ 训练不稳定 │ │ 但有暴露偏差 │ 缓解暴露偏差 │ 错误累积严重 │ │ │ │ 难以收敛 │ └──────────────┴────────────────┴───────────────────────────┘五、Scheduled Sampling 的局限局限说明训练不一致同一输入在不同 step 采样的来源不同引入训练噪声理论上不是严格的无偏估计超参数敏感调度策略和衰减速度k需要仔细调参不同任务差异大无法完全消除偏差只是缓解而非根除 Exposure Bias推理时仍可能有错误累积与并行训练冲突采样引入了时间步依赖需要前一步预测结果破坏了 Transformer 的并行训练能力后续改进方向Scheduled Sampling (2015) │ ├── Professor Forcing (2016) → 用 GAN 思想对齐训练/推理分布 ├── Beam Search 覆盖机制 → 推理阶段改进解码策略 ├── Minimum Risk Training (MRT) → 直接优化任务级目标函数 └── Self-Critical Sequence → REINFORCE 自身采样作为 baseline Training (SCST, 2017)六、总结问题Teacher Forcing 导致 Exposure Bias 训练用真实输入推理用预测输入 → 分布不匹配 → 错误累积 方案Scheduled Sampling 训练中逐步用模型预测替代真实标签 → 缩小训练/推理分布差距 本质从 p0纯 Teacher Forcing到 p1纯 Free Running的渐进过渡 让模型在训练阶段就学会在自身输出上继续生成 代价引入训练噪声 超参数敏感 破坏并行性一句话概括Scheduled Sampling 通过在训练中逐步放手让模型从永远在正确输入上练习过渡到学会在自身可能出错的输出上继续工作从而缓解训练与推理的分布不匹配问题。
返回列表