尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI 的进步,真的可以预测吗?

AI 的进步,真的可以预测吗? 大模型经常给人一种“突然进化”的感觉:昨天还答不对的问题,模型规模扩大、数据增加之后,今天似乎就能完成了。于是,AI 进步常被描述成充满偶然性的黑箱探索。但在这层不确定性之下,存在一条非常稳定的经验规律:当模型参数、训练数据和计算量持续增加时,语言模型的训练损失往往按照近似幂律平滑下降。把横纵坐标都换成对数刻度后,这种关系会接近一条直线。它就是Scaling Laws,缩放定律。2020 年,OpenAI 团队在论文 [Scaling Laws for Neural Language Models]中系统研究了这一现象。作者发现,语言模型的交叉熵损失与模型规模、数据规模和训练计算量之间存在可拟合的幂律关系,其中一些趋势横跨七个数量级。这项工作的影响不只是一条漂亮曲线。它让大模型研发从“先投入巨额算力再看结果”,逐渐转向“先用小规模实验拟合趋势,再预测大规模训练的回报”。一、缩放定律到底在说什么?一个简化的缩放公式可以写成:```textL(X) = L∞ + A · X^(-α)```其中:- `L(X)` 是模型在给定规模下的损失;- `L∞` 是难以继续消除的损失下限;- `X` 可以表示参数量 `N`、数据量 `D` 或计算量 `C`;- `A` 是与具体任务和数据有关的常数;- `α` 是缩放指数,决定增加资源后性能改善的速度。如果暂时忽略 `L∞`,对公式两边取对数,就会得到:```textlog L = log A - α · log X```这正是一条斜率为 `-α` 的直线。这里的关键词是**损失**。缩放定律最直接预测的是交叉熵损失等连续指标,不是笼统预测“模型有多聪明”,更不是保证每一种下游能力都会按完全相同的节奏出现。二、小模型为什么能预测大模型?训练一个前沿模型之前,研究团队可以先训练一组规模较小的模型:```text模型参数:1
返回列表