尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI大模型与数学 第36课梯度完整专题:梯度向量求解、梯度方向计算(10道梯度实操计算题)

AI大模型与数学 第36课梯度完整专题:梯度向量求解、梯度方向计算(10道梯度实操计算题) 课程前言前面我们学完二元函数一阶、二阶偏导数梯度就是把所有一阶偏导数组合成的向量是深度学习反向传播最核心的基础工具。核心定义二元函数 zf(x,y) 的梯度向量\nabla f(x,y)\left(\frac{\partial f}{\partial x},\frac{\partial f}{\partial y}\right)几何含义梯度指向函数瞬时上升速度最快的方向负梯度方向是损失下降最快方向梯度下降算法直接沿负梯度更新权重。梯度模长|\nabla f|\sqrt{\left(\frac{\partial f}{\partial x}\right)^2\left(\frac{\partial f}{\partial y}\right)^2}代表变化快慢模越大参数更新幅度越大。梯度方向角\tan\theta\dfrac{\partial f/\partial y}{\partial f/\partial x}代表上升最快的角度。AI大模型对应关系4. 损失函数 L(w_1,w_2) 的梯度 每个权重对应的偏导数梯度下降、Adam、SGD等全部优化器本质都是对梯度做缩放、修正后更新参数梯度模长过大 → 训练震荡梯度模趋近0 → 到达极小值点、收敛完成。做题前先回顾一下梯度向量、梯度方向怎么算损失函数 L衡量模型预测结果和真实答案差距的标量数字一个数。模型全部几十亿参数打包成一个巨大向量1、什么是梯度向量梯度是损失函数对每一个参数求偏导数拼在一起形成的向量。\nabla L\left(\frac{\partial L}{\partial w_1},;\frac{\partial L}{\partial w_2},;\frac{\partial L}{\partial w_3},;\dots;\frac{\partial L}{\partial w_n}\right)^T\boldsymbol w_1,\boldsymbol w_2…大模型每一个权重参数。每一个分量 \displaystyle \frac{\partial L}{\partial w_i}只改动这一个参数其他全部固定看损失 L 会增大还是减小。大白话损失函数是高维空间的曲面。梯度向量指向损失函数局部上升最快的方向。注意梯度本身指向往高处走我们要降低损失所以往梯度的反方向更新权重。2、梯度方向如何计算两步步骤1前向传播输入样本模型跑一遍算出预测值计算损失 L标量。步骤2反向传播求全部偏导数链式法则大模型是多层嵌套复合函数L f_n(f_{n-1}(\dots f_1(\boldsymbol w,x)\dots))依靠微积分链式法则从最末尾的损失一层一层往回算求出每一层每一个权重的偏导组装成梯度向量 \nabla L。工程上PyTorch/TensorFlow 的自动微分帮你完成这套链式求导。步骤3权重更新梯度下降梯度指向损失上升方向所以减去梯度乘以学习率 \eta\boldsymbol w_{new} \boldsymbol w_{old}-\eta\cdot \nabla L\eta学习率步长。-\nabla L损失下降最快的方向。3、结合线性代数理解梯度是向量生活在模型参数的高维向量空间不是输入数据空间。每一个参数对应空间的一个坐标轴。梯度向量和等高线关系梯度向量一定垂直于损失函数的等高线指向增大方向。如果梯度 零向量 \nabla L\boldsymbol 0到达局部极小/极大点参数不再更新训练停止。4、大模型现实中会遇到的现象梯度爆炸梯度向量各个分量数值巨大更新之后权重直接崩坏。梯度消失梯度向量几乎变成零向量参数几乎不更新底层网络学不到东西。这就是为什么会讲级数收敛判定用来分析训练稳定性。总结梯度向量损失函数对全部模型参数的偏导数拼成的向量。方向梯度指向损失上升最快反方向才是训练更新的方向。计算前向算损失反向传播链式法则批量求出所有偏导组装梯度向量。一、10道梯度实操计算题步骤AI工程解读题1f(x,y)x^23y求梯度向量 \nabla f解\frac{\partial f}{\partial x}2x,\quad \frac{\partial f}{\partial y}3梯度\nabla f(2x,\ 3)AI解读简单单层网络x为主权重、y为固定偏置权重梯度随参数增大同步变大偏置梯度恒定不变。题2f(x,y)x^3y写出梯度向量解\frac{\partial f}{\partial x}3x^2y,\quad \frac{\partial f}{\partial y}x^3\nabla f\left(3x2y, x3\right)AI解读特征交叉交互损失两个权重梯度互相绑定一个参数变化会同步改变另一维度梯度参数更新相互干扰。题3f(x,y)2x25y2-xy求梯度并计算点(1,2)处梯度解一阶偏导\frac{\partial f}{\partial x}4x-y,\ \frac{\partial f}{\partial y}10y-x梯度\nabla f(4x-y,\ 10y-x)代入(1,2)\nabla f(4-2,\ 20-1)(2,\ 19)AI解读二维均方误差损失梯度分量分别代表两个权重的更新幅度y参数梯度远大于x训练时y权重收敛更快。题4f(x,y)e^{xy}梯度向量解\frac{\partial f}{\partial x}e^{xy},\quad \frac{\partial f}{\partial y}e^{xy}\nabla f\left(e{xy}, e{xy}\right)AI解读指数激活融合双特征两个维度梯度完全同步深层网络易同步梯度爆炸。题5f(x,y)\sin(x2y)求点(0,0)梯度、模长解\frac{\partial f}{\partial x}\cos(x2y),\ \frac{\partial f}{\partial y}2\cos(x2y)\nabla f\big(\cos(x2y),\ 2\cos(x2y)\big)(0,0)处梯度\nabla f(1,2)梯度模长|\nabla f|\sqrt{1222}\sqrt{5}AI解读RoPE二维位置编码y维度梯度变化幅度是x的2倍位置编码两个维度更新速率不同。题6f(x,y)4x\dfrac{1}{y}写出梯度表达式解\frac{\partial f}{\partial x}4,\quad \frac{\partial f}{\partial y}-\frac{1}{y^2}\nabla f\left(4,\ -\frac{1}{y^2}\right)AI解读线性权重搭配L2正则简化模型权重x梯度固定正则项梯度随y减小急剧放大防止权重无限增大。题7f(x,y)xye^x梯度向量解\frac{\partial f}{\partial x}ye^x,\quad \frac{\partial f}{\partial y}x\nabla f\left(ye^x,\ x\right)AI解读特征交互指数激活复合层x同时影响两条梯度链路前向传播多层特征叠加典型梯度结构。题8f(x,y)x\cos y求点(\pi,0)梯度解\frac{\partial f}{\partial x}\cos y,\quad \frac{\partial f}{\partial y}-x\sin y\nabla f\big(\cos y,\ -x\sin y\big)代入(\pi,0)\nabla f(1,\ 0)AI解读时序周期加权损失y位置角度为0时y维度梯度归零仅权重x参与更新。题9f(x,y)3x3-y2xy完整梯度表达式解\frac{\partial f}{\partial x}9x^2y,\quad \frac{\partial f}{\partial y}-2yx\nabla f\left(9x^2y,\ -2yx\right)AI解读浅层神经网络完整复合损失梯度高次项让x维度梯度随参数快速放大易出现震荡。题10 压轴综合f(x,y)e^{2x}\sin y求梯度、点(0,\frac{\pi}{2})梯度模长解一阶偏导\frac{\partial f}{\partial x}2e^{2x}\sin y,\quad \frac{\partial f}{\partial y}e^{2x}\cos y梯度\nabla f\big(2e^{2x}\sin y,\ e^{2x}\cos y\big)代入(0,\frac{\pi}{2})\nabla f(2\cdot1\cdot1,\ 1\cdot0)(2,\ 0)模长|\nabla f|\sqrt{2202}2AI解读Transformer注意力层二维梯度模板梯度模长直接决定参数单次更新步幅是SGD、Adam优化器的核心计算依据。二、课程核心总结衔接第37课梯度下降数学原理8. 梯度向量 全部参数一阶偏导数集合指向损失上升最快方向9. 训练模型取负梯度更新权重实现损失下降10. 梯度模长代表变化幅度模大震荡、模小收敛停滞11. 梯度分量大小对应不同权重的更新优先级优化器会自适应缩放各分量。训练大模型时梯度爆炸、梯度消失本质是梯度模长异常你平时用哪些方法控制梯度大小欢迎评论区交流
返回列表