免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

AI大模型与数学 第33课多元函数基础:二元函数一阶偏导数计算在大模型的作用(10道偏导基础计算题)

AI大模型与数学 第33课多元函数基础:二元函数一阶偏导数计算在大模型的作用(10道偏导基础计算题) 课程前言前面课程全部是一元函数仅单个自变量但AI大模型拥有成千上万权重参数损失函数是多元函数 L(w_1,w_2,w_3…)。简单理解我们遇到的事情每个因素相当于一个元这件事情的结果由两个因素决定就是二元。我们实际遇到事情决定事情的结果往往是众多因素所以多元函数才能模拟我们实际遇到的问题。二元函数是多元的入门设 zf(x,y)对 x 求偏导 \dfrac{\partial z}{\partial x}固定y不变只把x当作变量求导代表x维度参数单独变化带来的损失变化率对 y 求偏导 \dfrac{\partial z}{\partial y}固定x不变只把y当作变量求导代表y维度参数单独变化带来的损失变化率AI核心对应偏导数组合在一起就是梯度向量 \nabla z\left(\dfrac{\partial z}{\partial x},\dfrac{\partial z}{\partial y}\right)反向传播更新权重的核心数据。一、基础计算规则通俗解读求某一变量偏导时其余自变量全部视作常数常数项导数直接为0偏导数 单参数独立梯度大模型每一个权重单独对应的梯度就是偏导数。二、10道二元一阶偏导数计算题解题步骤AI场景解读题1z3x^22y求 \dfrac{\partial z}{\partial x},\dfrac{\partial z}{\partial y}解固定y\dfrac{\partial z}{\partial x}6x固定x\dfrac{\partial z}{\partial y}2AI解读简单双层网络x为主权重、y为偏置项权重梯度随参数大小变化偏置梯度恒定不变。题2zx^3y求两个一阶偏导解\dfrac{\partial z}{\partial x}3x^2y\dfrac{\partial z}{\partial y}x^3AI解读权重两两相乘的交互损失两个参数梯度互相耦合不能单独更新某一参数。题3zx24y2-2xy求偏导数解\dfrac{\partial z}{\partial x}2x-2y\dfrac{\partial z}{\partial y}8y-2xAI解读二维均方损失拓展形式两个参数互相约束梯度下降同时修正两个权重。题4ze^{xy}求一阶偏导解\dfrac{\partial z}{\partial x}e^{xy}\dfrac{\partial z}{\partial y}e^{xy}AI解读指数激活融合两个输入特征两个维度梯度完全同步多特征融合层基础运算。题5z\sin(x2y)求偏导解\dfrac{\partial z}{\partial x}\cos(x2y)\dfrac{\partial z}{\partial y}2\cos(x2y)AI解读RoPE二维位置编码x、y分别代表行列位置两个维度旋转变化速率不同。题6z5x\dfrac{1}{y}求偏导数解\dfrac{\partial z}{\partial x}5\dfrac{\partial z}{\partial y}-\dfrac{1}{y^2}AI解读线性权重搭配反比例正则项权重梯度固定正则项梯度随参数缩小急剧放大。题7zxye^x求一阶偏导解\dfrac{\partial z}{\partial x}ye^x\dfrac{\partial z}{\partial y}xAI解读特征交互项叠加指数激活输入x同时影响两条梯度链路深层网络前向传播典型结构。题8zx\cos y求偏导数解\dfrac{\partial z}{\partial x}\cos y\dfrac{\partial z}{\partial y}-x\sin yAI解读时序周期特征加权损失x为权重、y为位置角度两个维度梯度逻辑完全分离。题9z2x3-y2xy求\partial z/\partial x、\partial z/\partial y解\dfrac{\partial z}{\partial x}6x^2y\dfrac{\partial z}{\partial y}-2yxAI解读高次权重二次偏置交叉耦合项完整复刻浅层神经网络复合损失梯度计算。题10 综合压轴ze^{2x}\sin y求解两个一阶偏导数解\dfrac{\partial z}{\partial x}2e^{2x}\sin y\dfrac{\partial z}{\partial y}e^{2x}\cos yAI解读指数特征映射周期位置编码组合损失Transformer注意力层二维梯度基础计算是多元梯度的标准模板。三、课程核心总结衔接第34课多元复合链式偏导5. 偏导数核心逻辑固定其余参数只计算单个参数的变化率对应模型单个权重梯度6. 所有大模型反向传播本质就是批量求解海量偏导数7. 两个偏导数组合成梯度向量指向损失上升最快的方向优化器沿反方向更新参数8. 下一课学习多元复合函数链式求导对应多层神经网络跨层梯度传递。计算偏导数时很容易忘记把其他变量当成常数你有没有踩过这个坑多元梯度在大模型训练里起到什么核心作用欢迎评论区交流
返回列表