
在AI尤其是深度学习里数学不再只是抽象的符号而是有几何形状的实体可以把AI数学中的核心“形状”分为四个层级第一层点、线、面基础维度这是AI处理数据的原材料。维度你需要几个「坐标」才能锁定一个具体的数。数据形状举例特征在 NumPy 中标量Scalar0维温度36.5°C或者一个像素的灰度值它就是一个数只有大小没有方向shape 显示为空元组()向量Vector1维[身高 体重 年龄]或者一天中每小时的气温记录就是一根“箭头”或一串数。比如 一串有序的数Shape为(n,)n 是元素个数矩阵Matrix2维一张黑白图片就是高度 x 宽度的灰度矩阵或者权重矩阵神经网络里的参数也是这个形状它负责把输入的向量“拉伸”或“旋转”到另一个空间就是一张“表格”有行和列或一个平面Shape 为(行数, 列数)张量Tensor(3 维及以上)全国 300 个城市、每个城市一周 7 天、每天 24 小时的气温张量是向量和矩阵向任意维度的推广。Shape 为(城市数, 天数, 小时数)即(300, 7, 24)1. 向量的运算①加法数乘数乘只改变向量的「长度」不改变它所在直线的方向负数反转方向但仍在同一条直线上。这个性质叫做 共线性——数乘前后的两个向量总是在同一条直线上。②点积从投影到相乘③模长模长就是向量从原点到终点的「直线距离」——勾股定理在高维空间的推广。2. 矩阵运算①加法乘法②转置③奇异值分解SVD-- 任意矩阵的拆解术SVD 是一种矩阵分解技术能将任意一个 m×n 的矩阵 A 分解为三个特定矩阵的乘积A U·Σ·Vᵀ。它是线性代数中最核心、应用最广的矩阵分解方法没有之一。想象你有一张照片1000x1000像素。这张照片里有很多冗余信息比如大片的蓝天。SVD能帮你把这张照片拆解成三个小矩阵的乘积并且能找出这张照片里最重要的“特征成分”。如果你只保留最重要的前50个成分照片看起来依然清晰但文件大小只剩原来的5%这就是数据压缩。练习一下假设我们有一张1000x1000的图片矩阵做完SVD后奇异值是[100, 80, 5, 2, 0.1, ...]。如果我们要压缩图片只保留最重要的特征我们应该保留前几个奇异值对应的成分为什么第二层空间与流形数据的栖息地这是AI最核心的几何直觉。欧几里得空间平直空间就是我们熟悉的立体几何。AI的输入数据如图片的所有像素被看作高维空间里的一个点。流形Manifold这是AI的关键概念你可以把它理解为“蜷缩在高维空间里的低维曲面”。直观理解地球上所有人类的照片理论上只是三维世界人在二维平面相机感光片上的投影。但所有“人脸照片”在高维像素空间中并不是随意分布的它们密集地聚集在一个“人脸流形”上。AI的任务深度学习就是在学习这个流形的结构。生成式AI如Stable Diffusion本质就是学习数据分布的流形然后从流形上随机采样生成一张“看起来像真”的新图片。第三层变换与映射AI的运算本质神经网络的每一层本质上就是对“形状”进行几何操作。线性变换仿射变换即y Wx b。这在几何上就是旋转、缩放、平移和剪切。你可以想象输入向量一个形状经过矩阵乘法在高维空间中被扭转、拉伸去贴合目标形状。非线性激活函数ReLU Sigmoid这是“折叠”操作。比如ReLUmax(0 x)就是把空间负半轴的所有点“折叠”到零平面上。正是这些“折叠”使得神经网络能够把极度扭曲、缠结的数据流形比如原始像素空间“展开”成线性可分的形状比如猫和狗的清晰分界线。第四层高维的“超球”与“凸包”损失与优化这是AI学习的“指南针”。损失函数的等高线碗状或峡谷状损失函数把模型参数映射到一个“地形”上。最优的参数就在这个地形的“最低谷”。如果是凸函数地形就像一个碗凸形状底部只有一个最低点传统数学能直接求解。但深度学习的损失函数是非凸的地形像连绵的群山布满局部最低点。梯度下降就像一个小球从山顶滚下沿着最陡的坡度梯度方向寻找最低的“盆地”。超球体正则化的几何意义L1和L2正则化在几何上就是在权重空间画一个菱形L1或球体L2。最优解必须在这个形状之内这就限制了权重的“体积”防止模型过拟合过于扭曲去迎合个别噪点。