Neural GSG:用“刘徽割圆”重新思考扩散模型,训练参数仅需2K!
当整个AI行业都在用海量数据和超大模型堆砌扩散效果时有一个项目选择了一条截然不同的路——它问了一个看似简单却极其反直觉的问题如果扩散模型根本不需要训练或者只需要极少量训练会怎样项目地址https://github.com/dfytensor/GSG一、为什么这个项目值得你停下来读如果你接触过扩散模型Diffusion Models你一定对这样的场景习以为常Stable Diffusion 拥有 8.6 亿参数训练耗费数千 GPU 小时推理时还要跑 50-100 步 U-Net。整个社区默认了“扩散模型 大参数 长训练 慢推理”的公式。但Neural GSG提出了一个颠覆性的问题如果扩散模型的迭代过程本质上只是从粗到细的确定性精化那我们为什么非要用随机噪声和千万级参数的神经网络去学它GSGGeometric Subdivision Generation几何细分生成的核心洞察来自一个古老的中国数学智慧——刘徽割圆术。刘徽用内接正多边形不断细分逼近圆面积而 GSG 把这套确定性迭代精化的逻辑直接搬到了生成模型里。结果令人震惊Vanilla GSG零训练无需任何训练10 步迭代即可生成合理样本。Neural GSG学习增强仅需约 2,000 个参数的 MLP训练时间以秒计就能在复杂 2D 分布和图像生成任务上达到高质量效果。这不是在 DDPM 上做点小修小补——它是从根上重新定义了“扩散”的物理含义从随机迭代精化走向确定性迭代精化。二、核心思想从“随机噪声”到“刘徽割圆”2.1 传统扩散模型DDPM在做什么DDPM 的前向过程本质是不断向数据中注入各向同性高斯噪声直到信号完全被噪声淹没q(xt∣xt−1)N(xt;1−βtxt−1,βtI) q(x_t | x_{t-1}) \mathcal{N}(x_t; \sqrt{1-\beta_t} x_{t-1}, \beta_t I)q(xt∣xt−1)N(xt;1−βtxt−1,βtI)它的反向过程需要训练一个庞大的神经网络来预测噪声pθ(xt−1∣xt)N(xt−1;μθ(xt,t),Σθ(xt,t)) p_\theta(x_{t-1} | x_t) \mathcal{N}(x_{t-1}; \mu_\theta(x_t, t), \Sigma_\theta(x_t, t))pθ(xt−1∣xt)N(xt−1;μθ(xt,t),Σθ(xt,t))这套框架在图像生成领域大获成功但代价是巨大的参数量和漫长的训练推理时间。2.2 GSG 的核心逻辑确定性几何细分GSG 的前向过程完全不同。它的核心思想是随着迭代步数增加从粗粒度表示逐步细分到细粒度表示最终逼近目标分布。这个过程是确定性的而不是随机的。每一步的更新规则不是从噪声中“去噪”而是从当前近似中“精化”xk1Subdivide(xk) x_{k1} \text{Subdivide}(x_k)xk1Subdivide(xk)其中 Subdivision 规则可以是无参数的几何公式Vanilla GSG也可以是一个极轻量的 MLPNeural GSG。这与刘徽割圆术的内在逻辑完全一致用确定性的迭代精化以可证明的收敛速度逼近目标。2.3 一句话总结区别维度传统扩散模型DDPMGSG / Neural GSG前向操作加高斯噪声确定性几何细分迭代性质随机确定性参数量数亿至数十亿0 或 ~2K训练成本数千 GPU 小时零训练 或 数秒推理速度50-100 步 × 大模型10 步 × 轻量公式/小MLP理论基础随机过程刘徽割圆 面积单调性三、理论验证面积单调性与收敛速率GSG 最让人信服的一点是它没有停留在工程直觉而是给出了严密的数学证明。3.1 定理一Score-Subdivision 对齐GSG 证明了得分函数score function与细分方向在几何上是对齐的。具体而言在合适的度量下cos(∇logp(x),Subdiv(x))≈−0.86 \cos(\nabla \log p(x), \text{Subdiv}(x)) \approx -0.86cos(∇logp(x),Subdiv(x))≈−0.86这个负相关意味着细分方向天然指向数据分布的高密度区域与得分匹配的目标高度一致。3.2 定理二面积单调性与收敛速率GSG 证明了细分过程的误差满足面积单调性Theorem 2。更关键的是其收敛速率满足Error∼O(n−1.76) \text{Error} \sim O(n^{-1.76})Error∼O(n−1.76)而理论最优下界为O(n−2.0)O(n^{-2.0})O(n−2.0)。这意味着 GSG 的收敛速率几乎达到了理论最优这一结果的意义在于GSG 不是“碰巧work”的工程 hack而是一个有严格数学保证的生成框架。四、实验验证从 2D 玩具到图像生成这篇工作最扎实的地方是它用四个递进的实验阶段从低维一路打到了真实的图像生成场景。4.1 Phase 1理论验证实验验证内容结果刘徽内接多边形面积单调性误差9.87×10−99.87 \times 10^{-9}9.87×10−9单调递增 ✅GSG 投影面积单调性误差8.56×10−98.56 \times 10^{-9}8.56×10−9单调递增 ✅收敛速率理论O(n−2.0)O(n^{-2.0})O(n−2.0)实测斜率-1.76✅Score 对齐理论负相关余弦相似度-0.86✅4.2 Phase 2Vanilla GSG零训练在高斯混合模型、螺旋线、瑞士卷三个经典 2D 密度估计任务上零训练的 GSG 与训练充分的 DDPM 正面交锋目标分布指标GSG零训练DDPM充分训练高斯混合KL散度2.011.39高斯混合W2距离3.456.80高斯混合推理时间1.7s0.1s螺旋线KL散度22.850.59螺旋线W2距离2.255.35螺旋线推理时间2.6s0.1s瑞士卷KL散度14.681.02瑞士卷W2距离2.235.34瑞士卷推理时间1.3s0.1s注意在W2 距离Wasserstein-2这个衡量分布整体质量的指标上零训练的 GSG 在所有三个任务上都显著优于训练充分的 DDPM而代价仅仅是推理时间略长因为 GSG 用 CPU 跑轻量公式DDPM 用 GPU 跑大模型。4.3 Phase 3MNIST 高度场生成在 16×16 的图像高度场生成任务上GSG 用仅 4 步细分就能生成可识别的数字形状SSIMMSE圆形0.9200.02620正方形0.9510.03774三角形0.9260.05692SSIM 全部超过 0.92这意味着仅 4 步迭代的 GSG 已经能生成结构高度保真的图像。4.4 Phase 4Neural GSG学习增强当引入一个仅约 2,000 个参数的 MLP 来学习细分规则后效果进一步提升任务模型W2距离推理时间复杂 2D 多模态 螺旋Vanilla GSG3.8570.1s复杂 2D 多模态 螺旋Neural GSG3.7210.2s复杂 2D 多模态 螺旋DDPM4.6160.2sNeural GSG 以2K 参数实现了比 DDPM海量参数更优的 W2 距离同时推理速度相当。五、加速论证参数与性能的极致对比这是 GSG 最令人震撼的一张对比表模型参数量训练成本推理速度生成质量Stable Diffusion860M数千 GPU 小时慢50-100 步 × U-Net高Vanilla GSG0零训练即时10 步 × 公式中Neural GSG~2K数秒快10 步 × 小 MLP高Vanilla GSG零参数、零训练10 步公式迭代即可生成样本。Neural GSG仅 2K 参数训练秒级完成10 步小 MLP 推理质量达到高水平。相比之下Stable Diffusion 的 860M 参数和数千 GPU 小时的训练成本在 GSG 面前显得像一个“重型武器”对上了“精确制导匕首”。六、快速上手项目提供了完整的可运行代码一行命令即可复现全部实验cdpaper/ python3 full_pipeline.py# 运行全部 4 个阶段约 20 秒然后在浏览器中打开paper.html即可查看完整的论文和实验结果。项目文件结构清晰full_pipeline.py— 主控脚本experiments_convergence.py— Phase 1理论验证exp_2d_final.py— Phase 2Vanilla GSG 2D 密度估计exp_mnist_synth.py— Phase 3MNIST 高度场生成exp_neural_gsg_v3.py— Phase 4Neural GSG 学习增强七、总结与思考GSG 的价值远不止于“又出了一个新方法”。它真正值得深思的地方在于第一它挑战了扩散模型的“默认假设”。当所有人都认为扩散必须依赖随机噪声和海量参数时GSG 用刘徽割圆术的古老智慧证明确定性的几何精化同样可以构成一个完备的生成框架。第二它为“小模型”开辟了新的可能性。在大模型军备竞赛的今天2K 参数就能在复杂分布上取得可比甚至优于 DDPM 的结果——这提醒我们架构设计和数学原理的革新可能比堆参数更关键。第三它有坚实的理论基础。从面积单调性定理到O(n−1.76)O(n^{-1.76})O(n−1.76)的收敛速率GSG 不是黑箱而是一个可解释、可证明、可复现的生成框架。当然GSG 目前还处于早期阶段在 ImageNet 级高清图像生成上尚未与 SOTA 大模型正面比拼。但它打开了一扇门如果生成模型的未来不一定是“更大”而是“更聪明”呢项目地址https://github.com/dfytensor/GSG欢迎 star、fork、提 issue——一起探索生成模型的另一种可能。