摘要本文是系列文章的第三篇详细展开面向“人工智能研究与开发”方向的学术型培养路径。在第一年共同基础之后从第二年开始志在深入AI底层的学生将进入一条以“创造和改进AI工具”为目标的深造通道。文章充分吸纳2024至2026年的技术前沿设计了五门螺旋式上升的核心课程——深度学习系统原理与框架设计、大规模模型训练与后训练工程、数据工程与模型评估、模型压缩与高性能推理部署、生成式模型与智能体前沿——每门课程均包含详细的教学重点设计。这条路径的核心理念是不仅要会用模型更要理解模型为何这样设计、如何改进模型、如何创造新的模型以及如何让模型学会使用工具、与其它模型协同。关键词人工智能教育深度学习后训练推理增强多智能体系统课程设计一、学术型路径的定位如果说共同基础阶段的目标是培养“能够驾驭AI工具构建系统的人”那么学术型路径的目标则是培养“能够创造和改进AI工具本身的人”。这两种人才的差异可以类比汽车工业中的两种角色大多数人学习开车和汽车基础维护而少数人则需要深入发动机原理、底盘调校和车辆工程。AI时代的软件工程领域也是如此——需要大量能够熟练使用大模型构建应用的工程师也同样需要能够设计和优化大模型的工程师。学术型路径的能力图谱由四个同心圆构成最内圈数学与理论基础——线性代数、概率论与信息论、优化理论、数值计算第二圈模型与算法能力——从经典机器学习到前沿生成式模型的原理与演进脉络第三圈系统工程能力——分布式训练、后训练与对齐、数据工程、模型压缩与推理部署最外圈研究创新能力——阅读、复现、批判和改进前沿研究产出原创性工作这四层能力通过五门核心课程以螺旋式方式培养每门课程都在不同深度上触碰这四个层次。与2023年前的学术型培养方案相比本方案特别纳入了2024至2026年间成熟的多项关键技术后训练与对齐的系统方法论、推理时计算扩展、状态空间模型等新架构、数据合成与数据工程、多智能体协作与工具使用、以及评估基准的系统性思维。二、课程四深度学习系统原理与框架设计这是学术型路径的基石课程承担着“从使用者到建造者”的转变任务。第一学期深度学习理论基础模块一计算图与自动微分这是整个深度学习理解的理论基石。课程从标量的链式法则出发逐步构建对向量-雅可比积、反向传播算法的深刻直觉。教学方式不是“讲数学”然后“写代码”而是“讲数学”的同时“亲手实现数学”——学生需要用纯NumPy实现一个简易的计算图引擎支持基本的张量操作和自动梯度计算。当他们在自己写的引擎上跑通简单的线性回归时反向传播就不再是教科书上的公式而是一个亲手构建过的系统行为。模块二优化理论与算法深入讲解SGD的收敛性条件、动量法的物理直觉、Adam等自适应方法的工作原理与潜在陷阱。学生需要完成对比实验在同一优化曲面上可视化不同优化器的收敛路径直观感受“振荡”“加速”“自适应步长”的真实含义。模块三基础架构的设计哲学以卷积神经网络和循环神经网络为案例讲解深度学习中最核心的概念——归纳偏置。为什么卷积适合处理图像因为其内置了平移等变性的假设。为什么循环网络适合处理序列因为其内置了时序依赖的假设。同时引入注意力机制作为“打破循环假设”的新范式为后续Transformer深入学习埋下伏笔。此模块也简要引入状态空间模型的基本直觉——如何用线性时不变系统替代注意力机制为第二学期的架构演进做铺垫。第二学期框架系统设计与架构演进模块一PyTorch源码精读教师带领学生深入阅读PyTorch的核心源码重点剖析四个子系统的设计张量系统如何在不同设备上实现统一接口的多态自动微分系统如何动态构建计算图并管理显存算子注册与调度系统如何决定操作在哪个设备上以何种精度执行神经网络模块系统如何管理参数、子模块和序列化每周学生提交源码阅读笔记课堂进行小组讨论。这是一种“考古式”学习方法——通过阅读工业级代码理解真实世界中复杂系统的设计权衡。模块二简易深度学习框架实现这是整门课程的顶点项目。学生以小组为单位从零设计并实现一个能够完整运行MNIST训练的深度学习框架。框架必须包含计算图引擎、自动微分、基本神经网络层、优化器和数据加载模块。项目分四个里程碑推进计算图正向传播、自动反向传播与梯度验证、完整训练循环、性能分析与优化。这一项目不是为了“造轮子”而“造轮子”——当学生亲手管理过显存、处理过算子融合、优化过计算图后他们对PyTorch的理解将从“魔法”变为“工程”对后续模型压缩和推理部署课程建立最坚实的系统认知基础。模块三大模型架构的最新演进在亲手实现框架的基础上将学生视野引向2024至2026年的架构前沿。重点讲解三方面内容其一状态空间模型——从S4到Mamba再到Mamba-2选择性状态空间如何实现线性复杂度下的长序列建模与注意力机制相比其优势与局限各是什么其二混合架构——Jamba等混合SSM-Transformer架构的设计哲学何时用注意力、何时用状态空间其三混合专家模型MoE的深化——从Mixtral到DeepSeek-V3路由策略、负载均衡、专家专业化方面的工程进展。同时简要讲解线性注意力变体RWKV等和上下文窗口扩展技术RoPE扩展策略、YaRN等。三、课程五大规模模型训练与后训练工程当学生理解了深度学习的基础理论和框架设计后本课程将他们带到“工业级”尺度。课程分为“训练”与“后训练”两大篇章反映2024年以来大模型技术栈的最新分工。第一学期大规模训练系统模块一分布式训练系统系统讲解大规模训练的核心技术。数据并行中Ring All-Reduce通信拓扑如何实现高效梯度同步模型并行中张量并行如何切分单个矩阵乘法流水线并行如何设计微批次调度减少“流水线气泡”ZeRO优化的三个阶段分别卸载什么对显存和通信各有什么影响序列并行和专家并行在MoE模型中的特殊考量学生需要在多GPU实验环境中实测不同并行策略撰写量化对比分析报告。模块二训练稳定性与效率优化混合精度训练中FP16与BF16的数值表示差异损失缩放防止梯度下溢的原理。Flash Attention如何从GPU显存层次出发实现IO感知的注意力计算优化梯度累积、激活检查点、ZeRO-Offload等“计算换显存”策略的工程实践。模块三数据工程——决定模型质量的关键环节这是2024年以来最受重视的方向之一“数据即模型”已成为共识。课程系统讲授数据质量评估与清洗——如何系统评估预训练数据的质量去重、毒性过滤、PII去除的方法论与工具链。数据混合与配比——不同来源数据的配比如何影响模型能力Phi系列模型用极少高质量数据达到卓越性能的启示是什么合成数据生成——用强模型生成弱模型训练数据、Self-Instruct、Evol-Instruct等方法的技术原理与局限。数据版权与伦理——训练数据的版权争议现状与合规使用框架。第二学期后训练与对齐技术这是2024至2026年间最活跃的研究方向之一。后训练Post-Training已从早期的“RLHF微调”发展为一个独立的、系统性的技术栈。模块一奖励建模与偏好学习从传统偏好奖励模型到过程奖励模型PRM的演进——在数学推理和代码生成中PRM提供细粒度的步骤级反馈显著优于结果奖励模型ORM。奖励模型训练中的数据构建策略、排序损失函数的选择、以及奖励篡改Reward Hacking的识别与防范。模块二直接对齐算法的演进谱系从经典的RLHFSFT→奖励模型→PPO到直接偏好优化DPO的范式转变——DPO如何将强化学习问题转化为分类问题进一步讲解DPO的后续演进IPO引入正则化防止过优化KTO无需成对偏好数据即可训练SimPO以序列概率直接优化ORPO在SFT阶段同时进行对齐。学生需要理解每个算法解决了什么具体问题、引入了什么新假设。模块三自我改进与AI反馈当人类反馈成本过高或质量不稳定时如何用AI替代RLAIFAI反馈强化学习用强语言模型替代人类标注者。自我对弈方法SPIN等让模型通过与自己历史版本对战来持续提升。宪法AI用一组自然语言原则约束模型行为实现可解释、可审计的对齐。同时讲解推理时对齐技术——推理阶段的系统指令、提示约束、受限解码如何影响模型行为。模块四推理增强技术——让模型“慢思考”这是OpenAI o1/o3系列引发的最热门方向。从思维链到思维树——让模型探索多条推理路径并选择最优分支。蒙特卡洛树搜索在LLM推理中的应用与AlphaGo思想的传承。验证器与重排序——Best-of-N采样、奖励模型重排序、一致性投票的理论基础。计算最优分配——何时增加推理时计算比增加训练时计算更有效o系列的scaling law启示。长上下文推理——如何在长上下文中保持推理连贯性避免“迷失在中间”。四、课程六模型压缩与高性能推理部署一学期模块一量化技术深度剖析从量化的数学基础讲起深入训练后量化PTQ的校准过程、量化感知训练QAT的伪量化节点机制以及LLM专用量化技术——GPTQ的逐层最优脑手术算法、AWQ的激活感知权重量化、QuaRot等2024年新方法的原理。学生需对同一模型实施不同量化方案在精度损失和推理加速之间建立量化权衡曲线。模块二剪枝与蒸馏结构化与非结构化剪枝的根本区别SparseGPT等LLM剪枝方法彩票假说的理论启示。知识蒸馏中温度参数如何控制“暗知识”传递蒸馏后的学生模型到底学到了什么模块三推理引擎与部署优化以vLLM为例深入讲解PagedAttention如何借鉴操作系统虚拟内存管理思想解决KV-Cache碎片化连续批处理如何提升GPU利用率投机采样如何用草稿模型加速自回归生成同时覆盖ONNX/TensorRT的图优化、边缘端部署的轻量化设计、以及模型注册与版本管理的基本概念。模块四MLOps与大模型运维实验追踪与可复现性工具链如WB、MLflow模型注册中心的使用A/B测试与金丝雀发布策略在线学习与模型持续更新的挑战。五、课程七生成式模型、多模态与智能体前沿一学期模块一扩散模型与多模态生成从DDPM的马尔可夫链加噪-去噪过程出发深入DDIM的确定性采样加速、Score-based模型的统一视角、Classifier-free Guidance的条件控制。多模态大模型方面讲解视觉-语言模型的演进——从CLIP到BLIP-2的Q-Former桥接到LLaVA的视觉指令微调视觉编码器选择与投影层设计的权衡多模态训练的阶段性策略。文生图与文生视频——Stable Diffusion的潜在空间扩散设计、DiT将U-Net替换为Transformer的动机、视频生成的时空一致性挑战。模块二多智能体系统——从单体模型到模型协作这是2025-2026年学术研究与应用开发共同关注的核心方向。当单个大模型的能力趋于稳定如何让多个模型协同工作产生112的效果多Agent架构模式角色分工型规划者-执行者-审核者、辩论型多个Agent生成方案后相互质疑和修正、分层型主Agent协调子Agent执行子任务。不同模式适合什么场景各有什么失效模式Agent间通信协议自然语言通信与结构化通信的权衡。Agent如何交换信息、协商任务、消解冲突Agent的“语言”需要标准化吗工具使用与工具创造Agent如何学习使用API、数据库、搜索引擎等外部工具更高级的能力是“工具创造”——Agent自主编写代码生成新工具来解决当前问题。集体智能的涌现多Agent系统中单个Agent能力有限但通过协作可能涌现出超越任何单体Agent的能力。这种“集体智能”的形成条件和度量方法是什么安全与可控性多Agent系统中单个Agent的失控可能通过通信链路级联放大。如何设计多Agent系统的安全约束和熔断机制模块三前沿研讨与文献批判每周精读一篇NeurIPS/ICML/ICLR/CVPR/ACL等顶会的最新论文。学生课前提交批判性分析——核心贡献是什么方法局限在哪里实验设计有无漏洞如果做后续研究会怎么做课堂随机抽人报告和答辩。期末要求学生产出一篇综述或研究提案鼓励优秀作品投稿学术会议或研讨会。这种“像研究者一样思考”的训练是学术型路径区别于应用型路径的关键环节。六、学术型路径毕业生能力画像完成学术型路径的学生应具备以下核心能力扎实的深度学习理论基础能够从数学层面理解模型行为从计算图视角分析任何架构的前向与反向传播完整的框架系统认知深入理解主流框架的设计哲学能够进行源码级别的定制和优化大规模训练与后训练工程能力掌握分布式训练技术栈理解从预训练到后训练到推理增强的完整链路数据工程的系统思维理解数据质量、数据配比和合成数据在模型开发中的决定性作用模型压缩与部署能力能够系统性地在精度和效率之间做出量化权衡多智能体系统的设计思维理解单体模型与多模型协作各自的能力边界研究创新素养能够阅读、批判和改进前沿研究成果产出原创性技术贡献他们可以胜任AI实验室算法研究员、AI框架开发工程师、模型训练与优化工程师、多智能体系统研究员等岗位。七、课程结构总览课程学期核心主题课程四深度学习系统原理与框架设计第二学年一学年计算图与自动微分、优化理论、基础架构哲学、框架源码精读、简易框架实现、新架构演进SSM、MoE、混合架构课程五大规模模型训练与后训练工程第三学年一学年分布式训练系统、训练效率优化、数据工程奖励建模、直接对齐算法演进、自我改进与AI反馈、推理增强技术课程六模型压缩与高性能推理部署第三学年一学期量化技术含2024年新方法、剪枝与蒸馏、推理引擎架构、MLOps课程七生成式、多模态与智能体前沿第四学年一学期扩散模型、多模态系统、多智能体协作、工具使用与创造、前沿文献研讨