尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

不止AI入门!俞勇团队全新力作用实战思维解锁决策底层逻辑

不止AI入门!俞勇团队全新力作用实战思维解锁决策底层逻辑 2026三掌柜赠书活动第四十七期 动手学博弈论目录前言AI入门圈公认王牌丛书出新作交大名师手把手带你学博弈论关于《动手学博弈论》编辑推荐内容简介作者简介图书目录《动手学博弈论》全书速览结束语前言在人工智能飞速迭代、全域智能化落地的当下算法、模型、算力早已成为技术深耕的基础能力而博弈思维是贯穿人工智能决策、商业竞争、资源博弈、智能交互的底层核心逻辑更是高阶技术人才、科研从业者、行业实践者必备的核心素养。长久以来博弈论因理论抽象、公式晦涩、实战脱节成为众多学习者的知识壁垒市面上多数教程重理论推演、轻落地实践让无数人深陷“看得懂概念用不好逻辑”的困境。AI入门圈公认王牌丛书出新作交大名师手把手带你学博弈论“动手学”系列人工智能实战教程是国内高校人工智能教学体系中认可度最高、覆盖面最广的实战丛书之一。这套由上海交大ACM班创始人、国家级教学名师俞勇教授牵头打造的新一代人工智能实战型人才培养系列教程前六本早已成为无数学生、工程师的入门刚需书覆盖强化学习、机器学习、自然语言处理、数据结构与算法、计算机视觉、大模型智能体口碑稳居同类书籍前列。关于《动手学博弈论》接下来给大家推荐一本关于博弈论的书籍这是一本关于如何学习AI博弈、多智能体实战的干货图书一经上市就登上了当当“计算机与互联网”图书排行榜前列。本书从博弈论基础理论讲起到多智能体代码实战技巧助学习者在人工智能、多智能体开发实战工作中轻松进阶另外关注本文博主点赞收藏本文且在本文评论区评论“入手动手学博弈论”将选取三名幸运读者送出纸质版《动手学博弈论》一本截止时间2026.09.29。入手《动手学博弈论》传送门 京东(JD.COM)-正品低价、品质保障、配送及时、轻松购物 或者 《动手学博弈论》(温颖 周铭 俞勇)【简介_书评_在线阅读】 - 当当图书 个人觉得这本书非常的不错是一本不可多得的好书值得拥有去学习。编辑推荐·鄂维南|安波|汪军|高阳四位业内大咖推荐·开创性地从现代人工智能角度阐述博弈论基础概念及其在人工智能中的交叉研究与应用·名家作品上海交通大学ACM班创始人俞勇教授、人工智能学院副教授温颖、上海人工智能实验室青年研究员周铭合作新书·畅销“动手学”系列新作·配套资源丰富在线代码理论解读视频习题配套课件。内容简介本书围绕“博弈论与人工智能”这一主题介绍从博弈基础理论到多智能体协作的完整知识体系是一本着眼于博弈论的教学实践的教材。本书分为5部分。第一部分第1章第6章介绍标准式博弈及其核心概念第二部分第7章第11章深入探讨扩展式博弈第三部分第12章第15章转向合作博弈第四部分第16章第21章阐述马尔可夫决策过程与随机博弈第五部分第22章第28章将深入讲解多智能体协作。本书将理论与代码示例相结合让读者在掌握博弈论原理的同时能将其运用于多智能体系统的设计与实现。作者简介温颖上海交通大学人工智能学院副教授主要研究方向包括博弈论、多智能体系统与深度强化学习。主持并参与多项国家自然科学基金和重点研发计划项目相关研究成果发表于国际顶级期刊与会议并拥有多项发明专利。曾在多场国际重要学术会议担任程序委员会委员积极推动博弈论与人工智能交叉领域的发展在多智能体协作策略、合作博弈算法设计、智能决策系统等方面取得了丰富成果。周铭上海人工智能实验室青年研究员主要研究方向包括开放式学习、具身人工智能和机器学习系统。2018年于四川大学学士获得学位同年进入上海交通大学直接攻读博士学位2023年于电子信息与电气工程学院获得博士学位。俞勇享受国务院特殊津贴专家首批“国家高层次人才特殊支持计划”教学名师上海交通大学特聘教授上海交通大学ACM班创办人APEX数据与知识管理实验室主任。曾获得“全国模范教师”“全国师德标兵”“CCF杰出教育奖”“上海市五一劳动奖章”和“上海交通大学校长奖”等荣誉。2018年创办伯禹人工智能学院在上海交通大学ACM班人工智能专业课程体系的基础上对人工智能课程体系进行创新致力于培养卓越的人工智能算法工程师和研究员。2025年创办知春创新中心探索中学和大学贯通式人才培养模式打造AI时代创新人才培养“加速器”。图书目录第 一部分 标准式博弈第 1章 初探博弈论 21.1 博弈论的概念 21.2 历史背景与发展脉络 31.3 博弈的类型 31.3.1 非合作博弈与合作博弈 41.3.2 标准式博弈与扩展式博弈 41.3.3 完全信息博弈与不完全信息博弈完美信息博弈与不完美信息博弈 41.3.4 零和博弈与非零和博弈 41.4 博弈论的核心假设 51.5 博弈模型的要素 51.6 小结 6第 2章 标准式博弈基础 72.1 场景引入电影博弈 72.2 标准式博弈的定义 72.3 常见的标准式博弈 82.4 标准式博弈的代码实现 92.5 小结 92.6 延伸阅读与思考 10第3章 标准式博弈中的策略 113.1 场景引入“剪刀-石头-布”博弈 113.2 策略的形式化定义 123.2.1 纯策略与混合策略 123.2.2 期望收益的计算 123.3 策略的代码实现 133.3.1 表示与计算“剪刀-石头-布”博弈的收益 133.3.2 纯策略与混合策略示例 143.4 占优策略与占优策略均衡 153.4.1 囚徒困境中的占优策略 153.4.2 代码实现识别囚徒困境的占优策略 163.5 小结 17第4章 纳什均衡 184.1 场景引入从“匹配硬币”到“最佳应对” 184.2 纳什均衡的定义 194.2.1 最佳应对 194.2.2 纳什均衡 194.3 求解纳什均衡的代码实现 204.4 纳什均衡的存在性、多重性、最优性与社会福利 224.5 小结 224.6 延伸阅读与思考 23第5章 支撑枚举法求解纳什均衡 245.1 场景引入协调游戏中的多重均衡 245.2 支撑的最佳混合策略应对 265.3 混合策略的纳什均衡条件 285.4 支撑枚举法 305.5 支撑枚举法求解二人标准式博弈实例 315.6 小结 32第6章 虚拟对弈求解纳什均衡 336.1 场景引入重复“猜拳”的策略调整 336.2 虚拟对弈 346.2.1 虚拟对弈的代码实现 346.2.2 虚拟对弈的收敛性 386.3 随机虚拟对弈 386.3.1 随机虚拟对弈的代码实现 386.3.2 随机虚拟对弈的性质 426.4 小结 42第二部分 扩展式博弈第7章 扩展式博弈基础 447.1 场景引入离散版的最后通牒博弈 447.2 扩展式博弈的定义 457.3 博弈树与信息集合离散版的最后通牒博弈的表示 467.4 扩展式博弈中的策略与纯策略纳什均衡 467.4.1 策略的形式 477.4.2 求解与均衡 477.4.3 代码实现 477.5 扩展式博弈与标准式博弈的比较 517.6 小结 517.7 延伸阅读与思考 52第8章 子博弈精炼纳什均衡 538.1 场景引入动态竞价 538.2 子博弈精炼纳什均衡 548.2.1 子博弈的定义 548.2.2 子博弈精炼纳什均衡的定义 548.3 逆向归纳法求解从后向前看 558.3.1 示例二人扩展式博弈 558.3.2 多子博弈场景下的递归思路 568.4 逆向归纳法的代码实现 568.5 子博弈精炼纳什均衡与纳什均衡的关系及其合理性与局限性 628.5.1 子博弈精炼纳什均衡与纳什均衡的关系 638.5.2 合理性与“不合理行为” 638.5.3 多重性与唯一性 638.6 小结 63第9章 扩展式虚拟自对弈 659.1 场景引入大规模扩展式博弈 659.2 广义弱化虚拟对弈从标准式到扩展式 659.2.1 广义弱化虚拟对弈的概念 669.2.2 行为策略与混合策略的等价性 669.3 全宽度扩展式虚拟自对弈 669.4 扩展式虚拟自对弈的代码实现 679.5 小结 78第 10章 遗憾最小化 8010.1 场景引入广告投放 8010.2 遗憾与无遗憾学习 8110.3 反事实遗憾最小化 8210.4 Kuhn扑克中反事实遗憾最小化的代码实现 8310.4.1 Kuhn扑克博弈树定义 8410.4.2 反事实遗憾最小化算法实现 8610.4.3 主函数训练并输出平均策略与博弈值 8910.5 小结 90第 11章 重复博弈 9211.1 场景引入重复的囚徒困境 9211.2 有限与无限重复博弈 9311.2.1 有限重复博弈 9311.2.2 无限重复博弈 9311.3 重复博弈的代码实现 9411.3.1 有限重复囚徒困境模拟 9411.3.2 Tit-for-Tat 策略与无限重复模拟 9611.4 小结 9911.5 延伸阅读与思考 100第三部分 合作博弈第 12章 合作博弈 10212.1 场景引入牛排定价博弈 10212.2 合作博弈的定义 10312.3 合作博弈的代码实现 10312.4 小结 10512.5 延伸阅读与思考 106第 13章 特征函数 10713.1 场景引入农业合作社 10713.2 特征函数的定义 10713.3 特征函数的分类 10813.3.1 单调博弈 10913.3.2 超可加博弈 11013.3.3 凸博弈 11113.3.4 简单博弈 11213.4 小结 112第 14章 核与核仁 11314.1 场景引入购买冰淇淋 11314.2 收益分配的原则 11414.2.1 收益分配与有效性、个体理性 11414.2.2 核 11414.2.3 核的存在性 11514.3 核仁 11514.3.1 超额值 11514.3.2 核仁的正式定义 11614.4 核与核仁求解的代码实现 11614.4.1 核的数值求解示例 11614.4.2 核仁的数值求解思路 11814.5 小结 11914.6 延伸阅读与思考 120第 15章 夏普利值 12115.1 场景引入满减优惠活动 12115.2 夏普利值的定义 12115.2.1 夏普利值 12215.2.2 夏普利值的性质 12215.3 夏普利值计算的代码实现 12315.4 夏普利值与可解释机器学习 12515.5 小结 132第四部分 马尔可夫决策过程与随机博弈第 16章 马尔可夫决策过程 13416.1 场景引入自动驾驶 13416.2 马尔可夫决策过程的定义 13416.3 最大化累计奖励 13516.4 贝尔曼等式 13616.5 求解马尔可夫决策过程的动态规划算法 13616.5.1 值迭代 13616.5.2 策略迭代 13816.6 强化学习与无模型学习 14016.6.1 值学习 14016.6.2 策略梯度 14116.7 小结 142第 17章 随机博弈 14317.1 场景引入Goofspiel游戏 14317.2 随机博弈的定义 14417.3 马尔可夫假设与非平稳性问题 14517.4 部分可观测假设 14517.5 随机博弈的解概念 14617.6 小结 147第 18章 求解随机博弈 14818.1 场景引入双人网格化足球游戏 14818.2 值迭代 15118.3 策略迭代 15318.4 强化学习 15618.5 小结 158第 19章 最佳应对学习 16019.1 场景引入合作与对抗中的策略选择 16019.2 虚拟对弈 16019.3 双时间尺度迭代 16319.4 小结 166第 20章 联合动作学习 16720.1 场景引入团队合作中的策略学习 16720.2 虚拟对弈与值函数估计 16820.3 虚拟对弈和混合策略 17020.4 混合策略JAL算法 17220.5 小结 173第 21章 理性和收敛性 17521.1 场景引入机器人协作问题 17521.2 理性和收敛性 17621.3 与纳什均衡的关系 17621.4 PHC算法 17721.5 WoLF原则与WoLF-PHC算法 18221.6 小结 186第五部分 多智能体协作第 22章 深度强化学习基础 18822.1 深度值函数网络算法 18822.1.1 值估计非平稳性问题 18922.1.2 连续经验相关性问题 19022.1.3 求解CartPole问题 19222.1.4 过估计问题 19322.2 深度策略梯度算法 19522.2.1 更丰富的策略表达形式 19522.2.2 可扩展至连续动作空间 19622.2.3 策略梯度理论 19722.2.4 实现策略梯度算法 19822.3 演员-评论家算法 20222.3.1 优势演员-评论家算法 20422.3.2 近端策略优化算法 20722.4 小结 209第 23章 多智能体深度强化学习 21023.1 场景引入自动驾驶车辆交互 21023.2 多智能体深度强化学习的核心挑战 21123.3 多智能体深度强化学习的训练范式 21223.4 小结 214第 24章 独立学习 21524.1 场景引入交通信号灯控制系统 21524.2 独立值学习 21524.3 独立策略梯度算法 21724.4 小结 218第 25章 多智能体值函数学习 22025.1 场景引入资源收集协作障碍任务 22025.2 值函数分解 22125.2.1 个体全局最大性质 22225.2.2 线性值函数分解 22325.2.3 单调值函数分解 22325.3 小结 228第 26章 多智能体近端策略优化 23026.1 场景引入团队对抗任务 23026.2 Dec-POMDP 23126.3 MAPPO的核心思想 23126.4 MAPPO应用 23326.4.1 缓解非平稳性问题 23326.4.2 实现MAPPO 23326.4.3 MAPPO的代码示例 23526.5 小结 247第 27章 多智能体序列学习 24827.1 场景引入合作任务中的多智能体学习 24827.2 顺序更新模式的理论基础 24827.2.1 优势函数分解与顺序更新 24927.2.2 优势函数分解引理 24927.2.3 策略单调提升界 25027.3 A2OP算法 25127.3.1 A2PO算法的单智能体策略单调提升界 25227.3.2 A2PO算法的联合策略单调提升界 25327.4 代码实现 25427.5 MAT算法 25927.6 小结 268第 28章 蒙特卡洛树搜索和群体学习 26928.1 蒙特卡洛树搜索 27028.1.1 自博弈训练MCTS 27128.1.2 Tic-tac-Toe 27628.1.3 AlphaZero 27928.2 群体学习 28028.2.1 PSRO算法 28028.2.2 经验博弈理论分析 28128.2.3 元博弈及其求解 28128.2.4 策略集合扩展 28428.2.5 PSRO算法收敛性 28528.3 小结 286《动手学博弈论》全书速览结束语从基础AI技术到高阶博弈决策交大俞勇团队「动手学」系列用七部匠心著作完整构建了一套全链路、实战化、体系化的人工智能学习体系陪伴千万学习者从零起步、进阶深耕成为无数高校教学、企业技术培训的首选实战教材。《动手学博弈论》的重磅上市不仅是系列丛书的全新升级更是对AI实战教学体系的一次关键补全。它打破了博弈论“小众难懂、脱离实战”的固有标签让抽象的博弈逻辑变得可学习、可实操、可复用无论是想要夯实AI底层逻辑的技术新人深耕算法与决策研究的科研从业者还是需要运用博弈思维优化决策、拆解问题的职场人都能在书中收获专属成长答案。以实战破壁垒以体系筑根基。跟随顶尖团队的教学节奏跳出碎片化学习误区系统掌握博弈核心逻辑与实战方法解锁人工智能高阶决策能力在技术迭代与行业竞争中筑牢核心竞争力奔赴更广阔的技术与职业赛道
返回列表