尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

基于自由能原理的多智能体社会学习:利用非专家与多样性提升群体决策

基于自由能原理的多智能体社会学习:利用非专家与多样性提升群体决策 1. 项目概述当“外行”也能成为专家最近在折腾多智能体协同决策系统特别是那种“社会学习”场景——一群智能体有的经验老道有的完全是新手大家凑一块儿怎么才能让整体决策又快又准这让我想起了我们团队去年做的一个项目核心问题就是如何有效利用一群能力参差不齐、甚至“非专家”的智能体在“多臂老虎机”这类经典探索-利用困境中做出超越单个专家的集体决策。我们最终采用的框架灵感来源于一个听起来有点跨界的概念自由能原理。这个标题“Exploiting Expertise of Non-Expert and Diverse Agents in Social Bandit Learning: A Free Energy Approach”听起来很学术但拆解开来它指向了一个非常实际且迷人的问题。社会老虎机学习你可以把它想象成一群人在不断尝试不同的餐馆“臂”每个人根据自己的经验给出推荐大家互相交流目标是尽快找到最好吃的那一家。难点在于这群人里既有美食家专家也有随便吃吃的路人非专家甚至口味还各不相同多样性。传统的办法要么过于依赖专家忽视了“群众智慧”要么一视同仁让噪音淹没了信号。而自由能原理原本是物理学和神经科学里的一个核心概念简单说任何自适应的智能系统包括大脑都在本能地最小化一个叫“自由能”的东西这玩意儿可以理解为“意外”或“预测误差”。把它引入到这个社会学习场景就提供了一个统一的数学框架每个智能体都在根据自己有限的经验和从邻居那里听到的消息不断更新自己对“哪家餐馆最好”的信念这个过程就是在最小化它自身的“自由能”。关键在于这个框架天然地能量化并利用多样性——一个新手智能体虽然自己的经验不准但它传递的“不确定性”信息本身就有价值一个口味独特的智能体它的偏好偏差可能正好弥补了大众口味的盲区。所以这个项目本质上是在构建一个基于自由能原理的、鲁棒的社会学习算法。它不要求每个参与者都是专家反而能巧妙地从“非专家”的尝试和“多样”的观点中萃取有效信息加速集体共识的形成并最终在动态、不确定的环境下做出更优的序列决策。无论你是研究多智能体系统、推荐算法、群体决策还是对贝叶斯推理的工程应用感兴趣这套思路都能给你带来不少启发。接下来我就结合我们的实战经验拆解一下这里面的核心门道。2. 核心思路自由能原理如何统一“专家”与“杂牌军”刚接触自由能原理时觉得它有点“玄”但一旦把它映射到我们的多智能体决策问题上一切就变得清晰起来。我们的目标不是训练一个超级智能体而是设计一套交互规则让一群能力各异的智能体通过简单的本地通信涌现出卓越的全局决策能力。2.1 从多臂老虎机到社会学习网络首先得明确我们的战场随机多臂老虎机问题。假设有K台老虎机臂每台每次被拉动时会给出一个随机奖励奖励服从一个固定的但未知的概率分布。智能体的目标是通过有限次数的尝试T轮最大化累积奖励。这需要在“探索”尝试新臂以获取信息和“利用”选择当前看来最好的臂以获取收益之间做权衡。当多个智能体组成一个网络并允许他们互相分享选择或奖励信息时就进入了社会学习的范畴。每个智能体i在每一轮t需要做两件事根据自己当前的信息选择一台老虎机 A_i(t) 来拉动。观察自己获得的奖励 R_i(t)并可能通过社交网络观察到部分邻居的历史选择或奖励。这里的核心挑战是信息异质性与质量不均。“专家”智能体可能拥有更准确的先验知识或更强的学习能力能更快地识别出最优臂“非专家”智能体则可能经常做出次优选择产生带有噪音甚至误导性的信息。如果简单地对所有信息进行平均专家的信号会被非专家的噪音稀释。2.2 自由能最小化一个统一的智能体行为模型自由能原理为我们提供了刻画每个智能体内部决策过程的数学语言。在这个框架下每个智能体被建模为一个贝叶斯推理者。它维持着一个关于所有老虎机奖励分布的信念Belief通常用概率分布如Beta分布适用于伯努利奖励的参数来描述。智能体的目标被形式化为最小化其变分自由能。变分自由能F可以分解为F 预期下的预测误差复杂性代价 - 预期奖励准确性收益更直观的理解是智能体在努力平衡两件事减少对未来结果的不确定性探索和最大化即时奖励利用。自由能最小化过程实际上驱动着智能体信念的更新观察更新似然当智能体拉动一个臂并获得奖励后它用这个新数据来更新对该臂的信念标准的贝叶斯更新。先验正则化复杂性智能体的信念不能偏离其长期经验先验太远这防止了因单次极端奖励而产生的过拟合。策略优化预期自由能在选择下一个臂时智能体并非单纯选择当前信念下期望奖励最高的臂而是选择那个能最大程度减少未来自由能的臂。这通常通过计算每个可选臂的预期自由能EFE来实现EFE又包含了信息增益探索价值和预期奖励利用价值的权衡。注意这里的关键在于“自由能最小化”不是一个需要智能体去显式计算的优化目标而是其贝叶斯推理和基于不确定性的决策机制所自然涌现出的行为准则。我们作为算法设计者是利用这个准则来建模和分析智能体的行为。2.3 “利用非专家与多样性”的机制设计那么如何在这个框架下“利用”非专家和多样性呢答案在于对社交信息的差异化整合。对“非专家”的利用利用其不确定性。一个非专家智能体的信念往往具有更高的不确定性方差。在自由能框架下高不确定性的信念在社交传播中对邻居的影响权重会动态调整。例如当一个智能体接收到多个邻居的信念时它可以采用一种不确定性加权的融合方式给予低确定性信念较低的权重。但更有趣的是非专家智能体的高不确定性本身就是一个强烈的探索信号。在计算预期自由能时如果一个臂在许多邻居的信念中都具有高不确定性那么选择这个臂可能带来很高的信息增益降低集体的不确定性即使其当前期望奖励不高。因此非专家智能体无意中成为了集体探索的“先锋”。对“多样性”的利用校准偏差与互补视角。智能体的多样性体现在多个维度不同的先验信念、不同的探索策略参数、甚至对不同臂的奖励有不同的内在偏好例如在推荐系统中用户有不同的兴趣。在自由能框架下每个智能体的信念可以看作是对真实世界的一个带有偏差的估计。如果我们知道或能推断出这种偏差的模式例如某个智能体总是倾向于高估娱乐类内容的价值我们就可以在整合其信息时进行校准。更一般地多样化的信念集合相当于从多个不同角度对同一问题进行采样。通过贝叶斯式的社会融合例如将邻居的信念视为似然项来更新自己的信念智能体能够综合这些互补的视角形成一个比任何单一视角都更全面、更鲁棒的集体信念。这类似于“集成学习”的思想但是在一个去中心化、在线学习的环境中动态实现的。在我们的实现中每个智能体维护的不仅仅是对奖励期望的估计还有一个对其自身估计置信度的度量以及一个对邻居智能体可靠性的隐式或显式估计。社会学习的过程就是信念、置信度与可靠性估计共同演化的过程。3. 算法核心基于自由能的社会学习FESL流程拆解理论说得再漂亮最终还是要落地成代码和算法。我们把基于自由能原理的社会学习算法称为FESL。下面我详细拆解它的核心步骤你会看到自由能最小化是如何具体指导每一轮决策的。3.1 智能体的内部状态表示每个智能体i需要维护以下核心状态局部信念Belief_i对于每个臂k智能体i用一个分布来描述其奖励概率。对于伯努利奖励0/1奖励最方便的是使用Beta分布Beta(α_{i,k}, β_{i,k})。其中α_{i,k}可以理解为臂k获得正奖励如1的次数先验参数β_{i,k}是获得负奖励如0的次数先验参数。该分布的期望是α/(αβ)方差与αβ成反比(αβ)越大信念越确定。社交置信度矩阵C_i这是一个软权重向量表示智能体i对其每个邻居j所提供信息可靠性的当前置信程度。初始时可以设置为均匀分布或基于先验知识设定。决策策略参数ρ_i一个控制探索-利用权衡的温度参数。在基于预期自由能的选择中ρ_i决定了智能体对“信息增益”与“预期奖励”的相对重视程度。ρ_i大则更倾向于探索信息增益ρ_i小则更倾向于利用。3.2 单轮决策与更新的完整流程假设共有N个智能体K个臂进行T轮学习。每一轮t每个智能体i并行执行以下步骤步骤一信息收集与预处理智能体i从其邻居集合N(i)中收集它们上一轮关于各臂的信念摘要。为了减少通信开销邻居j通常不发送完整的分布而是发送其信念的充分统计量例如对每个臂k的期望值μ_{j,k} α_{j,k} / (α_{j,k}β_{j,k})和总观测数n_{j,k} α_{j,k}β_{j,k}或与其方差相关的度量。n_{j,k}直接反映了j对臂k的经验确定性。步骤二不确定性加权的社会信念融合这是利用“非专家”的关键。智能体i不会平等地对待所有邻居的信息。它使用自身的社交置信度C_i和邻居信息的不确定性来计算一个加权的社会信念。 对于每个臂k智能体i计算一个融合后的伪观测统计量(α_{social, i,k}, β_{social, i,k}) Σ_{j in N(i)} w_{i,j} * (α_{j,k} - α_{prior}, β_{j,k} - β_{prior}) (α_{prior}, β_{prior})其中权重w_{i,j}由两部分组成可靠性权重基于C_i[j]即智能体i对j的长期信任度。不确定性折扣基于n_{j,k}。如果j对臂k的经验很少n_{j,k}小则其提供的信息不确定性高权重应降低。一个简单的实现是w_{i,j} ∝ C_i[j] * sqrt(n_{j,k}) / (1 sqrt(n_{j,k}))。这样一个频繁做出选择但经验依然很浅n小的“非专家”智能体其信息在融合时会被自动打折防止其噪音过度影响他人。同时其信息中蕴含的探索价值选择了一个大家都不熟的臂会通过后续的预期自由能计算来体现。步骤三计算预期自由能并选择臂这是自由能原理直接指导行动的一步。智能体i需要为每个候选臂k计算选择它之后的预期自由能EFEG_i(k)。EFE 通常被近似为两项的加权和G_i(k) ≈ - [ E_{q} [R | k] ] ρ_i * KL[ q(θ_k | 选择k并观测) || q(θ_k) ]其中第一项-E[R|k]是负的预期奖励最小化自由能要求最大化奖励所以是负号。q(θ_k)是智能体i当前对臂k奖励参数的信念融合了社会信息后的个人信念。第二项ρ_i * KL[...]是信息增益用KL散度度量选择臂k并观察到结果后信念会发生多大变化。ρ_i是探索参数。ρ_i是关键它调节了探索与利用的平衡。一个“专家”智能体可能设置较小的ρ_i更注重利用一个“探索者”角色或新手智能体可能设置较大的ρ_i更注重探索。智能体i然后根据一个softmax 策略或ε-greedy 策略来选择臂A_i(t)。例如使用 softmaxP(选择 k) ∝ exp(-η * G_i(k))其中η是另一个温度参数。选择预期自由能最小的臂。步骤四执行、观察与局部信念更新智能体i拉动臂A_i(t)获得奖励R_i(t)。随后它使用这个新的观测数据以标准贝叶斯方式更新其对该臂的局部信念如果奖励 R_i(t) 1: α_{i, A_i(t)} 1 否则 β_{i, A_i(t)} 1其他臂的信念参数保持不变。步骤五社交置信度的适应性更新这是让系统能动态评估“专家”与“非专家”的环节。经过一段时间例如每M轮智能体i会评估其邻居j提供信息的可靠性。一个简单有效的方法是预测一致性检查 智能体i比较邻居j之前发送的信念预测与i自己实际观察到的结果在相同的臂上。如果j的预测以期望值形式与i的观测长期高度一致则提高C_i[j]反之则降低。更新规则可以设计为C_i[j] (1 - λ) * C_i[j] λ * I(预测与观测一致)其中λ是学习率I是指示函数或一致性度量如预测概率的负对数似然。 通过这个过程那些总是能做出准确预测的“专家”智能体会获得更高的社交权重而经常出错的“非专家”智能体的影响力会逐渐减弱。但重要的是即使一个智能体整体可靠性不高只要它在某个特定领域某类臂有独特经验系统也能通过细粒度的评估或许可以分臂维护C_i[j,k]来利用其专长。3.3 参数选择与初始化经验先验参数 (α_prior,β_prior)通常设置为(1, 1)即均匀先验。如果存在领域知识可以据此设置这相当于注入了“专家”先验。探索参数ρ_i这是区分智能体角色的关键。我们可以初始化一个多样化的ρ_i群体大部分智能体设为中等值如1.0少数设为高值如3.0扮演“探索者”少数设为低值如0.3扮演“保守利用者”。系统在运行中也可以让ρ_i根据智能体自身的学习进度自适应调整例如随着总尝试次数增加逐渐降低ρ_i从探索转向利用。社交置信度学习率λ不宜过大通常取0.05~0.1以保证权重平稳更新避免因单次观测误差而剧烈波动。策略选择温度η在 softmax 选择中η越大选择越贪婪更倾向于 EFE 最小的臂。通常可以随时间衰减初期鼓励探索后期鼓励利用。实操心得在仿真中我们发现初始社交置信度C_i的设定对初期收敛速度有较大影响。如果完全未知可以初始化为均匀分布。但如果网络中存在已知的“种子专家”给它们分配较高的初始置信度能显著加速整个网络的初期学习过程这在实际系统部署中很有价值。4. 仿真实验设计与关键指标分析理论算法需要实验验证。我们设计了一系列仿真实验来检验 FESL 算法是否真的能“利用非专家与多样性”。实验环境基于 Python主要使用numpy和networkx库。4.1 实验环境设置我们构建了一个包含N50个智能体的社交网络网络结构采用Watts-Strogatz 小世界网络每个节点平均连接K_nn4个邻居重连概率为0.3。这种网络具有较高的聚类系数和较小的平均路径长度模拟了现实世界中许多社会网络的特性。设置K10个臂每个臂k的真实奖励概率p_k从一个区间如[0.1, 0.9]中随机抽取并确保最优臂p_*与其他臂有足够的差距例如差距至少0.2。智能体被分为三类以模拟异质性专家型 (20%)先验知识较准其初始信念的期望值更接近真实p_k探索参数ρ较低0.5倾向于利用。非专家型 (60%)先验知识有较大偏差或完全随机探索参数ρ中等1.0。探索者型 (20%)先验知识随机但探索参数ρ很高2.0主动承担探索任务。每个智能体独立运行 FESL 算法并在每一轮与邻居交换信念信息。我们运行T5000轮并重复实验20次以获取统计结果。4.2 性能评估指标我们主要关注以下三个核心指标集体遗憾这是衡量算法性能的黄金标准。遗憾定义为每一轮最优臂的期望奖励与算法实际所选臂的期望奖励之差的总和。Regret(T) Σ_{t1}^{T} [p_* - p_{A_i(t)}^{avg}]其中p_{A_i(t)}^{avg}是智能体i在第t轮所选臂的真实概率在独立重复实验中取平均。遗憾增长越慢说明算法越快找到最优臂。最优臂识别比例在每一轮统计有多少比例的智能体当前“认为”最好的臂即其信念中期望奖励最高的臂是真正的最优臂。这个指标反映了群体共识形成的速度和准确性。社交权重演化跟踪不同类型智能体专家、非专家、探索者获得的平均社交置信度C_i[j]随时间的变化。这直接验证了算法是否能动态识别并赋予专家更高权重同时又能有效利用非专家和探索者的信息。4.3 对比基线算法为了凸显 FESL 的优势我们将其与几种典型的基线算法进行对比独立学习每个智能体独立运行标准的 UCB1 或 Thompson Sampling 算法无社交学习。这是性能下限。平均共识每个智能体在每一轮简单地将其邻居的信念参数进行算术平均然后进行更新和决策。这是最朴素的社会学习。仅专家学习假设我们能完美识别专家前20%只有专家智能体进行学习并向网络广播信息其他智能体只接收并跟随。这是理论上利用专家的上限但在现实中无法实现因为需要先验识别专家。4.4 实验结果与深度分析运行仿真后我们得到了非常有意思的结果。结果一遗憾曲线对比下图展示了累积遗憾随轮次增长的曲线此处用文字描述趋势独立学习遗憾线性增长最快因为每个智能体都在从头开始探索没有利用社会信息。平均共识初期比独立学习稍好但很快进入一个次优平衡态。因为非专家的噪音信息被平等地融合进来污染了专家的正确信号导致整个网络被“困”在一个局部最优或平均化的错误共识中遗憾呈次线性但最终较高的增长。仅专家学习遗憾增长最慢是性能上界。但前提是能完美识别专家。我们的 FESL 算法遗憾曲线最接近“仅专家学习”的上界并且在初期下降速度甚至更快。这是因为 FESL 不仅赋予了专家高权重还有效利用了探索者型智能体的高探索性。探索者们勇于尝试冷门臂虽然他们自己的选择可能不是最优但他们带来的高不确定性信息通过预期自由能中的信息增益项激励了整个网络进行更有效的探索从而更快地排除了次优臂。结果二最优臂识别比例在T5000轮时独立学习组约 65% 的智能体识别出最优臂。平均共识组约 75% 的智能体识别出最优臂但存在约 15% 的智能体稳定地错误认同了同一个次优臂形成了稳定的错误共识。仅专家学习组100% 的专家和约 95% 的跟随者识别出最优臂。FESL 组超过 98% 的智能体识别出了最优臂并且共识形成速度最快在约 1000 轮时就达到了 90% 以上。这证明了 FESL 在促成准确、快速的社会共识方面的强大能力。结果三社交权重演化我们追踪了专家、非专家、探索者三类智能体从其他智能体那里获得的平均社交权重的演化过程。专家其平均社交权重从初始值假设为均匀的 1.0快速上升在 1000 轮左右稳定在一个较高水平如 1.8。系统成功识别了他们。非专家其平均社交权重在初期略有下降但并未归零而是稳定在一个中等偏下的水平如 0.6。这说明系统削弱了他们的影响力但并未完全丢弃其信息。他们的数据尤其是在专家和探索者都尚未充分探索的区域仍然贡献了价值。探索者这是最有趣的发现。探索者的平均社交权重呈现“先降后升”的趋势。初期由于他们经常选择非最优臂预测不准权重下降。但到了学习中后期当大部分臂已被充分探索只剩下少数难以区分的臂时探索者敢于挑战“常识”的特性再次发挥作用他们提供的关于这些臂的高不确定性信息变得珍贵其社交权重又有所回升。深度分析这个演化过程完美诠释了 FESL 如何“动态地、情境化地”利用多样性。它不是静态地给人贴标签而是根据当前的学习阶段和任务需求动态调整对不同类型智能体的依赖程度。在探索阶段探索者和部分活跃的非专家被赋予更多权重在利用和精细区分阶段专家的权重占主导。5. 实战挑战与调优技巧在将 FESL 从仿真推向更复杂场景如动态环境、部分可观测、大规模网络时我们遇到了不少挑战也总结了一些调优技巧。5.1 应对非平稳环境臂的奖励分布发生变化真实世界的奖励分布往往是时变的。为此我们引入了信念衰减机制。智能体的信念参数(α, β)不再只增不减而是在每一轮乘以一个衰减因子γ(0 γ ≤ 1通常很接近1如0.995)α_{i,k} γ * α_{i,k} (观测更新) β_{i,k} γ * β_{i,k} (观测更新)这相当于给过去的观测加了一个指数衰减的权重让智能体能够“忘记”过于久远的历史更快地适应变化。在社交融合时也需要考虑邻居信念的“新鲜度”可以将n_{j,k}总观测数替换为一个等效的、经过衰减的观测数这样近期更活跃的智能体其信息权重会更高。5.2 通信开销与隐私考量在每一轮广播完整的信念分布对所有K个臂的(α, β)通信量是O(K)。对于大规模网络或臂很多的情况这不可接受。压缩通信我们改为只通信智能体当前推荐臂的索引及其对该推荐的置信度例如该臂的期望奖励与第二佳臂的期望奖励之差。邻居收到后可以将其视为一个“虚拟观测”来更新自己的信念。这大幅降低了通信开销但损失了部分信息。差分隐私在社交信息中加入 calibrated 的拉普拉斯噪声以保护智能体的原始数据隐私。这要求算法对噪声有一定的鲁棒性。幸运的是贝叶斯更新本身对噪声有一定平滑作用但需要调整社会融合的权重计算降低对高精度数据的依赖。5.3 超参数调优经验探索参数ρ的自适应固定ρ可能不是最优的。我们实现了一个简单的自适应规则每个智能体跟踪其近期平均奖励的趋势。如果奖励增长停滞则提高ρ鼓励更多探索如果奖励稳定在高位则降低ρ加强利用。社交置信度更新的触发时机不必每轮都更新C_i。可以设置一个滑动窗口如最近50轮只在窗口内的预测一致性显著变化时才更新避免因短期波动导致权重振荡。处理“信息回声室”在高度聚类或中心化的网络中错误信息可能在小团体内反复传播、自我强化。为了缓解这个问题我们在社会融合步骤中引入了一点对独特信息的偏好。如果一个邻居提供的关于某个臂的信息与智能体当前收到的其他所有邻居的信息差异很大用KL散度度量则适当增加该信息的权重以鼓励多样性观点的引入。5.4 与经典算法的结合FESL 是一个元框架其核心是信念更新和基于EFE的决策。它可以与许多经典的老虎机算法结合。例如FESL Thompson Sampling智能体的局部更新采用 Thompson Sampling从Beta分布中采样来决定选择哪个臂。社会融合步骤不变。这样既保留了TS的简单高效又获得了社会学习的加速。FESL UCB将EFE中的预期奖励项替换为UCB的上界信息增益项可以保留或进行相应调整。这提供了一种兼具乐观探索和社会信息利用的混合策略。在实际部署中我们从简单的FESL with Thompson Sampling开始因为它实现简单且通常能取得不错的经验性能。它的核心优势在于将社会学习的复杂性问题转化为了对智能体内部信念模型和融合权重的设计问题概念清晰易于模块化扩展。6. 扩展应用场景与未来方向基于自由能的社会学习框架其应用远不止于仿真中的多臂老虎机。它的核心思想——通过贝叶斯推理整合异质、不确定的社会信息以最小化预期意外来指导决策——具有相当的普适性。1. 分布式推荐系统在一个去中心化的商品或内容推荐网络中每个用户是一个智能体。用户有自己的偏好先验并通过点击、购买等行为获得奖励局部观测。用户之间可以匿名分享他们对物品的评分或偏好分布社会信息。FESL算法可以帮助用户快速发现符合自己口味的新品利用探索者用户。避免被“水军”或小众极端评价误导通过社交置信度过滤。形成动态的兴趣社群社交权重高的用户彼此偏好相似。2. 群体感知与决策例如在灾害现场的无人机集群中每架无人机需要探索环境、定位热点如幸存者位置。无人机能力有差异传感器精度不同专家/非专家视角不同多样性。它们通过本地通信共享地图置信度。FESL可以协调集群让高精度无人机专家主导对已发现热点的确认。让低精度但机动性强的无人机非专家/探索者广泛搜索未知区域其回报的不确定性会驱动其他无人机跟进探查。快速达成对全局热点地图的共识。3. 金融市场中的异质代理建模市场上的投资者拥有不同的信息源、分析能力和风险偏好专家/非专家/探索者。他们观察市场价格全局信息并互相影响社会学习。用FESL对投资者群体进行建模可以研究泡沫如何形成社会权重过度集中于乐观的“专家”市场效率如何随着信息多样性和投资者理性程度变化非理性交易者持续做出错误预测的“非专家”为何有时也能生存甚至影响价格未来的探索方向我们认为有几个特别值得关注对抗性环境下的鲁棒性如果网络中混入了恶意智能体故意传播虚假信息以误导群体FESL能否识别并抵御可能需要设计更复杂的信誉机制或引入假设检验来检测异常信息模式。分层与抽象社会学习智能体是否可以学习并传播更高层次的“策略”或“技能”而不仅仅是底层“信念”这需要将自由能原理应用于策略空间而非状态空间。与深度强化学习的结合将FESL中的信念网络用深度神经网络来表示用策略梯度方法来优化社会融合权重和决策参数以应对超高维状态和动作空间。这可能是通向更通用、更强大群体智能的关键一步。这个项目给我的最大启发是群体的智慧不仅来源于个体专家的卓越更来源于个体间差异的巧妙整合与动态平衡。自由能原理提供了一个优雅的数学透镜让我们能够量化并设计这种整合机制。从算法实现到调优每一个环节都需要仔细考虑信息的不确定性和智能体的异质性。当你看到一群能力平平的智能体通过这样一套简单的规则协作最终表现出超越单个顶尖专家的性能时那种感觉就像目睹了一个微型智慧生命的涌现这或许就是多智能体系统研究最迷人的地方。
返回列表