尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

人脑算力极限:能量如何定义计算上限?

人脑算力极限:能量如何定义计算上限? 这次我们来看一篇 1989 年的老论文Ralph Merkle 的《Energy Limits to the Computational Power of the Human Brain》。看到这个年份先别急着划走——这篇论文虽然写于三十多年前但它讨论的问题恰好是今天我们做大模型训练、GPU 选型、推理优化时躲不开的那个问题一个计算系统在物理上到底能跑多快怎么估算它的极限影响它速度的到底是芯片工艺、算法设计还是更底层的物理规律Ralph Merkle 是什么人公钥密码学最早的独立研究者之一Merkle 树哈希树的提出者后来长期活跃在纳米技术和量子密码学领域。他写这篇论文主要不是想回答生物学问题而是想回答一个工程问题如果抛开硅基工艺、编程框架这些“可以不断改进”的因素人脑这台生物计算机的计算能力上限最终会被什么卡住他的答案非常明确能量。Merkle 的推理路径可以压缩成三句话。第一人脑功耗大约在 20 到 25 瓦这个量级第二按论文的估算口径大脑每秒大约执行 10 的 14 次方次操作第三这个水平距离热力学给出的理论下限Landauer 极限还差着七八个数量级说明生物实现远没有压到物理极限。换句话说人脑很强但远不是“物理上的极限”未来基于原子级制造的计算系统理论上可以快很多。这篇文章接下来会做四件事拆解论文的“能量预算法”分析框架把大脑的能量账本列清楚用一段 Python 把估算过程复现出来最后把这个框架放到今天的 AI 算力语境里看看它对选卡、评估训练能耗、设计低功耗推理系统还有没有参考价值。如果你平时关心大模型训练成本和推理功耗这篇应该值得读完。1. 论文核心信息速览先把论文的基本信息整理成一张表方便后续检索和引用。这里要特别说明一个问题论文里的数字是 1989 年的估算口径和后来神经科学用更先进测量手段得到的数字会有出入但数量级基本一致。我们关注的重点不是某个数字是否精确而是这套分析框架是否仍然成立。项目内容论文标题Energy Limits to the Computational Power of the Human Brain作者Ralph Merkle发表年份1989作者背景公钥密码学独立发明者之一、Merkle 树提出者、纳米技术与量子密码学研究者核心问题人脑计算能力受哪些物理量限制理论上的数量级上限是多少分析方法能量预算分析计算速率 可用功率 / 单次操作能耗主要估算大脑计算速率约 10^14 次操作/秒功耗约 20 到 25 瓦关键对比单次神经事件能耗高出 Landauer 极限约 7 到 8 个数量级对今天的影响为 AI 算力能耗评估、神经形态计算、分子计算提供物理分析框架适合读者关注 AI 算力效率、芯片能耗、神经形态芯片、物理极限与能耗优化的工程师和研究者从这张表能直接看出论文的落脚点不是“人脑有多厉害”而是“人脑离物理极限还有多远”。这个视角在今天尤其有价值。现在的大模型训练动辄消耗千兆瓦时级别的电力推理服务要按 token 算电费芯片设计要反复优化每瓦性能指标本质上都是在做能量预算分析。只是很多做工程的人还没有意识到1989 年已经有人用类似的方法先把人脑这台“生物计算机”的账单算了一遍。2. 为什么要重读一篇 1989 年的旧论文2.1 作者视角Merkle 不是神经科学家Merkle 写这篇论文时的身份更接近密码学家和纳米技术倡导者而不是传统意义上的神经科学家。他的关注点从一开始就不只是大脑本身而是分子制造和纳米计算的未来。在 1989 年硅基芯片还处于从微米制程向亚微米制程迈进的阶段个人电脑的性能以 MIPS 计神经网络研究刚刚经历一轮复兴人们开始重新讨论“计算能不能模仿大脑”。在这个背景下Merkle 提出一个非常工程化的问题如果有一天我们能精确地在原子尺度构造计算设备那么 25 瓦的功耗到底能支撑多强的计算能力人脑正好是一个现成的参照物。这个视角对今天的读者仍然有启发。现在讨论“人脑 vs 大模型”时很多人直接拿参数量和推理速度做对比却忽略了最关键的限制条件功耗。Merkle 的论文提醒我们任何物理系统都有功率上限计算能力不会无限增长最终会被散热、能量供给和单次操作的最小能量成本卡住。这一点不会因为算法改进或制程进步而消失。2.2 “能量定义计算能力”的思路很超前1989 年绝大多数计算机科学家的性能指标是时钟频率、指令数、浮点运算次数很少有人会把“焦耳”“瓦特”和“计算能力”放在同一个公式里讨论。Merkle 的做法是直接把大脑看作一个功率受限的信息处理系统用物理定律推上限。这种思路后来成了高性能计算领域评估能效的标准方式比如今天的 TOPS/W、FLOPS/W 指标本质上就是能量预算法在不同硬件上的具体表现。这篇论文之所以值得重读不是因为它的计算有多么精细而是因为它提供了一个可以把“生物大脑”“硅基芯片”“未来计算设备”放在同一把尺子上度量的框架。无论你是做算法、做硬件还是做系统优化的工程师只要需要评估计算系统的物理边界这套框架都能直接用。3. 论文的核心分析框架能量预算法3.1 基本公式计算速率 可用功率 / 单次操作能耗Merkle 整篇论文的推导可以压缩成一个非常简单的公式C P / ε其中 C 表示每秒可执行的最大操作数P 是系统可用的平均功率ε 是每一次操作消耗的平均能量。这个公式的含义很直接你给一个计算系统多少能量系统每秒就能完成多少次操作。想提高计算速率要么增加功率供给要么降低单次操作能耗两条路都绕不开物理极限。从现代计算系统的角度看这个公式简直太“显然”了。一块 GPU 的功耗是 700 瓦算力是 10^15 FLOPS 量级那么每 FLOPS 大概消耗 0.7 纳焦耳一个 NPU 采用更低的精度、更稀疏的算子每瓦能效就会更高。但回到 1989 年很少有人用这种“从功率反推操作数”的方式思考大脑的计算极限Merkle 的分析算是比较早的系统化尝试。3.2 什么是“一次操作”任何能量预算分析都绕不开一个定义问题什么才算是“一次操作”。对于数字芯片操作可能是“一次浮点乘法”“一次整数加法”或“一次推理 token 生成”。对于大脑Merkle 面临同样的口径问题是统计一次动作电位一次突触事件还是一个神经元从静息到放电再到恢复的完整状态切换论文的处理方式是给出一个数量级分析不纠结于微观事件的精确定义而是把大脑整体看作一个每秒进行大量并行动态事件的系统。用后来的神经科学语言来解释大体上可以理解为“所有神经元和突触每秒完成的动态事件总数”。不同统计口径会带来几倍的差异但不会改变结论的数量级。这种“先估量级、再看趋势”的方法和我们在工程评估中做的 rough order of magnitude 估计非常接近。3.3 为什么能量预算法到今天依然有效能量预算法之所以有效是因为它抓住了计算系统最底层的约束信息处理必须消耗能量。即使未来出现完全可逆计算、超导芯片或量子计算机能量预算仍然成立只是 ε 的下限会发生变化。Landauer 极限给出了通用计算中不可逆比特操作的理论能耗下限在温度 T 下擦除 1 bit 信息至少要消耗 k_B T ln 2 的能量。这个极限对芯片设计、数据中心规划和算法优化都意味着一种长期约束。今天的 GPU 单个浮点运算能耗远高于 Landauer 极限说明硬件还有很大的效率提升空间大脑的神经事件能耗也远高于这个极限说明生物系统同样没有逼近物理边界。把这两个结论放到一起就能理解“能效提升”不是你追我赶的短期竞赛而是所有计算系统共同面对的长期课题。4. 关键估算大脑的能量账本4.1 功率预算20 到 25 瓦Merkle 在论文中使用的大脑功率预算大致在 20 到 25 瓦范围。这个数字和后来神经科学研究的观测基本吻合成年人大脑约占体重 2%静息状态下消耗全身约 20% 的能量绝对值约 20 瓦。到现代研究比如用 PET 和 fMRI 结合代谢测量得到的估计静息大脑的葡萄糖消耗折算成功率大约是 15 到 25 瓦仍然落在同一区间。20 瓦这个数字并不大一颗主流 CPU 的功耗就能超过它一块 GPU 的功耗是它的 30 倍以上。但大脑要在这么低的功率下完成语音识别、视觉理解、运动控制、语言生成等一系列任务这让它的能效显得非常突出。早期很多对比文章喜欢说“人脑算力等于多少台超级计算机”其实就是看中了大脑在功率受限条件下的高效率。4.2 操作速率约 10^14 次/秒Merkle 论文中给出的操作速率估算通常被引用为每秒约 10^14 次操作也就是一百万亿次。用一个简单的能量预算法可以把这个数字拆开如果大脑功率取 20 瓦速率为 10^14 次/秒那么单次操作平均能耗就是ε P / C 20 W / 10^14 ops/s 2 × 10^-13 J这个量级是合理的。生物学上的动作电位和突触传递事件每次消耗的能量大致在 10^-14 到 10^-13 焦耳之间取决于统计的是单个离子通道、一次突触事件还是完整的神经元状态更新。Merkle 的估算并没有精确到某个具体分子过程但他的数量级判断能够和后世的实测数据对上说明这个框架是可靠的。4.3 与 Landauer 极限的差距把大脑单次操作能耗放到热力学极限旁边对比才能看出生物系统的效率位置。人体核心温度大约 310 K在这个温度下 Landauer 极限约为k_B T ln 2 ≈ 1.38 × 10^-23 × 310 × 0.693 ≈ 3 × 10^-21 J/bit用 2 × 10^-13 J 除以 3 × 10^-21 J得到约 7 × 10^7 倍也就是 7 到 8 个数量级的差距。换句话说大脑的每次操作能耗比理论上的不可逆计算最低能耗高出约一亿倍。这个结论不是要否定大脑的效率而是说明生物计算距离物理极限还有很大冗余空间。Merkle 的乐观之处也在这里如果未来原子级制造能把单次操作能耗压低几个数量级同等功率下计算能力会有惊人提升。4.4 需要注意的边界必须强调能量预算只是给出了“上限”不意味着大脑真的能做到每秒 10^14 次操作。实际的神经编码有大量冗余神经元之间存在复杂的抑制与竞争很多动态事件可能不直接贡献有用计算。能量预算回答的是“物理最多允许跑多快”而不是“大脑在实际任务中真的跑多快”。这两个问题被混为一谈是很多科普文章出错的地方。对于做工程的人来说这个区别也很重要你看到一个芯片的理论算力不等于实际推理吞吐要区分理论峰值、可达到性能和实际业务性能。5. 用 Python 复现一次大脑计算上限估算这一节把论文的推导过程转成可运行的 Python 脚本。目的是让你在自己机器上也能快速调整参数比如功率、速率、温度看看结论怎么变化。下面三个脚本都可以直接复制保存为.py文件运行不需要额外安装第三方库。5.1 基础能量预算计算第一个脚本实现最核心的能量预算公式用功率和速率反推单次操作能耗或者反过来给功率和单次能耗推算最大速率。import math # 论文估算口径的参数 power_watts 20.0 # 大脑平均功耗单位 W ops_per_second 1e14 # 大脑每秒操作数单位 ops/s # 由功率和速率反推单次操作平均能耗 energy_per_op power_watts / ops_per_second print(f单次神经事件平均能耗约: {energy_per_op:.2e} J) # 反过来如果已知单次能耗可以计算最大速率 alternative_energy 2e-13 # 单次操作能耗单位 J max_ops power_watts / alternative_energy print(f按照单次能耗 {alternative_energy:.1e} J 推算最大速率为: {max_ops:.2e} ops/s)运行结果应该是两条数量级相近的输出理论上两种方式得到的速率都应在 10^14 次/秒附近。如果差异太大说明参数口径不一致需要检查功率值和单次能耗是否来自同一套估算模型。这个脚本的价值在于你可以替换成任何已知参数快速评估一个计算系统的能量上限。5.2 对比 Landauer 极限第二个脚本计算人体温度下的 Landauer 极限并输出它与大脑单次操作能耗的倍数关系。这里的关键是理解Landauer 极限是“擦除 1 bit 信息”的最低能耗而一次神经事件可能翻转多位状态所以倍数只是一个用来建立直觉的数量级参考。import math # 物理常数 k_B 1.380649e-23 # 玻尔兹曼常数单位 J/K # 人体核心温度约 37 摄氏度 T 310.15 # Landauer 极限k_B * T * ln2 landauer_limit k_B * T * math.log(2) print(f人体温度下的 Landauer 极限约: {landauer_limit:.2e} J/bit) # 大脑单次操作能耗来自上一节的估算 brain_event_energy 2e-13 ratio brain_event_energy / landauer_limit print(f大脑单次事件能耗约为 Landauer 极限的 {ratio:.1e} 倍) print(f换成一个更直观的说法大约差 {math.log10(ratio):.1f} 个数量级)输出结果会显示差距在 10^7 到 10^8 倍之间也就是 7 到 8 个数量级。这个数字本身不精确但足以说明生物系统离物理极限仍有很大距离。如果你把温度改成室温 300 K极限值会略有降低但结论不变把温度改成液氮 77 K极限能耗会下降约 4 倍这也能解释为什么超导和低温计算在物理上更省能但工程收益需要扣除制冷成本后重新判断。5.3 对比不同硬件的每瓦能效第三个脚本把大脑和现代计算系统的每瓦能效放到一起对比。这里用的参数都是公开量级具体到某个型号的 GPU、CPU数字会有差异但量级对比足够说明问题。# 对比不同计算系统的每瓦能效 # 数据为公开量级实际硬件参数请按具体型号替换 systems [ {name: 人脑Merkle 估算, ops: 1e14, power: 20}, {name: 现代 AI 加速卡FP16 稠密, ops: 1e15, power: 700}, {name: 桌面 CPU向量指令, ops: 1e12, power: 200}, ] print(系统每瓦能效对比) for s in systems: eff s[ops] / s[power] print(f{s[name]}: {eff:.2e} ops/s/W)从常见数据看人脑按 10^14 次操作、20 瓦估算每瓦约 5 × 10^12 次操作现代 AI 加速卡按 10^15 FLOPS、700 瓦估算每瓦约 1.4 × 10^12 FLOPS。也就是说即使按比较保守的口径大脑的每瓦能效仍然比现在的通用 AI 加速卡高几倍。差距不算夸张但要注意比较口径不同一个是“神经事件”一个是“浮点运算”两者不能完全画等号。6. 与现代 AI 算力对比效率差距在哪里6.1 绝对算力与能效是两回事从绝对算力看现代 AI 加速卡已经在向 10^15 FLOPS 量级迈进单卡即可逼近甚至超过论文对大脑整体速率的估算。但功耗同样大幅上升一张主流 AI 加速卡的功耗在 700 瓦左右是大脑的 30 倍以上。如果只看绝对算力会觉得“硬件已经超越人脑”如果加入功耗约束会发现能效差距仍然明显。这正是能量预算法最有用的地方它逼着你把算力和能源消耗放在同一个框架里评估而不是只比一个指标。对大模型从业者来说这种对比直接影响成本判断。同样一个推理任务用低功耗硬件意味着可以降低服务器散热压力、提高机柜密度用低精度计算可以成倍提高吞吐。这些优化表面上是工程问题底层其实都在改变能量预算公式里的 ε 和 P 两个参数。6.2 一次大模型训练的能耗相当于什么把能量预算视角放大到训练任务会得到一个很有冲击力的换算。以公开报道中一次大模型训练的耗电量为例通常在千兆瓦时GWh量级。换算成焦耳1 GWh 3.6 × 10^12 J如果把这个能量交给一个 20 瓦的人脑它可以持续运转3.6 × 10^12 J / 20 W 1.8 × 10^11 秒这大约是 5700 年以上。换句话说一次大规模训练的能耗相当于让一个人脑以 20 瓦功率连续运行数千年。这个对比不是为了制造焦虑而是为了说明现代 AI 训练在能量效率上还有巨大的优化空间。问题不在于“能不能训练”而在于“能不能更省着训练”。6.3 这种对比的公平性问题做这类对比时必须保持清醒人脑的 10^14 次操作和 GPU 的 10^15 FLOPS 并不是同类任务。人脑在低功耗下完成的是高并行、稀疏激活、容错性极强的模拟计算GPU 执行的是密集矩阵乘加精度要求高数据搬运开销大。直接比较数值会低估大脑也会低估现代硬件在特定任务上的优势。更合理的用法是把能量预算法当作评估工具而不是拿来下结论说“AI 永远追不上人脑”或“芯片已经超过人脑”的论据。7. 常见误解与边界条件围绕大脑算力和能量极限有很多流传很广的说法。这里用一张表把常见误解、可能原因和正确理解口径整理出来方便排查自己的认知偏差。现象 / 说法可能原因正确理解口径“大脑每秒 10^14 次操作是精确测量”把数量级估算当成实测值这是能量预算推导的近似结果不同统计口径差异可达数倍“能量不够所以大脑不可能再变快”把单一上限当成全因素解释能量只是关键约束之一还受散热、分子运输、信噪比限制“给大脑更多能量计算能力线性提升”默认能量与速率严格成正比能量供给增加会带来散热问题实际提升有上限“Landauer 极限是所有计算的能耗下限”混淆不可逆擦除与通用计算Landauer 极限针对不可逆比特擦除可逆计算可规避部分能耗“人脑只开发了 10%”把能量预算和功能使用混淆能量账本覆盖全脑不存在大面积闲置的计算资源“芯片每瓦能效已经超过大脑”忽略比较口径差异需要明确比较的是神经事件还是 FLOPS、是稠密计算还是稀疏计算这张表里最需要注意的一点是Merkle 的论文解决的是“物理上限”问题不是“真实性能”问题。脑科学实验表明大脑在执行具体任务时通常只激活一小部分神经元大量神经元处于抑制或待命状态。如果因此说“大脑只用了 10%”在能量上是说不通的因为整个网络维持静息电位、泵送离子、维持突触可塑性都需要持续消耗能量。这个误解在 AI 场景的对应版本就是“模型参数量大就一定更耗电”——实际耗电取决于激活的参数量、访存量和计算图结构而不只是参数总量。从工程角度看边界条件同样重要。能量预算的结论依赖于功率、单次能耗和操作定义这三个参数。任何一个参数口径不对结果都会跑偏。比如把“单次操作”定义为一次神经元静息态到放电再到恢复的完整周期和定义为一次突触事件数值差一两个数量级都很正常。做任何算力评估之前必须先把指标口径定义清楚否则再精确的计算都是白费。8. 对 AI 算力设计者的启示8.1 能耗墙是未来十年的核心约束大模型规模还在增长但数据中心的供电和散热已经越来越紧张。从能量预算角度看模型推理和训练的成本不会只由算力决定还会由电能决定。Merkle 的框架提醒我们与其纠结于“堆更多卡”不如先算清楚一件事——在给定的功率预算下怎么让系统完成更多有效操作。低精度推理、稀疏化、模型量化、KV Cache 优化本质上都是在降低公式里的 ε。你能把 ε 降多少系统就能在同一功率下多做多少事。8.2 向大脑学习稀疏激活和近似计算大脑的一个重要特征是稀疏激活每次任务只有一部分神经元参与而不是全网络同时高负荷运转。现代 LLM 推理也有类似思路比如 MoE混合专家模型只激活部分专家路径理论和实践都证明可以在不显著损失质量的前提下降低计算开销。论文提供的物理视角让这类设计选择有了更明确的依据稀疏激活降低的是实际平均能耗而能量预算关注的是平均值而不是峰值因此稀疏架构在同样功率上限下可以获得更高的有效吞吐。另一个值得借鉴的思路是近似计算。大脑的神经元并不追求每个动作电位都精确到小数点后若干位它的信息编码天然带噪声却能在复杂任务中保持强鲁棒性。对应到芯片设计低精度推理、近似计算单元、随机计算都能降低单操作能耗代价是精度下降。至于精度损失是否可接受需要结合具体任务来测试不能一概而论。8.3 物理极限决定长期路线从 Lamdauer 极限出发可以给计算技术画一条长期路线当前的数字芯片离理论极限还很远能效提升空间依旧巨大但要进一步逼近极限可能需要可逆计算、低温计算、分子计算或量子计算等范式突破。Merkle 之所以在 1989 年就对纳米技术抱有强烈信心正是因为他看到生物系统已经证明了“在很小体积、很低功耗下实现复杂计算”是可能的剩下的只是工程实现问题。对普通工程师而言这条长期路线意味着短期内应优先优化能效指标长期则需要关注那些可能改变 ε 数量级的底层技术。今天看起来很昂贵的量子计算、光计算、存内计算研究一旦在某个细分任务上突破能效瓶颈很可能重新定义大模型的部署边界。9. 总结与延伸阅读这篇 1989 年的论文最值得记住的结论不是某个具体数字而是那个可以反复使用的分析框架任何计算系统都要用“可用功率 / 单次操作能耗”来评估性能上限。人脑以 20 到 25 瓦的功耗支撑每秒约 10^14 次操作这个量级比今天的 AI 加速卡在能效上仍有一定优势但远未逼近 Landauer 极限说明生物计算和数字计算都还有很长的效率提升之路。如果你看完想自己验证建议先跑一遍第 5 节的三个 Python 脚本把功率、操作数、温度参数改一改观察结论如何变化。最容易踩的坑是把“操作”的定义混用导致数量级对不上其次是忘记区分理论上限和实际可达到性能。先把这两个问题想清楚整个分析就不会跑偏。关于这篇论文的延伸背景可以关注几个方向Landauer 1961 年关于信息擦除能耗的原始论文Bennett 在 1970 年代关于可逆计算的工作以及 Merkle 后来关于纳米技术和量子密码学的一系列文章。如果对大脑计算效率的现代测量感兴趣也可以去看基于葡萄糖代谢、PET 成像和突触计数的神经科学研究它们的数字会比 1989 年的估算更精确但分析框架仍然是一脉相承的。这篇论文适合放入“算力评估与能效优化”方向的收藏夹等下次做硬件选型或能耗评估时翻出来做对照参考。
返回列表