尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【学习笔记】-深度认知系列-第5讲-AI的“大脑”长什么样?——Transformer架构极简入门

【学习笔记】-深度认知系列-第5讲-AI的“大脑”长什么样?——Transformer架构极简入门 1、 你在读这句话的时候其实在“注意”在我们拆解Transformer之前先做一个小小的思想实验。此时此刻你正在读这句话。你的眼睛扫过这些文字你的大脑在做什么你并没有逐字逐句地“背诵”每一个字。你的大脑在跳跃——它在“注意”关键词“思想实验”“眼睛扫过”“大脑在做什么”。你正在做的事情有一个专门的名字——注意力机制Attention Mechanism。Transformer之所以能成为今天所有大模型的地基最核心的秘密就在这个词里注意力。在Transformer之前AI处理文字的方式像是一个“逐字阅读的机器人”——它老老实实地从左到右、一个字一个字地读。这种方法有两个大问题慢每个字都要等前一个字处理完容易迷路句子一长前面的信息就“消失”了。Transformer换了一种方式它不是逐字阅读而是“同时看”整句话然后自己决定——哪些词值得多看两眼哪些词扫一眼就够了。这个“同时看”的能力就是Transformer最核心的突破——并行处理 自注意力机制。2、Transformer的“大脑解剖图”如果把Transformer比作一个“超级阅读器”它内部有三个最重要的“零部件”2.1 自注意力机制让句子里的每一个词“互相看”句子“那只猫在追一只老鼠它跑得飞快。”当你读到“它”的时候你知道“它”指的是谁吗当然知道——“它”指的是“猫”不是“老鼠”。你是怎么知道的因为你在读这句话的时候无意识地完成了三件事看到了“它”知道这是个代词需要找一个“主人”扫了一遍前面的词“猫”“追”“老鼠”做了一个判断在这个句子里“它”和“猫”的关系更近猫是“追”的主体这不就是你在读句子时的“注意力”吗自注意力机制做的事情和你刚刚做的事情是一样的模型看到“它”这个词模型让“它”去“看”句子里的每一个其他词模型给每一个词打分——谁和“它”最有关系分数高的就是“它”最应该“注意”的词 “猫”的分数是0.9“老鼠”的分数是0.2模型就知道“它”更可能是指“猫”。这个“打分”的过程就是自注意力的核心。2.2 多头注意力多个“专家”同时看一句话我们每个人都只有一种“注意力模式”。但Transformer不一样——它有多个“注意力头”每个头关注不同的事情。你可以把多头注意力想象成你同时请了8个专家来读同一句话专家1专门看“语法结构”专家2专门看“语义关联”专家3专门看“位置关系”专家4专门看“指代关系”每个专家各看各的各自得出自己的“注意重点”。最后把所有专家的观点汇总在一起形成对这句话更全面的理解。多头注意力让模型不仅知道“猫和老鼠有联系”还能同时知道是什么联系、在哪一层面上联系。2.3 位置编码给词语装上“GPS定位”Transformer是“同时看”整句话的——但这里有一个致命问题如果所有词都是同时被看到的那“猫追老鼠”和“老鼠追猫”在模型看来有什么区别对模型来说这两句话里的词语完全一样只是顺序不同。如果模型不理解“顺序”它就无法理解“猫追老鼠”和“老鼠追猫”的区别。为了解决这个问题Transformer的设计者给每个词语加了一个“位置标签”——就像给每个人贴上一个号码牌 模型看到的并不是“猫”和“老鼠”两个孤立的词而是“猫” “位置3” · “老鼠” “位置7”有了这个“位置标签”模型就知道了“猫”在“追”的前面“老鼠”在“追”的后面——主语和宾语一下子就分清楚了。这个“位置标签”就是位置编码Positional Encoding。它相当于给每个词装上了“GPS定位”让模型知道它在句子里的坐标。3、两座“大楼”编码器与解码器除了上面这三个核心组件Transformer的整体结构还有一个非常重要的分层设计它由两座“大楼”组成——编码器Encoder和解码器Decoder。编码器负责“读”和“理解”解码器负责“写”和“生成”编码器负责“读”和“理解”。你输入的问题先进入编码器编码器把句子里的每个词都变成数字向量通过自注意力机制理解词与词之间的关系。编码器的输出是一组数字向量——这叫“编码表示”。解码器负责“写”和“生成”。它接收编码器输出的“编码表示”结合自己已经生成的前文一个字一个字地“预测”下一个词。可以这样理解编码器是“阅读理解总结归纳”的过程解码器是“边想边写”的过程。4、Transformer为什么如此重要Transformer之所以成为今天所有大模型的“地基”是因为它解决了一个根本性的瓶颈——并行处理。在Transformer之前AI处理文字是逐字按顺序推进的——每个词必须等前一个词处理完效率极低。而Transformer可以同时看到整个句子——所有词一次性进入模型并行计算训练速度直接起飞。更重要的是Transformer的“可扩展性”极强。它是一个“放大无上限”的架构——你给它更多数据、更大参数、更强算力它就能“长”得更大、更聪明。如果你只能记住一个关于Transformer的事实那应该是这个今天所有你能用到的、能聊天的、能写代码的、能画画的AI其底层架构都来自2017年谷歌团队那篇只有7页的论文——《Attention Is All You Need》5、这一讲你只需要记住这3句话 Transformer的核心是“注意力机制”——它让AI“同时看”整句话自己决定哪些词重要、哪些词不重要。就像你读句子时大脑自动关注关键词一样。 Transformer的大脑有三大部件——自注意力让词与词之间“互相看”、多头注意力多个专家同时看各看各的重点、位置编码给每个词装上GPS定位区分“猫追老鼠”和“老鼠追猫”。 所有大模型都长着同一个“大脑”——GPT、Claude、文心一言、盘古……它们都基于Transformer架构。Transformer之于AI就像发动机之于汽车。Transformer不是一个“更好的算法”它是一次对人脑注意力机制的工程化模仿。人脑处理语言时用的就是这个逻辑——看上下文、抓重点、忽略噪音。Transformer只是把人类做了几千年的本能翻译成了计算机能运行的数学语言。2017年那篇只有7页的论文开启了整个大模型时代。七年后Transformer已成为AI的“标准大脑”。而它的核心思想用一个字就能概括看。参考文献AI深度认知30讲 · 第5讲AI的“大脑”长什么样——Transformer架构极简入门
返回列表