尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

收藏必看!揭秘大模型如何将文字变成数字:小白也能懂的LLM第一课!

收藏必看!揭秘大模型如何将文字变成数字:小白也能懂的LLM第一课! 前言你有没有想过——当你说“今天天气真好”AI 读到的不是“天”“气”“真”“好”这四个字而是一串数字[1243, 892, 501, 733]它看不见文字听不到声音它只认识数字。那问题来了人类的语言是怎么变成这些数字的这不是魔法也不是玄学。这是大语言模型LLM最基础、也最精妙的第一步文本编码Tokenization。今天我们就来彻底拆解LLM 是如何把“文字”变成“数字”并让它们在神经网络里“跑起来”的。 第一步文字 ≠ 数字但机器只认数字计算机的底层只有0和1。哪怕你发一条微信、写一篇论文最终都会被转成二进制——但LLM的输入不是“二进制”而是整数序列。为什么因为直接把“天”“气”映射成数字比如“天”1“气”2会带来灾难性问题文字数字问题天1与“地”2但“天地”≠“天”“地”地2“天气”123但“三”3 → 语义错乱三3模型会误以为“天气”“三”所以LLM不能用“字典映射”。它需要一种既能保留语义又能处理无限词汇的编码方式。这就是——分词Tokenization。 第二步分词的智慧 —— BPE把词“切碎”再重组LLM 用的不是“一个字一个编号”也不是“一个词一个编号”而是Byte-Pair EncodingBPE——一种“聪明的切碎术”。✅ 举个例子假设我们有以下语料lowlowestnewerwiderwideBPE 的工作流程初始化把每个词拆成字符统计字符对频次“low” → l, o, w,“lowest” → l, o, w, e, s, t, 表示词尾找最常出现的字符对→ “o” “w” 出现2次→ 合并成新符号ow更新词表“low” → l, ow,“lowest” → l, ow, e, s, t,继续找下一轮“e” “s” 出现1次合并为es→ “lowest” → l, ow, es, t,重复直到达到目标词表大小比如50,000个Token最终你的词表可能长这样Token含义l字母 low字母组合 “ow”es字母组合 “es”t字母 t词尾new新词er后缀 “er”wide完整词wider完整词✅ 你会发现“wider” “wide” “er”“lowest” “low” “est” “ow” “es” “t”语义单元被拆解、复用效率极高 第三步把句子变成数字序列 —— Tokenizer 的魔法现在我们输入一句话“The capital of France is Paris.”Tokenizer 会这样处理分词Tokenize“The” →[452]“ capital” →[123]注意空格是token的一部分“ of” →[78]“ France” →[912]“ is” →[201]“ Paris.” →[678]“.” 与 “Paris” 合并最终输出[452, 123, 78, 912, 201, 678]这就是LLM真正“看到”的输入——一串整数没有字母没有标点只有编号。 你可以把Tokenizer想象成一个“翻译官”把中文/英文 → 翻译成“AI语言”而AI语言就是这50,000个Token组成的“词典”。 第四步数字如何“变成语义”—— Embedding层登场数字本身没有意义。但LLM有一个神奇的层叫Embedding Layer词嵌入层。它的作用是给每一个Token分配一个高维向量比如4096维这个向量编码了这个词的语义、语法、上下文关系。假设Token[452] “The” → 嵌入向量E[452] [0.23, -1.12, 0.87, ..., 0.51]共4096个数Token[123] “capital” →E[123] [0.41, 0.98, -0.33, ..., 0.19]那么输入序列[452, 123, 78, 912, 201, 678]就变成了一个6×4096的矩阵[ [0.23, -1.12, 0.87, ...], ← The [0.41, 0.98, -0.33, ...], ← capital [0.11, 0.05, 1.22, ...], ← of [0.67, -0.45, 0.77, ...], ← France [0.33, 0.21, -0.91, ...], ← is [0.89, 0.14, 0.55, ...] ← Paris.]这个矩阵就是LLM的“输入世界”。✅ 这个向量不是随便给的而是通过训练学出来的。“capital”和“city”的向量会很接近“France”和“Germany”会靠近欧洲区域“is”和“was”会靠近动词区域。语义藏在向量的几何空间里。这就是为什么“king - man woman ≈ queen”不是巧合而是向量空间的线性关系。⚙️ 第五步数字开始“运算”——从Embedding到Transformer现在LLM拿到了一个6×4096的数字矩阵。接下来它做的就是用数学运算不断重构这些数字。每一层Transformer都会做矩阵乘法Q X Wq计算查询向量点积相似度scores Q K.T哪个词和当前词最相关Softmax把分数变成概率注意力权重加权求和output attention_weights V融合上下文残差连接 归一化让信号稳定传递前馈网络x → W1 → GELU → W2非线性变换每一步都是纯数学运算矩阵乘法指数函数加法、除法、激活函数没有“理解”没有“意识”只有数字在高维空间里跳舞。但奇妙的是——当这些数字被反复变换、叠加、融合后输出的最后一个向量恰好能预测下一个最可能的Token输入“The capital of France is” →输出[0.01, 0.02, ..., 0.85, ..., 0.001]最大值在Token[678] “Paris.”→ 所以AI说“Paris.” 真实演示用Python模拟一次Tokenization Embedding# 伪代码模拟LLM的前两步tokenizer {The: 452, capital: 123, of: 78, France: 912, is: 201, Paris.: 678}# 输入文本text The capital of France is Paris.# Step 1: Tokenizetokens [452, 123, 78, 912, 201, 678]# Step 2: Embedding (简化版)embedding_dim 4embedding_table {452: [0.23, -1.12, 0.87, 0.51],123: [0.41, 0.98, -0.33, 0.19],78: [0.11, 0.05, 1.22, 0.44],912: [0.67, -0.45, 0.77, -0.21],201: [0.33, 0.21, -0.91, 0.66],678: [0.89, 0.14, 0.55, 0.88]}# 转换成矩阵x [embedding_table[t] for t in tokens]print(输入序列的嵌入向量6×4)for row in x:print(row)# 输出# [0.23, -1.12, 0.87, 0.51]# [0.41, 0.98, -0.33, 0.19]# [0.11, 0.05, 1.22, 0.44]# [0.67, -0.45, 0.77, -0.21]# [0.33, 0.21, -0.91, 0.66]# [0.89, 0.14, 0.55, 0.88] 你看到的不是文字而是6个4维的数字向量它们承载了“首都”“国家”“系动词”等语义关系。AI就是靠这些数字推理世界的。 为什么这如此重要很多人以为LLM“懂语言”其实它只是把文字 → 切成Token分词把Token → 映射成向量Embedding把向量 → 用数学变换不断融合Transformer把最终向量 → 映射回Token输出层选概率最高的 → 输出文字它没有“理解”“意思”“意图”但它完美模拟了语言的统计规律。就像一个精通围棋的AI它不理解“胜负”“艺术”但它知道哪一步赢的概率最高。✅ 总结LLM的“语言翻译器”三步曲步骤输入输出关键技术1. 分词“The capital of France is Paris.”[452, 123, 78, 912, 201, 678]BPEByte-Pair Encoding2. 嵌入Token序列6×4096 的数字矩阵学习型词嵌入Learned Embedding3. 运算数字矩阵更高阶的数字矩阵TransformerAttention FFN LLM 不认识“字”✅ LLM 只认识“编号” 它的“语言”是数学的语言 最后一句AI的“语言”是你看不见的宇宙你看到的“对话”是AI输出的文字。你没看到的是数万维空间里数十亿个数字的精密舞蹈。每一个字的背后是成千上万次矩阵乘法是数万亿参数的协同演化是人类用数学为语言建模的壮举。下一次当你对AI说“帮我写一首诗”请记住它听到的不是诗意是一串编号和一串在高维空间里悄悄旋转的向量。动手实验建议用 Hugging Face 的transformers试试from transformers import AutoTokenizertokenizer AutoTokenizer.from_pretrained(meta-llama/Llama-2-7b-chat-hf)print(tokenizer.encode(Hello, world!))# 输出[1, 15043, 11, 13]你看到的就是LLM眼中的“世界”。如何学习AI大模型如果你对AI大模型入门感兴趣那么你需要的话可以点击这里大模型重磅福利入门进阶全套104G学习资源包免费分享这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】这是一份大模型从零基础到进阶的学习路线大纲全览小伙伴们记得点个收藏第一阶段从大模型系统设计入手讲解大模型的主要方法第二阶段在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用第三阶段大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统第四阶段大模型知识库应用开发以LangChain框架为例构建物流行业咨询智能问答系统第五阶段大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型第六阶段以SD多模态大模型为主搭建了文生图小程序案例第七阶段以大模型平台应用与开发为主通过星火大模型文心大模型等成熟大模型构建大模型行业应用。100套AI大模型商业化落地方案大模型全套视频教程200本大模型PDF书籍学会后的收获• 基于大模型全栈工程实现前端、后端、产品经理、设计、数据分析等通过这门课可获得不同能力• 能够利用大模型解决相关实际项目需求 大数据时代越来越多的企业和机构需要处理海量数据利用大模型技术可以更好地处理这些数据提高数据分析和决策的准确性。因此掌握大模型应用开发技能可以让程序员更好地应对实际项目需求• 基于大模型和企业数据AI应用开发实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能 学会Fine-tuning垂直训练大模型数据准备、数据蒸馏、大模型部署一站式掌握• 能够完成时下热门大模型垂直领域模型训练能力提高程序员的编码能力 大模型应用开发需要掌握机器学习算法、深度学习框架等技术这些技术的掌握可以提高程序员的编码能力和分析能力让程序员更加熟练地编写高质量的代码。LLM面试题合集大模型产品经理资源合集大模型项目实战合集获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】
返回列表