尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

一图看懂全球AI架构图:DS、Kimi、Qwen的技术原理

一图看懂全球AI架构图:DS、Kimi、Qwen的技术原理 想知道Qwen3和DeepSeek V3在注意力机制上有什么不同吗打开全球LLM架构图库找到两张图直接对比。你就会知道Qwen3用GQA分组查询注意力DeepSeek V3用MLA多头潜在注意力前者没有共享专家后者有。从ChatGPT诞生一晃四年多全世界冒出了成千上万的AI工具多种技术流派它们到底有多大区别呢开源好闭源好收敛还是分裂一图胜千言。从这张全球主流AI模型架构图数据库可以直观看到虽然LLM架构有很多改进但其实没有根本性的创新。今天最好的开放权重模型如果你缩远了看仍然很像GPT-2就是一堆注意力层和前馈层堆起来……这是一个重要的、不人云亦云的洞察否则容易被OpenAI、Anthropic、马斯克等硅谷大忽悠的信口开河、妖言惑众欺骗和带偏。LLM能力的惊人提升更多来自各AI公司训练方法的革新比如RLVR可验证奖励的强化学习而不是架构本身的突破。马斯克转发了一张梗图讽刺现在AI圈的范式变化。以前做AI研究人员精心设计数学模型、证明理论性质现在做Al主要把Transformer、数据量和算力不断放大结果模型莫名其妙就变强了。虽然很损但很真实。全球每天推陈出新又迅速过时的AI工具开发者都很难深入研究更不要说普通用户如何分辨区别了。许多论文充斥专业术语表述艰涩含糊各家架构图绘制风格各异想要搞清楚及横向对比十分困难。为了解决这些普遍痛点问题有心人做了一个“大语言模型架构画廊”LLM Architecture Gallery项目让你像逛画廊一样浏览不同AI模型的架构图。今年3月机器学习领域知名研究者Sebastian Raschka上线LLM架构图库把从2024年初到2026年春天发布的全球40多个大模型的架构图谱全部收录在一个页面里包括各种Transformer变体、Encoder-Decoder架构、注意力机制详解、多模态架构设计等。这类信息散落在各家几十页技术报告的不同角落现在被压缩成一张对比图。图谱链接sebastianraschka.com/llm-architecture-gallery/Sebastian Raschka写过两本深受欢迎的专业书籍《Python Machine Learning》和《Build a Large Language Model (From Scratch)》。他把两篇长文《The Big LLM Architecture Comparison》和《A Dream of Spring for Open-Weight LLMs》中绘制的所有架构图抽取出来用统一的视觉语言重新呈现集中放在一个页面上。点击任意一张图可以放大每张图下方附带一份规格表列出该模型的参数量、发布时间、注意力机制类型等关键信息。想深入某个模型点开“view in article”页面直接跳转到原文对应章节。比如 QK-Norm应用于查询和键向量的归一化技术是什么、为什么能稳定训练点进去就能读到解释。该导览提供了可快速查阅的AI架构索引便于在同一坐标系下横向对比不同模型的设计思路理解技术演化路径为后续研究与模型设计提供参考善莫大焉。项目上线几小时后知名AI人士Andrej Karpathy称赞“太好了我的自动研究功能很需要这个内容的Markdown版本——一个创意池。”Raschka很快回复并提供了YAML格式的元数据GitHub链接。Karpathy随后表示他用Obsidian把博客文章导出成markdown并“输入到了autoresearch循环中”。一个出发点是方便人类阅读的AI架构图集就这样被接入了AI自动化研究的工作流。一位用户说这让人想起了当年的Neural Network Zoo也是用可视化的方式展示不同架构。这份图集收录了几十个模型架构从Llama 38B到Qwen3.5、Sarvam 105B、Ling 2.5 1T到最新的Kimi K3、DeepSeek-V4-Flash等。所有架构图都按同一套视觉规范绘制配色、图例、字体统一LLM Architecture Gallery图谱像一张大模型名录汇集了近年来出现的中美主流模型参数规模从几亿参数的小模型一直延伸到千亿乃至万亿级模型。这份图集的价值不仅在于人类可读还在于它的结构化程度足以被机器解析。Raschka在GitHub上提供了YAML格式的元数据包含每个模型的参数量、发布日期、技术报告链接、注意力类型等字段。如果你想写脚本批量分析这些模型的共性和差异这份元数据是起点。每一张模型卡就像对各AI公司的X光透视体检表或管理学意义上的平衡计分卡让人及机器在同一套视觉框架下快速理解模型的结构组成。像欣赏美术馆的名画一样人类用肉眼体会AI模型是怎么一回事即使不具体了解其技术原理但会有简洁粗略的印象。从中看出MoEMixture-of-Experts混合专家模型是2025年开源LLM的主旋律。所有超过百亿参数的主流前沿开放权重模型都采用了这种架构。传统的“稠密”Transformer会在每次生成token时激活全部参数参数越多算力成本越高。而MoE把参数分成若干“专家”每次只激活其中一部分。DeepSeek V3名义上有6,710亿参数但实际运行时只激活370亿Llama 4 Maverick号称4,000 亿参数激活的只有170亿。Raschka在图集中把各个模型的专家数量、激活比例、专家隐藏层尺寸都标注出来稀疏程度一目了然。Hacker News有人感慨“我很惊讶这些模型在结构上有多相似主要差异就是层的大小。”架构层面的优化更多为了让训练和推理更高效、成本更低而不是让模型根本上更聪明。这些模型几乎都在做同一件事努力让注意力机制便宜一点、快一点、跑得更长同时保住性能。收敛设计语言MoE、QK-Norm、滑窗注意力成了标配分裂具体方案Mamba混搭、线性注意力替换、MLA压缩KV等每家都在赌不同的技术路线。Llama 3还在坚持GQA加RoPE的经典搭配。DeepSeek V3一出来MLA加稠密前缀共享专家这套组合拳就成了大力出奇迹的新标杆。有观点认为这不是趋同是抄作业。换个角度这恰恰说明大家都卡在同一个瓶颈长上下文推理的计算成本。标准注意力的复杂度是O(n²)扩到百万token级别根本撑不住。2026年架构图谱出现了明显的混搭趋势。Qwen3.5用了3:1的DeltaNet和普通注意力交替层。Kimi Linear把大部分注意力层换成线性版本只保留四分之一的MLA。英伟达的Nemotron 3 Nano更激进用Mamba-2跑大部分层注意力只在关键节点出现。这些方案的共同点承认注意力机制不可能全程在线得找替代品分担压力。分歧在于到底哪种替代品靠谱。线性注意力省显存但长依赖能力存疑状态空间模型SSM速度快但训练难调滑窗注意力简单粗暴但信息会丢。另一个值得注意的细节QK-Norm的普及速度。从Qwen3开始几乎所有新模型都加了归一化层不管稠密模型还是MoE。OLMo 2甚至把整个规范化方案从pre-norm改成post-norm配合QK-Norm稳住训练。大模型训练已经卷到“微操”阶段了。架构上的大创新几年没见过现在拼各种小技巧的叠加效应。归一化放哪一层、RoPE用多少维度、专家路由的稀疏度怎么调成了决定成败的关键。Step 3.5 Flash例外。它用多token预测MTP-3在训练和推理阶段都保持高吞吐量196B总参数、11B激活参数推理速度能和600多B的DeepSeek V3掰手腕。有人说它取巧更像务实架构创新空间有限那就在工程实现上找机会。LLM Architecture Gallery图谱收录了从3B到1T参数的模型每个都标注了关键设计选择、发布日期、配置文件链接让业内人士意识到LLM的架构演进正在从“范式革命”滑向“增量优化”。下一个突破是什么也许不在注意力机制本身而怎么把注意力、SSM、线性模型等拼得更聪明。或者跳出这个框架找到全新的序列建模方式。随着Qwen3 Next、Kimi K2、MiniMax M2等模型的发布SebastianRaschka更新了其架构对比图绘制内容清晰易懂。模型时间线全量注意力结构DeepSeekV3.1-GLM4.6-MiniMax M2最新混合注意力结构: Qwen3-Next-DeepSeekV3.2-KimiLinear(最新)思考模型Kimi K2 Thinking(最新)Kimi K2 Thinking(对比 R1)要点Kimi K2 Thinking的上下文序列长度从128k增长到256k模型大小1T单Token由1共享专家8个独立专家处理激活参数32B字典长度160K测评数据未与DSR1对比Qwen3 Next(对比Qwen3)要点采用线性模块GDN与Gated Attention混合比例3:1上下文序列长度支持262k80B-A3B模型大小80B激活参数3B单Token由1共享专家10个独立专家处理在QK上采用zero-centered RMSNorm替换标准的RMSNormMiniMax-M2(对比Qwen3)要点QK的正则采用了分头处理230B激活参数10B 单Token由8个独立专家处理无共享专家精度对比数据Kimi Linear(对比Qwen3 Next)要点使用了改进的KDAKimi Delta AttentionKDA基于GDN改进了alpha项KDA与MLA模块采用3:1混合。Kimi K2.5基于Kimi K2 MoE大模型文本底座原生多模态模型融合MoonViT-3D原生分辨率视觉编码器“视觉编码器 - MLP 投影层 - 文本 MoE 模型”的统一多模态架构同时设计了分阶段的训练流水线和高效的训练基础设施。kimi k2是deepseek v3的放大版文本基座模型Kimi K2 MoE模型激活参数320亿384个专家每个token激活8个专家稀疏度48预训练采用了15万亿高质量文本token。支持256k超长上下文为长文本 / 长视频理解奠定基础。Raschka绘制的Kimi K3架构图1、没错它看起来相当复杂但本质上是他们去年发布的Kimi Linear模型的放大版、生产级实现。模型规模从480亿参数扩大到2.8万亿参数K3目前遥遥领先是规模最大的开放权重模型。与Kimi Linear相比唯一新增的组件是LatentMoE。它本质上与Nemotron 3 Ultra中的LatentMoE相同其核心思路类似于多头潜在注意力即通过降维投影来压缩大型线性层。3、与Nemotron 3、DeepSeek V4等模型类似Kimi K3的整体方向也是提升推理效率。也就是说它使用了许多经过效率优化的组件来替代传统组件。例如MoE → LatentMoE常规注意力 → 多头潜在注意力和Kimi Delta Attention4、唯一一项并非以效率优化为目的的组件改动是注意力残差连接。DeepSeek V4使用mHC即流形约束超连接改进了残差路径K3注意力残差同样旨在改进残差路径但实现方式有所不同。mHC的做法是拓宽残差路径而注意力残差——也已经应用于Kimi Linear则会跨层连接残差信息。连接本身使用注意力分数作为衡量重要性或贡献程度的权重。根据技术报告这一机制能够持续改善验证损失和下游任务表现尽管提升幅度不大。代价是训练成本增加约4%推理成本增加约2%。5、值得注意的是Kimi K3完全取消了RoPE层所有位置都改用NoPE即不使用位置嵌入。这一点同样继承自Kimi Linear。在其他架构中近期的趋势通常是在局部注意力层中使用RoPE例如滑动窗口注意力而在全局注意力层中使用NoPE。此前也有少数架构全程只使用NoPE但Kimi K3是首个采用这种设计的前沿级模型。6、Kimi K3还原生支持多模态这一点非常不错。总体来说这是一次非常出色的发布。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表