大模型分类体系
1、简述大模型基础模型 Foundation Model分类采用多维度正交划分不同维度可交叉组合定位模型分为技术底层维度、数据模态维度、规模算力维度、训练范式维度、应用层级维度、部署形态维度、开源版权维度、任务能力维度八大体系覆盖学术、工程、产业落地全场景。2、按底层神经网络架构技术底层最核心学术分类全部基于 Transformer 衍生分 4 大类决定模型能力边界2.1 Encoder-only 仅编码器双向理解型原理双向注意力MLM 掩码预训练同时读取上下文左右信息优势文本理解、语义匹配、分类、抽取精度极高短板不擅长长文本生成适用检索、情感分析、NER、文本打分、知识库向量代表BERT、RoBERTa、ERNIE-Base、SimBERT2.2 Decoder-only 仅解码器自回归生成当前主流 LLM原理单向从左到右逐 Token 预测CLM 因果语言建模优势开放式长文本生成、对话、逻辑推理、代码写作适用聊天机器人、文案、代码、报告、思维链推理代表GPT 全系列、Llama3/4、Qwen2/3、GLM、Mistral、DeepSeek2.3 Encoder-Decoder 编解码序列转换专用原理编码器理解输入解码器独立生成输出优势翻译、摘要、改写、短序列转换短板超长自由生成弱于纯 Decoder代表T5、BART、ChatGLM 初代、mT52.4 MoE 混合专家稀疏架构超大参数量旗舰架构原理总参巨大但每次推理仅激活少量专家模块算力可控分类MoE-Decoder、MoE-Encoder-Decoder、MoE 多模态优势万亿级参数、强通用能力、训练成本低于稠密大模型代表GPT-4、Qwen3-Max、Gemini Ultra、Mixtral 8x7B2.5 补充非 Transformer 传统大模型边缘小众CNN 视觉大模型ViT 变体、RNN 系模型已淘汰3、按输入输出模态产业最常用分类3.1 单模态大模型仅一类数据LLM 纯文本大语言模型输入输出均为文字擅长逻辑、数学、文书、代码通用对话代表GPT-3.5、Llama3、通义千问基础版Code-LLM 代码专用大模型文本子集海量代码语料专项训练代码补全、漏洞检测、跨语言转换、工程注释代表CodeLlama、DeepSeek-Coder、StarCoder视觉大模型 LVM仅图像输入输出图像分类、分割、检测代表ViT、SAM、Stable Diffusion纯视觉生成音频大模型 LAM语音识别、语音合成、音乐生成代表Whisper、AudioLDM视频单模态模型短视频生成、动作识别代表Sora、可灵、Veo3.2 多模态大模型 MLLMAny-to-Any 跨模态融合统一语义空间同时处理文本 / 图像 / 音频 / 视频 / 3D / 文档多模态理解型图文问答、图表解析、视频摘要、OCR 文档分析代表GPT-4V、Qwen-VL、LLaVA多模态生成型文生图、文生视频、图文转音频、3D 生成代表GPT-4o、Gemini Omni、Sora、万相、Seedance全模态 Omni 模型实时语音对话 视觉 视频一体化端到端音视频交互4、按参数规模算力 / 部署分级工程落地核心以稠密模型标准划分MoE 标注激活参数而非总参数分级参数量区间部署场景典型代表超轻量端侧模型1B手机、IoT、嵌入式、离线本地Qwen2-0.5B、Phi-3-mini、Gemma-2B轻量模型1B~10B边缘服务器、个人 PC、低成本私有化ChatGLM3-6B、Mistral-7B、Baichuan2-7B中型模型10B~70B企业私有化、API 轻量化服务Llama3-13B/70B、Qwen2-14B、DeepSeek-67B大型稠密模型70B~400B云端旗舰、高推理需求场景Llama3-400B、Claude 3 Sonnet超大规模 MoE 模型总参≥1T激活 10B~200B公有云顶级通用模型GPT-4、Gemini Ultra、Qwen3-Max5、按训练迭代阶段模型成熟度分类完整训练流水线 4 级递进预训练底座模型Base Model仅通用海量数据预训练无指令、无人类对齐输出自由、无格式约束不适合直接对话多用于二次微调指令微调模型SFT Supervised Fine-tune加入指令数据集学会遵循用户指令、结构化输出可直接做基础对话、工具调用人类对齐模型RLHF/DPO人类反馈强化学习 / 直接偏好优化安全、价值观对齐、降低幻觉、输出符合人类习惯市面商用对话模型主流形态ChatGPT、Claude、文心一言工具增强基座Agent 大模型内置工具调用、函数调用、检索增强能力可联网、调用插件、操作数据库、控制机器人6、按应用层级L0/L1/L2 三层产业分层L0通用基础大模型通用底座无行业偏向覆盖全领域通用知识具备通用推理、创作、理解能力是所有垂直模型的底层底座闭源GPT-4o、Claude 3、Gemini、文心一言、通义千问开源Llama3、Qwen3、GLM4、DeepSeek-V3L1行业大模型单行业通用基于 L0 底座注入全行业通用数据覆盖行业全场景不局限单一细分任务金融大模型、医疗大模型、法律大模型、工业制造大模型、教育大模型、自动驾驶大模型L2垂直场景专用模型细分任务专用在行业模型基础上针对单一细分任务专项训练精度最高、泛化最弱法律合同审查模型、裁判文书生成模型医疗CT 影像诊断、药品研发分子模型 AlphaFold2工业质检视觉大模型、设备故障预测模型办公PPT 生成、OCR 文档解析、代码审计专用模型7、按部署运行形态运维选型分类云端 SaaS 模型厂商 API 调用无需本地算力开箱即用GPT、通义千问公有云私有化本地部署模型企业机房服务器部署数据不出内网开源 7B/13B/70B 系列端侧离线模型手机、平板、边缘硬件本地运行无网络依赖10B 轻量模型混合部署模型轻量端侧做基础交互云端大模型处理复杂推理8、按开源 / 版权授权生态分类闭源商用模型权重不开放仅开放 API无法本地微调OpenAI GPT、Anthropic Claude。完全开源模型权重、训练代码全开放商用无限制Qwen 全系列、DeepSeek。受限开源模型权重开放商用有营收 / 规模限制Llama3Meta 商用许可、Gemma。学术开源模型仅限科研禁止商用LLaVA、早期 BERT 变体。9、按任务能力范式功能分类1. 判别 / 理解型模型输入数据做分类、打分、抽取、检索不生成全新内容BERT、向量检索模型、风险判别模型2. 生成式模型AIGC 核心输出全新文本 / 图像 / 音视频 / 代码GPT、Sora、Stable Diffusion、CodeLlama3. 推理数学专用模型强化数理逻辑、符号计算、复杂数学证明DeepSeek-Math、Qwen-Math、Numina4. 检索增强 RAG 模型底座 外挂知识库解决实时信息、私有数据、幻觉问题企业知识库问答系统专用5. 机器人 / 具身智能大模型文本视觉 机器人动作控制物理世界交互Google Robotics Transformer、特斯拉 FSD 大模型6. 科学计算基础模型面向科研蛋白质结构、气象预测、流体仿真、量子计算AlphaFold2、风乌气象大模型10、极简分层总览底层架构 → 模态输入 → 参数规模 → 训练阶段 → 应用层级 → 部署方式 → 开源属性 → 任务功能。