第4章 开发者视角:三条AI路线怎么选
一句话点题不是每个人都要造轮子。先学会用别人的模型再学会改别人的模型最后才考虑自己训模型。别一上来就想从头训练大模型那是亿万富翁的游戏。写在前面前面三章我们聊了AI的历史、概念和边界都是认知层面的东西。从这章开始我们要往实践层面过渡了。但动手之前有一个最关键的问题没解决作为开发者你到底该走哪条路同样是做AI开发不同路线的门槛、成本、能力要求天差地别。选错路线要么白白烧钱要么事倍功半。这章帮你把三条路彻底讲清楚看完你就知道该走哪条。一、三条路分别是啥先上一张全景对比心里有个数路线A调用API路线B微调/部署开源模型路线C从头训练模型干什么调别人现成的模型API拿开源模型改一改自己部署从零开始训练一个模型比方去饭店点菜买半成品回来自己加工自己种菜养牛从头做门槛低中极高成本按量付费几厘到几毛一次一次性买显卡/租云GPU几十万到几千万需要什么能力会写代码调接口懂模型部署、Linux运维懂算法、有算力集群、有大量数据适合谁90%的开发者有特定需求的中高级团队大厂/AI公司/研究院典型代表调OpenAI/通义/文心API部署LLaMA/QwenLoRA微调从头预训练GPT/Qwen下面逐条展开。二、路线A调用API——“去饭店点菜”1. 这条路在干什么你不需要关心模型怎么训练的、跑在什么显卡上、用了什么架构。你只需要注册一个账号拿到API Key看文档按格式发HTTP请求拿到返回结果集成到你的系统里就这样。跟你调任何第三方接口比如微信支付、地图API没有任何本质区别。2. 主流API提供商提供商代表模型特点价格水平OpenAIGPT-4o / GPT-4o mini能力天花板生态最全贵但mini版便宜AnthropicClaude 3.5 Sonnet长文本、代码能力强中等偏贵GoogleGemini 1.5 Pro多模态、超长上下文中等阿里通义Qwen-Max / Qwen-Plus中文能力强国内首选便宜百度文心ERNIE 4.0 / Speed国内生态完善便宜深度求索DeepSeek-V3性价比极高能力接近GPT-4极便宜月之暗面Kimi超长上下文200万字便宜智谱GLM-4开源API双线企业友好便宜选型建议海外项目/对能力要求最高 → GPT-4o 或 Claude国内项目/对成本敏感 → DeepSeek-V3 或 Qwen需要超长文档处理 → Kimi200万字上下文需要极高性价比 → DeepSeek-V3几乎是目前最便宜的第一梯队模型3. 这条路的优点优点说明上手快会写代码就行半小时跑通第一个Demo零运维不用管服务器、显卡、部署、扩容随时用最新模型厂商升级了模型你自动享受效果有保障顶级模型的能力已经非常强成本可控按调用量付费不用的时候不花钱4. 这条路的缺点缺点说明应对策略数据隐私数据要发给厂商选私有化部署方案/国内合规厂商/签数据处理协议依赖第三方API挂了你的系统也挂多模型备用降级策略定制性差模型是黑盒你改不了内部用Prompt工程RAG弥补长期成本量大了一月几万到几十万缓存模型路由简单问题用便宜模型网络限制国内调海外API有合规和延迟问题用国内厂商API或Azure代理5. 什么时候选这条路绝大多数场景都应该先走这条路。理由很简单试错成本最低上线速度最快能快速验证AI到底能不能解决我的业务问题先跑通再优化。别一上来就想着自己部署模型等你把环境搭好、模型调通人家的API方案已经上线三个月了。6. 一个最小可运行示例用Python调通义千问API就这么几行importrequests urlhttps://dashscope.aliyuncs.com/compatible-mode/v1/chat/completionsheaders{Authorization:Bearer sk-your-api-key-here,Content-Type:application/json}data{model:qwen-plus,messages:[{role:user,content:用一句话解释什么是机器学习}]}responserequests.post(url,headersheaders,jsondata)resultresponse.json()print(result[choices][0][message][content])就这么简单。你不需要懂Transformer、不需要懂反向传播、不需要有GPU。会调API就能开始做AI应用。三、路线B微调部署开源模型——“买半成品回来加工”1. 这条路在干什么你从Hugging Face或ModelScope下载一个开源模型比如Qwen-7B然后直接部署模型够用不改直接部署到自己服务器上用微调Fine-tuning用你的业务数据再训练一下让模型在特定任务上表现更好量化压缩把模型缩小让普通显卡也能跑2. 为什么不直接用API要自己部署这个问题是核心。以下场景才值得考虑自己部署场景为什么API搞不定自己部署的价值数据合规金融/医疗/政务数据不能出内网数据留在自己的服务器上延迟敏感API网络延迟不稳定内网部署延迟100ms成本极限调用量极大API费用扛不住一次性投入边际成本趋近于零定制需求API模型不懂你的专业领域微调后效果更好离线场景没有网络的环境本地部署不依赖网络关键判断如果你的场景以上五条都不沾那就老老实实用API别折腾。3. 主流开源模型一览模型参数量特点适合场景Qwen2.50.5B~72B中文最强开源模型全尺寸覆盖国内项目首选LLaMA 38B/70BMeta出品英文生态最好海外项目/研究DeepSeek-V3671B(MoE)性价比之王推理能力极强通用任务/推理场景ChatGLM6B/9B清华系中文友好部署轻量中小团队/资源有限Mistral7B/8x7B欧洲团队效率高英文场景/边缘部署Yi6B/34B李开复团队综合能力强通用任务新手建议从Qwen2.5-7B开始。中文好、社区活跃、文档全、LoRA微调方案成熟是最稳妥的入门选择。4. 部署方案怎么选方案工具特点适合场景快速体验Ollama一行命令装好傻瓜式本地开发/测试生产部署vLLM高吞吐、支持并发、PagedAttention生产环境首选轻量部署llama.cppCPU也能跑极致量化没有GPU的机器容器化Docker vLLM标准化部署方便运维企业级部署云端托管ModelScope/SiliconFlow不想自己管服务器快速上线/中小项目生产环境推荐组合vLLM Docker GPU服务器。vLLM是目前开源大模型推理引擎的事实标准吞吐量远超原生Transformers。5. 微调方案怎么选微调不是重新训练而是在已有模型基础上小幅调整。方案原理显存需求效果适合场景LoRA冻结原模型只训练一个小的补丁低7B模型约8GB好最主流的微调方案QLoRALoRA 4bit量化极低7B模型约4GB略降显卡不够用时的选择全量微调所有参数都训练极高7B模型约60GB最好有A100/H100的土豪团队不微调只用PromptRAG不需要大部分场景够用优先尝试这个重要认知90%的情况下你不微调也能解决问题。先试Prompt工程再试RAG最后才考虑微调。这个顺序后面章节会反复强调。6. 硬件需求参考模型大小推理显存(量化后)微调显存(LoRA)推荐显卡1.5B~2GB~6GB任意显卡/Mac M芯片7B~5GB(INT4)~8GBRTX 3090/4090/A1014B~10GB(INT4)~16GBA10/A30/双309032B~20GB(INT4)~40GBA100 40G72B~40GB(INT4)~120GB多卡A100/H100Mac用户好消息M1/M2/M3/M4芯片的统一内存架构天然适合跑大模型。一台32GB的MacBook Pro就能流畅跑7B模型64GB的Mac Studio能跑32B。Ollama对Apple Silicon优化很好。四、路线C从头训练模型——“自己种菜养牛”1. 这条路在干什么不是微调是从零开始训练一个模型。包括预训练Pre-training用海量文本让模型学语言基础——这一步最贵指令微调SFT教模型按指令回答问题人类反馈强化学习RLHF让模型回答更符合人类偏好2. 你大概率不需要走这条路直接给数据阶段数据量算力成本估算预训练一个7B模型~1万亿Token几百张A100跑几周约50万-200万人民币预训练一个70B模型~10万亿Token上千张H100跑几个月约5000万-2亿人民币GPT-4级别训练不公开不公开估计1亿美元这不是普通公司能干的事。全球有能力从头预训练大模型的组织不超过50家。3. 什么人该走这条路角色是否该走原因应用开发者不该用API或开源模型就够了企业AI团队不该微调开源模型性价比远超从头训AI创业公司极少该除非你的核心壁垒就是模型本身大厂AI实验室可以有钱有卡有数据有人才学术研究者看情况研究算法本身可以做应用不需要4. 如果真要训练需要什么维度要求数据万亿Token级别的高质量文本算力至少几百张A100/H100团队分布式训练工程师 数据工程团队 算法研究员时间几周到几个月资金几百万到几亿人民币运维训练中途GPU挂了怎么办检查点恢复机制评估训练完怎么知道好不好需要完善的评测体系说实话99.9%的读者不需要走这条路。我把它列出来是为了让你知道这条路存在并且理解为什么不该走——知道边界在哪才能做出正确决策。五、三条路对比总结维度路线AAPI调用路线B微调部署路线C从头训练上手难度★☆☆☆☆★★★☆☆★★★★★初期成本几乎为零买/租GPU几千到几万几百万起步长期成本按量付费量大则贵一次性投入边际成本低天文数字上线速度几天到几周几周到几个月半年到几年定制能力低PromptRAG弥补中高可微调最高完全自主数据安全数据要出系统数据在自己服务器数据在自己服务器运维负担零中等要管服务器极高训练部署监控适合团队规模1-5人3-15人50人适合阶段验证期/MVP成长期/规模化基础研究/平台级六、我的推荐路线图对大多数开发者我推荐这个渐进式路线第一步先走路线A1-4周选一个API → 跑通Demo → 集成到业务 → 上线MVP目标用最低成本验证AI能不能解决你的业务问题。能解决继续往下走不能解决止损退出损失最小。第二步在路线A上做深度优化1-3个月优化Prompt → 加RAG知识库 → 加缓存降低成本 → 加多模型路由目标在API方案上把效果和成本优化到极致。很多人在这一步就解决了问题不需要往下走。第三步评估是否需要路线B1-2周评估问自己三个问题API方案的效果是否已经无法满足业务需求调用量是否大到API费用已经成为负担是否有数据合规要求必须私有化部署三个都是→ 进入路线B有任何一个否→ 留在路线A继续优化第四步走路线B1-3个月选开源模型 → 本地部署跑通 → 评估效果 → 需要微调则微调 → 上线目标在保证效果的前提下实现私有化部署或成本优化。第五步路线C别想了。除非你拿了几个亿融资否则这条路不是给你走的。七、不同角色的路线建议你的角色推荐路线学习重点后端开发者A → BAPI集成、RAG架构、Spring AI前端开发者AAPI调用、流式输出、AI交互设计数据工程师A → B数据Pipeline、向量化、RAG数据处理算法工程师B → C模型微调、训练优化、评估方法产品经理AAI能力边界、Prompt设计、产品架构创业者/技术负责人A → B技术选型、成本估算、团队搭建八、一个成本估算的真实案例假设你要做一个企业内部知识库问答系统有10万条内部文档日均5000次问答方案A纯API项目月成本API调用5000次/天 × 30天 × ~2000 Token/次 × 0.001元/千Token~300元向量数据库云托管~200元服务器API中转业务逻辑~500元合计~1000元/月方案B自部署开源模型项目一次性成本月成本GPU服务器A10 × 10租赁~2000元向量数据库自建0~300元微调数据标注~5000元0运维人力0~5000元分摊合计~5000元~7300元/月分析日均5000次问答的量API方案每月只要1000元远低于自部署自部署的月成本是API的7倍还有一次性投入和运维负担只有当日均调用量达到5万次以上或者有数据合规硬性要求时自部署才在经济上划算这就是为什么我反复说先走API路线量大再考虑自部署。第1阶段总结这四章构成了认知启蒙阶段的完整闭环章节核心认知第1章 AI发展简史AI不是新东西70年沉淀条件成熟才爆发第2章 AI/ML/DL的关系三者是包含关系大模型是DL的一个应用第3章 AI能力边界知道AI不能干什么比能干什么更重要第4章 三条路线选择先API → 再自部署 → 最后才考虑从头训练如果你认真读完了这四章你已经比80%的AI焦虑者清醒了。你知道了AI是什么、能干什么不能干什么、作为开发者该从哪里入手。接下来第2阶段我们进入机器学习基础开始真正理解AI背后的原理。别担心还是大白话不会有让你头疼的数学公式——该讲的地方讲不该深挖的地方绝不装学术。下一章预告第5章第2阶段第1章「监督学习给标准答案让机器学」—— 从一个判断垃圾邮件的小例子开始带你理解什么是特征、什么是模型、什么是训练。10行代码跑通你的第一个机器学习程序。