第3章 AI的能力边界:能干什么、不能干什么
一句话点题AI不是万能的。知道它不行的地方比知道它行的地方更重要——因为踩坑都是从以为AI能干开始的。写在前面我见过太多这样的场景老板看了个ChatGPT的演示视频第二天开会说“咱们也搞个AI把客服全替了。” 结果上线后发现AI经常胡说八道客户投诉不降反升最后灰溜溜换回人工。也有反过来的一个团队明明可以用AI把效率提升3倍但他们觉得AI不靠谱死守着老方法白白浪费机会。这两种错误的根源都是同一个不清楚AI到底能干什么、不能干什么。这章就是帮你划这条线。看完之后面对任何要不要用AI的问题你心里都有一把尺子。一、AI擅长什么先说好消息。目前AI在以下几类任务上已经做得非常好甚至超过人类水平1. 模式识别——“看一眼就知道是什么”模式识别就是从海量数据中发现规律、识别特征的能力。这是AI最早突破、也最成熟的领域。能力具体表现超过人类了吗大白话图像识别人脸识别、物体检测、医学影像部分场景已超过看一眼就知道是谁、是什么语音识别语音转文字、声纹识别准确率已达人类水平听一句就知道说了什么文本分类垃圾邮件检测、情感分析超过扫一眼就知道是好评还是差评异常检测信用卡欺诈检测、设备故障预警超过一眼看出这个不对劲为什么AI在模式识别上强因为机器能不知疲倦地看几亿条数据人看1000条就累了。规律藏在数据里谁看得多谁就学得准。典型应用场景银行风控、医疗影像筛查、工厂质检、安防监控、内容审核2. 内容生成——“写文章、画图、写代码”这是大模型时代AI最出圈的 capability。能力具体表现当前水平大白话文本生成写邮件、写报告、写文案、写代码中上水平需人工审校能写出80分的初稿你得自己改成90分图像生成AI绘画、Logo设计、海报生成创意够好细节还差能画个大概手指头还是画不对代码生成Copilot、Cursor等编程助手日常代码很能打复杂逻辑还需人审像个靠谱的初级程序员语音生成语音合成、有声书非常自然难辨真假听不出是机器读的视频生成Sora等文生视频快速进步中还不稳定能生成几秒的片段长视频还得等关键认知AI生成的内容是从0到80分的利器但从80分到100分仍然需要人。别指望AI一步到位给你完美成品它的价值在于帮你快速拿到初稿。3. 信息处理——“读得多、读得快”能力具体表现大白话文档理解读一份100页合同提取关键条款你看一天它看3秒翻译多语言互译支持100语种比大多数翻译软件都好摘要总结把长文章/长视频压缩成要点读完帮你画重点知识问答基于给定文档回答问题你的私人速读助手数据分析从表格数据中发现趋势、生成报告帮你从数据里挖金子这类任务的共同特点是输入信息量大输出是提炼后的结论。AI的阅读速度和并行处理能力远超人类特别适合干这种活。4. 对话交互——“能聊天的界面”能力具体表现大白话自然语言理解理解用户的口语化、模糊表达不需要你学命令行说人话就行多轮对话在上下文中保持记忆和连贯性能记住你前面说过什么意图识别理解用户想干什么而不是说了什么你说我饿了它知道你想点外卖个性化交互根据用户画像调整回复风格对小孩和对大人说话方式不一样这个能力改变了人机交互的方式以前是你学机器的语言学Excel公式、学SQL现在是机器学你的语言直接说帮我算一下这个月的销售排名。二、AI不擅长什么坏消息来了。以下几类任务AI目前做不好甚至完全做不了别往坑里跳1. 精确计算——算不准的数学题你可能觉得奇怪计算机不就是算数的吗为什么AI算不准因为大语言模型的本质是语言模型它干的是接龙——根据前面的内容猜下一个词。它不是在计算而是在模仿看起来像计算的文字。场景AI的表现问题简单加减法大多数能算对小数字还行大数乘法经常算错12345×67890它可能给你一个自信但错误的答案多步数学推理不稳定前面对了最后一步错了自己还检查不出来精确的财务计算不可靠涉及钱的场景绝对不能直接用解决方案让AI写一段Python代码来算而不是让它直接给答案。这就是为什么很多AI系统会配一个代码执行器——AI负责理解你要算什么写成代码让真正的计算引擎去算。大白话AI是个文科生别让它做理科生的活。让它出题可以让它算题不行。2. 实时性要求高的任务——反应不够快也不够稳大模型的推理延迟通常在几百毫秒到几秒之间而且存在不确定性——同一个问题可能这次1秒回答、下次5秒回答。场景要求AI能做到吗高频交易微秒级响应完全不行工业控制毫秒级、确定性响应不行自动驾驶紧急决策毫秒级、100%可靠不能依赖大模型做主控实时语音翻译延迟200ms勉强但体验不够好游戏NPC实时交互100ms小模型可以大模型太慢核心矛盾大模型越强大推理越慢而很多实时场景要的不是最聪明的回答而是够快的回答。实践建议实时场景用小模型缓存规则不要硬上大模型。大模型适合做离线分析、非实时辅助不适合放在关键路径上做实时决策。3. 需要绝对准确性的任务——“一本正经地胡说八道”这是AI最危险的缺陷学名叫幻觉Hallucination。场景AI的问题后果法律引用编造不存在的法条和判例律师被法庭处罚真实案例医学诊断给出看似专业但错误的建议可能危及生命历史事实张冠李戴、时间错乱误导用户文献引用编造不存在的论文学术事故API调用编造不存在的函数名和参数代码跑不起来幻觉的根本原因大模型是概率预测机器不是事实查询机器。它预测的是什么词最可能出现在这里而不是什么是事实。当它不知道答案时它不会说我不知道而是会生成一个看起来很合理的错误答案。应对策略后面章节会详细讲策略做法效果RAG检索增强先查知识库再回答大幅减少幻觉但不能完全消除提示词约束“如果不确定就说不知道”有一定效果但不稳定输出校验用规则或另一个模型检查输出增加一层保险人工审核关键场景必须人审最可靠但最慢大白话大模型就像一个特别能说但不太靠谱的实习生——写的初稿很有启发但每一个数字、引用、事实你都得自己核实。4. 需要真正理解的任务——它只是看起来懂了场景AI的表现实际情况阅读理解能回答文章里的问题靠模式匹配不是真的读懂了常识推理大多数能答对但会犯人类不会犯的低级错误因果推理经常混淆相关性和因果性公鸡打鸣所以太阳升起式的错误空间推理文字描述还行复杂空间关系就乱把桌子上的杯子放到左边的柜子里这种指令经常搞混时间推理多步骤时间排序容易出错A在B之前B在C之前那A和C谁先有时候会答错核心问题大模型学到的是语言中的统计规律而不是世界运行的真正规律。它知道苹果和掉下来经常一起出现但它并不真正理解万有引力。5. 需要创造力从0到1的任务——它擅长排列组合不擅长真正的原创能力AI的表现大白话模仿风格写作很好能模仿鲁迅、能模仿你的写作风格组合已有想法很好把A方案和B方案的优点结合起来真正的原创突破不行它做不到前人从未想过的点子情感共鸣的深度表达表面可以深度不够能写看起来感人的文字但打动人心的还是人写的AI的创造力本质是对已有知识的重新组合它的训练数据决定了它的想象力边界。真正的从0到1的创新——比如提出相对论、发明新艺术流派——AI目前做不到。6. 需要物理世界经验的任务——它没碰过真实世界场景问题机器人精细操作叠衣服、拧螺丝这种对人简单的动作对AI极难烹饪火候、口味的判断需要多感官融合AI做不到医疗手感号脉、触诊这种需要手感的判断复杂环境导航在嘈杂、动态的真实环境中行动大模型读过所有菜谱但它没尝过味道也没拿过锅铲。文字里的世界和真实物理世界之间有一道巨大的鸿沟。三、一张表看清AI的能力边界能力维度AI擅长AI不擅长信息处理大量数据的快速读取、分类、摘要精确计算、多步逻辑推理内容生成文本/图像/代码的初稿生成100%准确的成品、真正的原创模式识别图像/语音/文本的特征识别需要因果推理的判断交互方式自然语言对话、意图理解实时性要求高的交互知识范围广博的通用知识训练数据内时效性信息、私有数据需RAG可靠性80分水平的快速产出100%确定性、零错误物理世界文字/图像/语音等数字领域需要物理交互和感官经验的任务四、判断该不该用AI的五个问题当你面对一个具体需求犹豫要不要用AI时问自己这五个问题问题1这个任务需要100%准确吗是→ 慎用AI做最终决策。AI可以做辅助但结果必须有人审核或规则兜底否80分就够→ 适合用AI比如初稿生成、辅助分析问题2数据是结构化的还是非结构化的结构化表格、数字→ 先考虑传统ML不一定需要大模型非结构化文本、图片、语音→ 大模型的主场问题3延迟要求高吗毫秒级→ 别用大模型用小模型或规则秒级可接受→ 可以用大模型离线分析→ 放心用大模型问题4任务有明确规则还是需要灵活性规则明确且固定→ 写规则引擎就行别用AI规则复杂且经常变→ 考虑AI规则引擎维护不过来时AI更有优势需要理解自然语言→ 大模型几乎是不二之选问题5出错的代价有多大低风险推荐内容、辅助写作→ 放心用错了影响不大中风险客服回复、数据分析→ 用AI人工审核高风险医疗诊断、法律建议、金融决策→ AI只能做辅助提示最终决策必须由人做五、几个常见的认知误区误区1“ChatGPT能回答所有问题所以它什么都会”事实它什么都能聊但不代表什么都说对了。能回答 ≠ 回答正确。尤其是专业领域的深度问题它可能自信地给你一个错误答案。误区2“AI会取代我的工作”事实AI取代的不是人而是人做的重复性任务。会用AI的人取代不会用AI的人。你的价值不在于会不会写文案/写代码而在于你知道该写什么、怎么判断好坏。误区3“AI效果不好所以AI没用”事实很多时候不是AI不行是用法不对。直接让大模型回答专业问题不靠谱用RAG大模型靠谱很多。工具的效果取决于用法。误区4“用了最先进的模型就够了”事实模型只是系统中的一环。数据处理、Prompt设计、检索策略、后处理校验每个环节都影响最终效果。GPT-4垃圾RAG不如GPT-3.5好的RAG。误区5“AI是黑盒所以不能用在对安全性要求高的场景”事实可以用但要用对方式。关键场景用AI做辅助提示而非最终决策加上规则兜底和人工审核。航空、医疗、金融领域都在安全地使用AI关键是设计好AI建议、人决策的流程。六、一个实用的决策框架把上面所有内容浓缩成一个决策树你的任务是什么类型 │ ├─ 需要精确计算/100%准确 │ └─ 不用AI做主输出让AI写代码→计算引擎执行 │ ├─ 需要实时响应100ms │ └─ 用小模型缓存规则不用大模型 │ ├─ 结构化数据表格/数字 │ └─ 优先传统ML随机森林/XGBoost │ ├─ 非结构化数据文本/图片/语音 │ ├─ 需要理解生成 → 大模型 │ ├─ 只需分类/识别 → CNN/BERT等专用模型 │ └─ 需要私有知识 → 大模型RAG │ ├─ 出错代价高医疗/法律/金融 │ └─ AI辅助人工决策绝不AI自动决策 │ └─ 重复性高的简单任务 └─ 先考虑规则自动化不行再上AI记住一个原则能用简单方案解决的别上AI。AI是最后的选择而不是第一选择。本章小结要点内容AI擅长什么模式识别、内容生成、信息处理、对话交互AI不擅长什么精确计算、实时响应、绝对准确、真正理解、原创突破、物理交互幻觉问题大模型会一本正经地胡说八道关键场景必须加校验选不选AI的判断标准准确性要求、数据类型、延迟要求、灵活性需求、出错代价核心原则AI是从0到80分的工具最后20分靠人能用简单方案别上AI下一章预告第4章「开发者视角三条AI路线怎么选」—— API调用、模型训练、模型部署这三条路分别适合什么人、什么场景、什么预算作为开发者你该走哪条这是第1阶段的最后一章讲完它我们就可以正式进入动手阶段了。