
一、核心思想AI Agent 是一个能感知环境、做决策、执行动作的软件系统核心公式为Agent LLM Planning规划 Memory记忆 Tools工具它与普通聊天机器人的本质区别是Agent 不只是“说”而是在动态环境中持续观察、判断、执行直到任务完成。二、AI Agent 的演进阶段阶段特点关键发展2022年对话时代模型只能基于已有知识回答Prompt Engineering 为主只能“说”不能“做”2023年中工具时代模型可调用外部APIFunction Calling、RAG 出现AutoGPT 等早期探索2023年底编排时代重视推理框架和多Agent协作ReAct 范式普及Coze/Dify 等平台用 DAG 约束流程2024年底标准化时代协议和多模态变重要MCP 协议、Computer Use、AI编程工具快速发展2025年长任务时代Agent 成为可执行长流程的工作单元Agent Skills 机制出现封装固定流程和校验规则2026年常驻时代更接近长期在线的数字工作单元Skills Heartbeat定时唤醒Harness Engineering 受重视分水岭2023年中之前AI基本只能“说”之后开始逐渐能“做”。三、Agent、传统编程、Workflow 的区别类型控制方式适用场景传统编程程序员写代码 → 执行结果逻辑固定、高频执行、高性能要求如订单扣库存Workflow产品画流程图 → 执行结果流程清晰、步骤有限、需可视化管理如审批流Agent用户说意图 → AI决策 → 动态执行步骤不确定、需理解意图、动态判断如排查故障关键判断执行路径能提前确定就用 Workflow不能确定再用 Agent。四、Agent 核心组件详解1. Planning推理与规划用 LLM 分析任务状态、拆解目标、决定下一步。常用技术Chain-of-Thought (CoT)让模型逐步推理。2. Memory记忆类型作用实现方式短期记忆保持对话连续性上下文历史长期记忆积累过去经验外部知识库向量数据库、知识图谱3. Tools工具让 LLM 能操作外部世界查数据、调API、读文件、执行代码。关键闭环工具执行后返回结果 → Agent 放入上下文 → 进入下一轮推理Observation。4. Agent Loop核心运行机制每一轮循环做三件事LLM 推理决定下一步调用工具还是直接回复。执行工具调用并捕获返回结果。写回上下文将观察结果追加到上下文继续下一轮。安全兜底设置最大迭代轮次一般10-20轮或 Token 阈值防止死循环。五、Tools 注册与调用标准1. 数据格式Function Calling SchemaOpenAI Schema用JSON Schema描述工具的名称、用途、参数类型和必填字段。关键在description要把使用场景和禁用场景讲清楚直接影响模型是否调用及参数填充。示例慢SQL查询工具{type:function,function:{name:query_slow_sql,description:查指定微服务的慢SQL。服务响应慢时用。如果是网络问题别调这个。,parameters:{type:object,properties:{service_name:{type:string,description:服务名},time_range:{type:string,description:时间范围 HH:MM-HH:MM}},required:[service_name,time_range]}}}