agent学习——基础概念2
1、AI 工程化/可观测性平台AI Suite1AI Suite通常指代一套端到端的 AI 应用开发与运维工具集。它不是单一工具而是把你在前几轮对话中提到的所有能力打包在一起的产品形态。2一个标准的 AI Suite 通常包含Tracing / Observability就是你刚学会的轨迹追踪记录全链路 Span。Evaluation即组件评估 E2E 评估支持离线跑分、在线 Judge、人工标注。Prompt ManagementPrompt 的版本管理、A/B 测试、变量注入。Dataset / Test Hub从 Trace 清洗出测试集、管理黄金样本、版本化基准。Playground / Debug在浏览器里直接调试单个 LLM 调用或整条 Chain无需改代码。Analytics / Dashboard成本、延迟、成功率、Token 消耗等运营指标看板。3典型代表产品LangSmith、Arize Phoenix、Braintrust、Portkey、阿里云百炼评测套件等。有些厂商直接把自己的产品命名为 XXX AI Suite。4来个全流程闭环路线2、带代码执行的规划Code-as-Action1简单来说就是让大模型不再直接用自然语言“空想”步骤而是通过编写并运行代码来完成推理、计算和任务拆解。代码在这里既是“规划的结果”也是“执行的工具”。2它是如何工作的三步机制规划即编码LLM 将用户意图转化为一段可执行程序通常是 Python这段程序本身就包含了任务分解的逻辑。沙箱执行系统在安全隔离环境中运行该代码获取真实返回值而非 LLM 编造的值。反馈修正若代码报错或结果异常错误信息会回传给 LLM触发自动调试循环——这正是你之前那张图中③测试与评估 → ④调整与优化的微观体现。3不都是第一步先上来把用户问题先转化为程序语言的吗但“带代码执行的规划”中的第一步与普通 Function Calling 或工具调用有本质区别。这个区别不在于“是否转成程序语言”而在于代码本身是否承载了“规划逻辑”。4没有它② 的 Trace 是碎片化的③ 的评估是主观昂贵的④ 的优化是盲目低效的。有了它整个闭环才具备工程化、自动化、可量化的持续改进能力——这正是 ELM 方法论评估驱动方法论的灵魂所在。3、举个例子_编写大气环境领域的专业报告1流程2要点3针对大气领域的特殊设计1. RAG 的内容必须分层不要用同一个向量库装所有内容。建议分为三个独立知识库标准规范库GB/HJ 标准、技术导则、政策文件 → 用于合规审查和依据引用领域知识百科大气化学机制、污染物来源解析方法、模型原理 → 用于解释性文字生成历史报告范例库过往优秀报告的章节结构、表述范式 → 用于风格对齐和 Few-shot⚠️关键提醒标准规范库必须保留原文条款编号和生效日期。RAG 检索时必须返回精确引用如“HJ 2.2-2018 第5.3.2条”而非模糊摘要。这是合规底线。2. Code Agent 必须绑定领域工具链通用 Python 库不够用。你需要封装一套大气领域专用工具集供 Code Agent 调用get_monitoring_data(site_id, start_time, end_time, pollutants)→ 自动对接国控/省控站 APIcalc_aqi(pollutant_concentrations)→ 严格按 GB 3095-2012 计算非 LLM 估算run_dispersion_model(meteo, emission, receptor)→ 调用 AERMOD/CALPUFF 等认证模型的 Python 接口plot_wind_rose(data, output_path)→ 标准化风玫瑰图符合行业制图规范这些工具内部逻辑必须是确定性代码LLM 只负责组装调用参数和处理返回值。3. 建立“数据-文字”双向校验机制在节点④增加一个独立的Fact-Checker Agent提取报告中所有数值、图表引用、标准条款回溯到节点③的输出结果和节点②的原始数据检查数值是否一致图表编号是否正确引用的标准是否现行有效若发现不一致自动退回上一阶段修正而非直接输出错误报告4风险4、其他人做的agent分享学习1GitHub - FlyAIBox/Agent_In_Action: Agentic AI 智能体开发实战 · GitHub在github上找到的一些实战项目准备有时间挨个儿学习复现一下~翻译搜索复制src