多模态大模型实战14
第14章 AI Agent多模态交互——让AI看听做学习目标理解多模态Agent的感知-推理-行动框架掌握视觉Agent(屏幕操作、网页导航)用VLM + Function Calling实现多模态工具调用端到端实战:多模态研究助手14.1 多模态Agent架构感知-推理-行动框架感知层:图像/视频/音频 → VLM/Whisper → 结构化描述 推理层:描述 + 任务 → LLM → 决策/工具调用 行动层:决策 → 工具执行 → 环境反馈 → 新感知ReAct模式多模态Agent的推理模式:Observation: [VLM看到屏幕截图] → "屏幕上有一个登录按钮" Thought: 我需要点击登录按钮 Action: click(button="登录") Observation: [VLM看到新截图] → "出现了用户名和密码输入框" Thought: 我需要输入用户名 Action: type(input="用户名", text="admin") ...14.2 视觉Agent