尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI Agent 对比系列(四):感知系统 — AI Agent 怎么看世界?

AI Agent 对比系列(四):感知系统 — AI Agent 怎么看世界? AI Agent 对比系列四感知系统 — AI Agent 怎么看世界《AI Agent 对比系列》第四篇 · 整合对比版本系列通过对比两个真实开源 AI Agent——OpenClaw和Hermes Agent——带你深入理解 AI Agent 的感知系统它怎么看到图片、听懂语音、读取环境。上一篇工具系统篇——AI Agent 的「手脚」是怎么组织和运行的。本篇感知系统篇——AI Agent 的「眼睛」和「耳朵」。先来做个实验对你的 Hermes 说你现在知道关于我的什么信息 查看你当前的记忆。对 OpenClaw 试这三件事如果配了对应的聊天平台实验 1发一张图片 → 这张图里有什么 实验 2发一段语音 → 明天的会议几点 实验 3如果有手机节点→ 把摄像头对着路由器背面IP 是多少第一个实验让你看到 Agent 怎么感知你的身份——它读的是文件不是真记住你。第二三个实验让你看到感知系统的转化链——图片和语音被转成文本后Agent 才能理解。核心认知AI Agent 没有真正的感官这是整篇文章最重要的句子AI Agent 没有眼睛、没有耳朵、没有触觉。它的一切感知都来自一个机制——把外部世界的信息转成文本塞进上下文。人类感知眼睛 → 视网膜 → 视觉皮层 → 我看到一只猫 耳朵 → 耳蜗 → 听觉皮层 → 我听到门铃声AI Agent 感知你发图片 → vision 模型 → 返回文字描述 → 注入上下文 → Agent看到了猫 你发语音 → STT 转写 → 返回文字 → 注入上下文 → Agent听到了你说话 节点拍照 → 图片 → vision 模型 → 返回文字 → 注入上下文 → Agent看到了路由器感知 原始输入的收集能力 × 把非文本转成文本的能力。Openclaw和Hermes两套系统都遵循这个原理但感知触角的多寡和广度差别很大。感知架构对比Hermes三大通道┌──────────────────────────────────────────────────┐ │ Agent 的感官分布 │ │ │ │ ️ 视觉通道 听觉通道 │ │ vision_analyze text_to_speech仅输出 │ │ browser_vision │ │ image_generate │ │ │ │ 文本与环境通道 │ │ 用户消息20 平台 │ │ Context FilesAGENTS.md/SOUL.md │ │ MEMORY.md / USER.md 快照 │ │ Session SearchFTS5 历史 │ │ web_extract / read_file │ │ │ │ 所有感知 → 文本化 → 注入 10 层 Prompt → Agent 推理 │ └──────────────────────────────────────────────────┘OpenClaw五根触角┌──────────────────────────────────────────────────────────────────┐ │ Agent Runtime (模型) │ │ 收到的所有信息都已经转成了文本模型只管做事 │ └───────────────────┬──────────────────────────────────────────────┘ │ ┌───────────────┼───────────────┐ ▼ ▼ ▼ ┌──────────┐ ┌──────────┐ ┌──────────────────┐ │ 消息通道 │ │ 媒体理解 │ │ 节点感知系统 │ │ (20 通道) │ │ (Image/ │ │ (camera/screen/ │ │ │ │ Audio/ │ │ location) │ │ │ │ Video) │ │ │ ├──────────┤ ├──────────┤ ├──────────────────┤ │ Telegram │ │ vision │ │ iOS 摄像头 │ │ WhatsApp │ │ model │ │ Android 屏幕 │ │ Discord │ │ STT │ │ macOS 屏幕录制 │ │ iMessage │ │ CLI │ │ GPS 定位 │ │ Signal │ │ fallback │ │ Canvas 画布 │ │ WeChat │ │ │ │ │ │ ……20 种 │ │ │ │ │ └──────────┘ └──────────┘ └──────────────────┘ │ ▼ ┌──────────────┐ │ 浏览器/网络 │ │ (browser/ │ │ web_fetch/ │ │ web_search) │ └──────────────┘核心差异Hermes 的感知是工具驱动的——Agent 通过主动调工具来感知OpenClaw 是渠道驱动的——消息和媒体流经 Gateway 时自动被预处理和转文本化Agent 收到时已经是消化过的信息。逐通道对比通道一消息输入两套系统都支持 20 聊天平台但处理路径不同。HermesOpenClaw通道数量20Gateway 平台适配器20Gateway WebSocket 接入统一格式MessageEventbase adapter 规范化Message 对象Gateway 统一带附件的消息附件路径文本Agent 决定怎么处理先过媒体理解系统预处理再进 Agent语音消息不自动转文本取决于平台自动 STT 转写注入 Transcript位置消息不处理节点 GPS 少数通道支持关键差异OpenClaw 在 Agent 看到消息之前Gateway 层已经对附件做了预处理——图片走了 vision、语音走了 STT。Agent 收到的消息里[Image]和[Audio]占位符已经被替换成了文本描述。Hermes 则是把附件路径直接给 Agent由 Agent 在推理循环中决定要不要调工具去处理。通道二视觉感知HermesOpenClaw核心工具vision_analyzeimage工具 媒体理解预处理触发方式Agent 在推理中决定调 vision_analyze收到图片时自动预处理Agent 不需要显式调用回退链无一个模型不行就报错有首选模型 → 备用模型 → CLI 回退描述长度模型原生输出可配置maxChars默认 500 字尺寸控制无交给视觉模型处理有maxBytes: 10MB检查图片生成image_generate9 种模型image_generate视觉核心理念不同HermesAgent 主动看——遇到图片 → Agent 决定调 vision_analyze → 看到描述OpenClaw系统自动看——收到图片 → 媒体理解系统自动预处理 → Agent 上下文里已经有描述通道三听觉感知这里差距最大HermesOpenClaw语音输入ASR❌ 不支持✅ STTGroq/OpenAI/Deepgram/whisper-cli 等多层回退语音输出TTS✅ text_to_speechOpenAI / Tool Gateway✅ tts处理方式仅输出无输入语音消息自动转写可替换 Body 或额外提供 TranscriptOpenClaw 的 STT 有完整回退链1. 当前模型 Provider 支持音频→ 直接发 2. 已配 API Key 的 ProviderGroq → OpenAI → Deepgram → Google 3. 本地 CLIwhisper-cli、sherpa-onnx、whisper PythonHermes 目前没有语音输入工具。通道四节点感知 — OpenClaw 独有这是 OpenClaw 和 Hermes 差距最大的地方。OpenClaw 有节点系统能把手机、平板、电脑变成 Agent 的传感器感知能力说明平台Camera拍照发送给 AgentiOS, Android, macOSScreen录屏或截屏iOS, Android, macOSLocationGPS 定位iOS, AndroidCanvas在设备上展示 HTML 内容iOS, Android, macOSNotifications设备通知推送iOS, macOSSystem设备状态查询全部你在手机上帮我看一下这个路由器背面IP 是多少 ↓ Agent 通过节点调用 camera.takePhoto ↓ 手机摄像头打开 → 拍照 → 图片传回 Gateway ↓ 图片进入媒体理解系统 → 模型识别图中的 IP ↓ Agent 回答IP 是 192.168.1.1Hermes 目前没有类似的设备节点系统。通道五环境与项目感知HermesOpenClaw项目上下文Context Files.hermes.md/AGENTS.md/CLAUDE.md/.cursorrules优先级渐进发现类似机制身份定义SOUL.md独立于项目上下文Personality / 角色定义持久记忆MEMORY.md USER.mdsession 快照持久存储 会话上下文历史检索FTS5 Session Search类似的历史搜索文件感知read_file / write_file / search_filesread / edit / apply_patch网页感知web_search / web_extractweb_search / web_fetch / browser感知管道对比两个 Agent 最终都遵循同一个管道模式但预处理层的位置不同Hermes裸管道外部信息 → Prompt Builder 组装 → Agent Loop → Agent 按需调工具 → 结果回填上下文OpenClaw预处理管道外部信息 → Gateway 预处理媒体理解/STT→ 转为文本 → Prompt → Agent Loop → 结果回填这就是为什么 OpenClaw 强调五根触角一个网关——接入层的感知处理已经帮 Agent 消化了一层Agent 收到时已经是半加工的信息。Hermes 更接近推原始数据给 Agent让它自己决定怎么处理。能做 / 不能做能力HermesOpenClaw接收文字消息✅ 20 平台✅ 20 平台看图理解✅ vision_analyze✅ image 自动预处理语音输入 → 文字❌ 无 ASR✅ STT 多回退链文字 → 语音输出✅ text_to_speech✅ tts手机摄像头感知❌✅ 节点系统屏幕/录屏感知❌✅ 节点系统GPS 位置感知❌✅ 节点系统浏览器自动化看网页✅ browser✅ browser读项目上下文文件✅ Context Files✅ 类似机制跨会话搜索历史✅ Session Search (FTS5)✅主动感知工具驱动网关预处理 工具驱动人类类比概念HermesOpenClaw总比喻蒙眼戴耳机的助手带智能手机的助手看图片旁边坐着一个画师“帮我看看这张图”自带 app 自动识别“图已读给你了”听语音没有耳朵耳朵旁边有个实时翻译机看环境你告诉它周围有什么它有手机摄像头自己拍自己看存储器随身笔记本 档案馆管理员笔记本 云端记忆库选择指南场景更推荐需要 Agent 听懂语音消息OpenClaw有 STT需要 Agent 用手机摄像头看环境OpenClaw节点系统独有只需要文字偶尔看图两者都可以需要精细控制感知流程什么时候看、看什么Hermes工具驱动Agent 自己做决定想开箱就有图片/语音预处理OpenClawGateway 层自动处理项目上下文感知AGENTS.md 等两者都可以需要语音输出TTS两者都可以下期预告文章内容Agent Loop 篇Agent 的大脑——推理循环、工具选择、上下文管理、中断与恢复信息源声明Hermes 信息来源Tools Toolsets、Prompt Assembly、Context Files、Gateway Internals、Tool Gateway、本地 config.yaml 及 MEMORY.mdOpenClaw 信息来源docs.openclaw.ai/channels、docs.openclaw.ai/nodes、docs.openclaw.ai/nodes/media-understanding、docs.openclaw.ai/concepts/architecture、docs.openclaw.ai/tools/browserHermes 当前实例0.18.2CLI 工具集 17/25 启用
返回列表