Shippy:确定性工具、会话级 Sandbox 与 Live-Data Eval(4 类收敛 + 7 步实现方案 + 6 类评测指标)
Shippy确定性工具、会话级 Sandbox 与 Live-Data EvalAi2 / Skylight 2026-07-15 案例拆解TL;DR场景Ai2 / Skylight 2026-07-15 在 Hugging Face Blog 公开的 Shippy Agent 案例是一套高风险海事查询 Agent的端到端实现不是更大的模型而是一套受控 Agent Runtime。结论可靠性来自 SoulSkills 版本化、确定性 CLI 收敛错误面、每会话 Kubernetes Deployment 隔离、Harbor 跑真实数据 专家 Rubric 四层共同把模型可犯的错误空间逐层收窄。产出可迁移到语音 Agent / 机器人 / 企业数据助手的三层模式、四类收敛清单、6 个评测指标、12 条错误速查卡与一份 7 步实施/实验方案。版本矩阵功能 / 事实状态说明原文Soul Skills 打包进版本化 Docker 镜像Config 决定 OpenClaw Harness、当前 Claude Opus 4.6 和运行设置✅ 已验证Hugging Face Blog S04 原文huggingface.co/blog/allenai/shippy-tech-blog2026-07-15原文Skill 遵循 Agent Skills 开放格式SKILL.md / metadata / scripts / references / assets✅ 已验证原文 S04 Agent Skills 官网 agentskills.io持续更新原文Skylight CLI 负责鉴权、分页、结构化输出早期直接 API 方案出现分页、几何编码、过滤器错误✅ 已验证原文 S04这是把 CLI 收口为受控工具面的直接动机原文Mothership 为每个用户会话创建独立 Kubernetes Deployment注入用户 JWT限制文件/网络边界✅ 已验证原文 S04架构图Sandbox 内部含 Sidecar Lifeline OpenClaw Harness 双向通讯原文Harbor 插件启动被测 Shippy 精确版本对实时数据运行专家加权 RubricSkill/模型/数据变化触发重跑✅ 已验证原文 S04 Harbor Framework 官网harborframework.com原文模型路由与跨线程记忆是后续路线不是当前已完成能力✅ 已验证原文 S04明确future work避免误读为现能力当前底层模型为 Claude Opus 4.6⚠️ 待核验用户原文给出当前 Claude Opus 4.6S04 未直接锁定版本号4.6 为作者描述建议以实跑镜像为准Agent Skills 开放格式是 Anthropic 主导的 Agent Skills 规范⚠️ 待核验用户原文称开放格式Agent Skills 官网 agentskills.io 持续更新但本案例实际由哪一方率先提出、当前治理方需另核Shippy 案例使用 Go / TypeScript / Python 等具体语言栈⚠️ 待核验原文未在 S04 中披露具体后端语言架构图中提及 Postgres GCS 与 Redis Streams实时数据原案例背后是 Global Fishing Watch / Skylight 平台数据⚠️ 待核验评分示例提到Global Fishing Watch via Skylight但实时数据源所有权与计费模型未在 S04 完整披露每会话 Kubernetes Deployment 的资源回收机制与空闲超时阈值⚠️ 待核验原文给出ephemeral, per-user和Redis Streams inbound / outbound per thread但具体 TTL/Idle TTL 未披露反方观点直接 Function Calling 对简单低风险 API 已足够✅ 立场本文作者明确列出文章不否认CLI 收敛是为高复杂 API 付出反方观点低价值短会话更适合共享池 Namespace✅ 立场本文作者明确列出不是所有场景都该上每会话 Deployment反方观点实时数据评测降低完全可复现性需保留冻结快照✅ 立场本文作者明确列出是 Live-Data Eval 的天然代价**一句话核心论点**高风险 Agent 的可靠性主要来自把模型可犯的错误空间逐层收窄并用真实数据、真实版本和真实工具链做整体回归。摘要Shippy 不是更大的海事模型而是一套受控 Agent 系统。Soul 与 Skills 形成版本化行为包Config 可切换 Harness 和模型类型化 API 与确定性 CLI 处理鉴权、分页和几何等高错误率细节每个用户会话拥有独立 Kubernetes DeploymentEval 通过 Harbor 启动精确版本对实时数据和专家 Rubric 评分。本章将案例抽象为可迁移到语音 Agent、机器人和企业数据助手的三层模式。读者问题为什么复杂 API 不应直接暴露给模型确定性 CLI 如何缩小错误空间又保留 Agent 灵活性每会话 Kubernetes 隔离何时值得何时过重实时数据变化下如何区分模型回归与数据漂移已核验事实Shippy 的 Soul 与 Skills 打包进版本化 Docker 镜像Config 决定 OpenClaw Harness、当前 Claude Opus 4.6 和运行设置。S04Skill 遵循 Agent Skills 开放格式由 SKILL.md、元数据、脚本、参考材料和资产组成。S04、S05Skylight CLI 负责鉴权、分页和结构化输出结果固定写入本地 JSON早期直接 API 方案出现分页、几何编码和过滤器错误。S04Mothership 为每个用户会话创建独立 Kubernetes Deployment注入用户 JWT并限制文件和网络边界。S04Harbor 插件启动被测 Shippy 精确版本对实时数据运行专家加权 Rubric并在 Skill、模型或数据变化时重跑。S04、S07模型路由与跨线程记忆是后续路线不是当前已完成能力。S04技术机制Shippy 的可靠性来自四类收敛语义收敛Soul 明确拒绝法律判定和超出数据的推断。接口收敛API Schema → 确定性 CLI → Skill下一层不再重新实现上一层的复杂性。资源收敛每会话独立文件、凭据和网络边界。评测收敛固定版本、实时数据、专家 Rubric、Judge 解释、回归门禁。写文件而不是通过 Shell 管道传大结果不只是性能优化也使中间结果可追踪、可复用和可清理。工程含义迁移到实时语音 Agent 时可以把 ASR、对话状态、LLM、工具层和 TTS 分为独立版本单元。工具层通过确定性 CLI 或服务接口控制参数语音 Session 使用独立工作目录和短期 Token系统级 Eval 同时检查识别、工具选择、数据正确性、延迟、打断和最终语音输出。实现或实验方案把系统边界、Skill 和运行配置分开版本化发布物中记录三者组合。为高复杂 API 构建面向任务的 CLI而不是把所有底层参数原样暴露给模型。CLI 输出使用稳定 JSON Schema、显式文件路径、生命周期和大小限制。按照风险选择隔离级别进程、容器、Namespace、每会话 Deployment 或专用账户。建立专家 Rubric事实准确性、时间范围、边界解析、来源归因、拒绝和风格使用不同权重。为数据快照或查询时间打标当结果变化时先区分数据漂移与 Agent 回归。保留失败样例的 Trace 和版本任何 Skill、模型或数据变化都触发差分报告。评测指标Tool Invocation ValidityCLI 命令和参数通过 Schema 校验的比例。Data Completeness分页、时间范围和几何过滤后结果是否完整。Isolation Breach跨会话文件、凭据或数据可见性事件目标必须为零。Rubric Pass Rate按任务类型和准则分解不只看总分。Cold Start / Cost每会话隔离带来的启动时间和资源成本。Data Drift Delta同版本 Agent 在不同数据时间点的得分变化。反方观点与替代解释直接 Function Calling 在简单、低风险 API 上可能足够不需要所有系统都增加 CLI。每会话 Kubernetes 隔离安全性高但低价值短会话可能更适合共享池加 Namespace。实时数据评测更接近生产却降低完全可复现性因此需要同时保留冻结快照集。适用边界适合高权限、数据敏感、复杂 API 和专业领域 Agent。对于无外部工具的简单问答完整 Mothership 式隔离成本过高应按风险选择最小充分架构。风险与误读点把 Shippy 单一案例写成行业标准。忽略每会话 Deployment 的冷启动和集群成本。让 LLM Judge 取代专家复核。临时 JSON 文件缺少唯一命名、清理和配额。把未来模型路由和跨线程记忆描述为现有能力。参考来源S04What building Shippy taught us about building agentsAi2 / Skylight / Hugging Face2026-07-15。S05Agent Skills OverviewAgent Skills持续更新。S06OpenClaw repositoryOpenClaw持续更新。S07HarborHarbor Framework持续更新。错误速查卡症状根因定位修复模型对同一问题两次答案数据不同但代码没动没区分数据漂移和Agent 回归对比 Rubric 各项得分 数据快照时间戳用冻结快照集做回归门禁实时数据只做探索工具调用经常出现分页、几何、过滤器错把底层 API 直接暴露给模型在 Skylight CLI 之外加一层任务型 CLI强制走 CLI所有参数 Schema 校验Tool Invocation Validity 低于 95%命令参数未校验 / 自由文本拼接抓取失败调用样本按 Schema diff给 CLI 加显式参数 Schema 路径/日期/几何白名单Data Completeness 偶尔掉到 80% 以下分页上限 / 时间窗口被截断检查 Skylight CLI 的--limit与时间过滤强制分页全量 几何相交校验 总数断言Isolation Breach 出现非零事件共享文件系统、共享 Token 缓存、共享网络出口审计 Sidecar / Sandbox 进程命名空间与文件系统改回每会话 K8s Deployment强制 JWT 注入 NetworkPolicyRubric Pass Rate 看似高但实际不可信LLM Judge 取代了专家复核检查 Judge 的 few-shot / rubric 来源把专家权重显式注入 Prompt保留 Judge Reasoning 留档改一行 Skill 提示所有 Eval 都要重跑Eval 与数据时间未分离看 Harbor 任务配置用冻结快照做必须通过基线实时数据只做漂移观测Cold Start / Cost 暴涨每会话都起独立 K8s Deployment监控冷启动比例 集群 CPU/内存峰值按风险分级低风险走共享池 Namespace高风险才每会话 Deployment临时 JSON 文件把磁盘打满没有唯一命名、清理、配额查输出目录 inode / size用session_id ts hash命名 TTL 配额上限误把未来模型路由当成现能力把 Roadmap 写成已交付检查原文 “future work” 段文档与代码门禁分开标注Roadmap 不进工程方案第三方文章把 Shippy 描述成通用最佳实践单一案例被泛化复读适用边界段显式标注本文案例适用于高权限 / 数据敏感 / 复杂 API不适用简单问答把OpenClaw / Skylight CLI / Harbor复制到生产时缺少官方来源引用的是社区文章而非一手查 Reference 段链接引用 S04 Hugging Face Blog 与 agentskills.io / openclaw / harborframework 官方域实时数据评测结果看起来变好或看起来变差但无解释Judge Reasoning 没有留档看 Harbor 输出是否含 reason 字段在 Eval 报告里强制保留 Judge Reasoning 文本 引用源