尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

From Computer Use 到 Datacenter Use:AKernel 如何给 AI Agent 提供即时算力

From Computer Use 到 Datacenter Use:AKernel 如何给 AI Agent 提供即时算力 本文整理自QCon北京《谈鉴锋、周天昱 - From Computer Use to Datacenter Use for AI》通过AI音视频总结工具Ai好记进行视频转文字转录整理以下为精炼整理后的会议笔记内容。现在聊 AI Agent大家听到最多的一句话是「给 Agent 一台电脑让它自己去工作」在虚拟环境里调工具、调接口、调大模型服务。但作者开头抛出一个很关键的观点如果 Agent 足够聪明真正需要的是更粗的手和脚也就是算力。比如要做一个炒股的 Agent模型再聪明也读不完一整年的交易数据它需要的是写个程序去跑历史数据、不断优化策略。这篇文章讲蚂蚁提出的 AKernel 基础设施目标就是让 Agent 能像用本地资源一样快速拿到数据中心级别的算力。为什么叫 Datacenter UseComputer Use局限于单台计算机的有限资源而Datacenter Use是让 Agent 直接、无缝地调用跨节点、跨地域的数据中心算力、存储和网络资源按需、弹性、全局。作者判断 Agent 往下发展有两个趋势把单个 agent 拆成产品经理、开发、测试等角色分工协作Datacenter Use给聪明的大佬配上足够的手脚现有云原生基础设施的鸿沟从 2015 年容器和云原生火起来后基础设施已经从巅峰期走到落地期。现状是纵向分层、横向分域带来大量协同问题。虽然能支撑各家大促和容灾但靠的是日复一日的演练大促准备时间从半年压到三个月再到一个月还是不够。核心痛点对 Agent 来讲让它等一天都不可接受要的是分钟级甚至秒级就有算力可用工业化细分程度已经很高但要给 Agent 把算力真正用起来中间还有很大的 gap总不能配一个 50 人的团队每天专门给 Agent 提供服务另一个判断Agent 未来的用户可能大量是 C 端用户需要给每个人的众多 Agent 都匹配 Datacenter Use 能力要能在全球算力池里找便宜的、合适的做出多云的感觉对应一个Build Your Own Cluster的概念。三个技术支柱AKernel 是一套基础设施为上层用户提供及时可用的算力设计目标是缩小系统半径做到轻量、高内聚。它基于三个技术支柱搭建。第一支柱OpenYuanrong 分布式内核作者对「分布式内核」这个理念很认同认为它偶合性好计算、网络、存储的一体化设计能有效缩小系统半径。主要能力提供相对宽松relaxed的存储算力在哪就在哪搭一个足够可用的存储系统提供对象存储和分布式存储省掉了自建一套的成本提供函数系统和数据系统前者做资源调度管控后者做跨节点或节点内跨沙箱的高效数据共享基于共享内存完整的运行时接入SDK 支持 C、Python、Go 等方便用户快速使用集群资源第二支柱AFaaS 安全沙箱沙箱是给 Agent 跑的运行时。它基于系统调用语义能从一个已保存好的沙箱状态快速克隆出新的沙箱实现毫秒级甚至 10 秒内的快速启动同时保持强安全隔离能力。应用场景支撑 Agent SandboxRL 训练、蒸馏、评测对外 serving比如类似 Kimi 的 agent 场景快速拉起第三支柱镜像懒加载加 P2P 分发问题当要同时拉起 1 万个 Agent 沙箱时如果每个沙箱都从中心仓库拉 3 到 5 个 G 的自定义镜像流量根本扛不住效果是分级很慢。解决方案节点上的镜像组件做 lazy load真正访问到镜像里的具体文件时才触发拉取再用集群内的镜像加速组件建立缓存走 P2P 网络加速分发效果可以从分级优化到秒级关键技术特性1. 全链路 Checkpoint/Restore功能用户可通过 SDK 或 CLI 对已拉起的沙箱做 checkpoint产生的镜像存到数据系统需要时快速加载恢复触发方式既可以用户主动触发也能通过函数系统检测到闲置沙箱自动 checkpoint 和 restore价值这种状态保存与恢复能力对训练到一半的模型、故障恢复、状态迁移都很有价值2. 双向网络代理本地到沙箱在集群里跑一个 Jupyter 服务可以暴露到本地直接访问沙箱到本地做 RL rollout 时本地起推理引擎集群里的沙箱需要访问本地的大模型服务也能通过另一个方向的代理打通3. 对话式部署流程把仓库代码 clone 下来打开 cloud code告诉它要在阿里云某个区域的集群部署一个 AKernel 集群只需提供云服务商的 SK就能在 10 分钟内自动完成多云集群搭建底层技术通过 Terraform 创建资源、Helm 编排、K8s 部署云支持目前基于 Terraform 已适配阿里云 ACK 和华为云 CCE运维简化一个 CLI 能列出所有资源、进入沙箱排查Grafana 仪表盘、trace、日志都开箱即用4. 自带监控链路拉集群时就自带一套监控对每个节点资源内存、磁盘、沙箱创建耗时都有监控沙箱拉起能精确到调度 20 多毫秒、节点侧 10 毫秒以内小团队运维的核心技术架构AKernel 用统一的代码库维护OpenYuanrong 加各种开源组件放一个大库日常研发用 AI 驱动AI 驱动运维示例容器拉起遇到故障打开 code 工具加一个强模型喂给它监控和整个大库代码5 到 10 分钟就能定位出原因团队规模对比传统方式维护一套 K8s 加节点操作系统内核加调度系统加分布式存储团队少说也要 30 到 50 人AKernel 方式小于 3 人的全栈团队就能维护核心优势轻量化设计加上 AI 驱动把需求、研发、测试、运维一个人端到端打通打破了基础设施必须大团队的固有认知。落地与展望当前落地情况这套体系在蚂蚁的场景里已经落地依赖集群快速拉起、函数系统和数据系统的高效调度与数据分发、沙箱快速启动和安全隔离能力。核心价值三点AI 时代用少量人做大量事通过 AI 驱动运维大幅降低人力成本不让基础设施能力制约 Agent通过极致优化释放 Agent 对算力的需求让开发者拿到代码就能部署集群实现真正的 Datacenter Use未来方向持续支持 GPU、各种国产加速卡沙箱也会支持更多的通用运行时以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。
返回列表