
摘要本文解读 COLM 2025 论文《AIOS: LLM Agent Operating System》。该论文提出AIOS 智能体操作系统通过融合操作系统内核思想、系统调用抽象与SDK 开发套件把 LLM 与工具资源从智能体应用中隔离出来统一管理其特别之处在于让并发智能体像进程一样被调度与隔离。实验表明接入 AIOS 后吞吐最高提升 2.1 倍并发智能体从 250 个扩展到 2000 个仍保持近似线性性能为规模化 LLM 智能体服务提供了系统级基础设施借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么智能体需要自己的操作系统研究主线从问题到结论基准/方法设计三层架构与七模块内核分类全景AIOS 内核的七大模块方法细节系统调用与调度机制实验设计与结果结果对比总结关键发现局限性常见问题FAQAIOS 和 AutoGen、LangChain 有什么区别AIOS 如何提升并发吞吐AIOS 对智能体性能有损吗AIOS 支持哪些智能体框架AIOS 开源吗参考链接论文基本信息项目内容标题英文AIOS: LLM Agent Operating System标题中文LLM 智能体操作系统内核化资源管理与调度作者Kai Mei, Xi Zhu, Wujiang Xu, Mingyu Jin, Wenyue Hua, Zelong Li, Shuyuan Xu, Ruosong Ye, Yingqiang Ge, Yongfeng Zhang机构Department of Computer Science, Rutgers University会议COLM 2025arXivhttps://arxiv.org/abs/2403.16971项目网站https://github.com/agiresearch/AIOS背景与动机为什么智能体需要自己的操作系统LLM 智能体在真实任务中既要调用大模型服务偏好检索、接口选择、回复生成也要使用传统操作系统服务文件、存储。但现有智能体框架AutoGen、LangChain 等让智能体直接访问 LLM 与工具资源带来三类问题无调度导致资源独占一个智能体可以淹没 LLM 请求其他智能体只能等待并发场景反复试错提示词被转成张量加载进显存直到触发 CUDA 显存上限异常再释放重试严重拖慢吞吐缺乏隔离与访问控制直接暴露系统级资源带来安全隐患。AIOS 的解法是把操作系统演进史批处理 → 分时 → 多任务 → 模块化内核的思想搬到智能体场景LLM 被视作类似 CPU 核心的资源由内核统一调度、隔离与恢复。与 MemGPT 等只做单点记忆管理的工作不同AIOS 提供完整的内核抽象——这正是它与既有工作最本质的差异。研究主线从问题到结论图 1AIOS 论文的研究主线 —— 从并发瓶颈到内核化资源管理的完整推理链基准/方法设计三层架构与七模块内核AIOS 采用经典的三层架构图 2旅行智能体完成任务需要 LLM 服务红与 OS 服务蓝协同 —— AIOS 将两者统一纳入内核管理应用层AIOS SDK 提供统一接口既支持原生 agent 开发也通过适配器接入 ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架内核层AIOS Kernel 含调度器、LLM Core、上下文管理、内存管理、存储管理、工具管理、访问管理七模块硬件层CPU/GPU/磁盘AIOS 通过传统 OS 系统调用间接访问不直接操作硬件。核心机制是查询分解智能体查询被拆成多个 AIOS 系统调用syscall由调度器分发到对应模块执行实现并行与有序处理。分类全景AIOS 内核的七大模块图 3AIOS 内核七大模块 —— LLM 核心、调度、上下文、内存、存储、工具、访问管理方法细节系统调用与调度机制图 4AIOS 三层架构 —— 应用层通过 SDK 访问内核层内核统一管理 LLM 核心、调度与各类资源LLM Core统一接口封装不同 LLM 端点API/本地视作核心便于调度与切换Agent SchedulerRR/FIFO 策略调度系统调用支持抢占式执行 上下文快照恢复Context Manager长上下文生成中断时快照并恢复防止长请求独占 LLM 核心Memory/Storage Manager短期对话记忆与长期交互日志持久化分层管理Tool/Access Manager工具加载与调用冲突消解、访问控制与用户干预协议。图 5Agent 查询分解为 AIOS 系统调用由调度器按策略分发到各执行模块访问类调用不经过调度器每个模块通过系统调用对外提供服务如 memory_store、tool_call、context_snapshot智能体经由 SDK 透明调用——与操作系统 syscall 同构应用无需关心资源细节。实验设计与结果评测协议LLM Core 用 GPT-4o-miniAPI Llama-3.1-8b / Mistral-7b本地 fp16单张 RTX A5000默认 250 个智能体并发、RR 调度成功率 SR% 为统一指标覆盖 HumanEval代码生成、MINT-Code多轮交互代码、GAIA通用助手工具调用、SWE-Bench-Lite软件工程修复四基准。主表五个框架接入 AIOS 前后成功率SR%括号为相对无 AIOS 的提升框架 (w/ AIOS)HumanEvalMINTGAIASWE-LiteReAct50.6 (1.8)30.1 (0.7)7.3 (1.8)4.3 (0.4)Reflexion51.8 (1.2)33.8 (1.4)7.8 (1.1)5.1 (0.4)Autogen87.8 (0)42.5 (0)9.7 (2.4)4.3 (0)Open-Interpreter86.0 (0.6)48.7 (2.8)---5.1 (0.4)MetaGPT82.9 (0)41.8 (0.7)---5.9 (0)所有框架性能保持或提升工具调用型基准 GAIA 提升最显著最高 2.4pp。增益来自三机制结构化 prompt 增强、工具调用参数预校验正则、冲突消解哈希表。图 6Llama-3.1-8b 上各框架归一化吞吐 —— AIOS 显著更高Reflexion 达 2.1×扩展性实验并发智能体从 250 增至 2000总体执行时间与平均等待时间均近似线性增长且与无 AIOS 的差距随并发数扩大持续拉大——高并发下优势更明显。图 7并发 agent 从 250 增至 2000 —— 总体执行时间与平均等待时间近似线性AIOS 差距随并发扩大附加实验Mistral-7b 本地模型上重复吞吐/延迟实验趋势与 Llama 一致确认效率收益与具体模型无关FIFO 调度策略与默认 RR 差异可控。图 8Mistral-7b 上各框架归一化吞吐 —— AIOS 同样显著提升验证跨模型普适性结果对比总结图 9AIOS 结果对比总结 —— 吞吐 2.1×、GAIA 2.4pp、并发近似线性扩展关键发现Oral 信号分析从创新模式视角看AIOS 命中两个高 Oral 率模式——P6 重新表述为可解对象n79Δ_OR2.9ppΔ_OH7.1pp把并发智能体共享 LLM 的难题重构为内核资源调度问题LLM 视作类 CPU 核心证据是 250→2000 并发近似线性扩展与 2.1× 吞吐P11 分解并委托求解器n42增长最快 τ6.3pp查询分解为系统调用后由调度器委托专门模块执行证据是 GAIA 最高 2.4pp 且五框架性能无一回退。系统类贡献以可复用基础设施 大规模受控实验构成完整证据链。性能保持或提升5 个框架 × 4 个基准全部 SR% 无回退Open-Interpreter 的 MINT 提升 2.8pp45.9→48.7吞吐最高 2.1 倍Reflexion 框架在 Llama-3.1-8b 上执行加速最显著源于避免显存试错GAIA 工具调用提升显著AutoGen 2.4pp7.3→9.7得益于参数预校验与冲突消解近似线性扩展并发 250→2000执行时间与等待时间线性增长无 AIOS 差距随并发扩大跨模型普适Llama-3.1-8b 与 Mistral-7b 上吞吐/延迟收益一致即插即用SDK 适配器机制让 5 大框架接入零侵入。局限性单 GPU 单模型串行默认一次只处理一个请求未覆盖多模型并行/分布式推理调度策略简单仅 RR/FIFO未探索优先级、负载感知等更智能策略访问控制基础Access Manager 提供基础鉴权安全与隐私保障仍待加强覆盖有限5 框架 × 4 基准通用性需要更大生态验证。作者明确的多 LLM 分布式资源管理、更智能调度与多智能体协作安全是未来方向。常见问题FAQAIOS 和 AutoGen、LangChain 有什么区别AutoGen 等框架聚焦智能体编排逻辑把 LLM 当外部 API 调用AIOS 把 LLM 当作类似 CPU 核心的内核资源统一调度、隔离与恢复并可通过适配器让这些框架直接接入受益。AIOS 如何提升并发吞吐核心是调度器避免提示词装不上显存的反复试错请求被分解为系统调用统一排队配合上下文快照实现抢占式执行最高带来 2.1 倍吞吐提升。AIOS 对智能体性能有损吗没有。四个基准 × 五个框架的成功率全部保持或提升工具调用型基准 GAIA 最高 2.4pp性能增益来自 prompt 结构化增强与工具调用预校验。AIOS 支持哪些智能体框架ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架均通过适配器接入原生 agent 也可直接使用 AIOS SDK 开发。AIOS 开源吗是的代码在 GitHub agiresearch/AIOS 组织下开源这是其作为可复用基础设施被社区广泛引用的基础。参考链接arXiv 论文页https://arxiv.org/abs/2403.16971项目主页GitHubhttps://github.com/agiresearch/AIOSReActICLR 2023https://arxiv.org/abs/2210.03629ReflexionNeurIPS 2023https://arxiv.org/abs/2303.11366AutoGenCOLM 2024https://arxiv.org/abs/2308.08155MetaGPTICLR 2024https://arxiv.org/abs/2308.00352给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件