◆ ◇ ◆01项目介绍ctf-agent 到底是个什么东西ctf-agent 是 Veria Labs 开源的一套自动化 CTF 解题 Agent。它的目标不是陪你聊题而是直接接入 CTFd 平台自动发现题目、分配模型、开 Docker 沙箱、跑工具、寻找 flag。最有意思的地方在于它不是把一道题丢给一个模型慢慢想而是让多个模型同时攻同一道题。哪个模型先找到 flag哪个模型就赢下这一局。这就像把传统 CTF 里的“一个人盯一道题”改成了“多个 AI 选手同时开打”再由 Coordinator LLM 统一看战况、读轨迹、给提示、做调度。【配图多模型竞速 / Solver Swarm 示意图】▎核心亮点速览▸ 多模型竞速Claude、Codex 等模型可以同时攻击同一道 challenge▸ 自动开题通过 CTFd 接入Poller 每 5 秒发现新题并自动拉起求解任务▸ Coordinator LLM读取 solver traces给出更有针对性的技术指导▸ 跨模型共享不同 solver 的发现会通过消息总线同步避免重复踩坑▸ Docker隔离沙箱每个 solver 在独立容器里运行预装常用 CTF 工具▸ 人工介入比赛中可以给正在运行的 solver 发送提示和方向修正 一句话理解ctf-agent CTFd自动轮询 Coordinator调度 多模型Solver蜂群 Docker工具沙箱不是“AI帮你想想思路”而是“AI模型组队开容器真跑题”。02测试成绩它到底有多强实战数据说话这类工具最怕只讲概念不讲成绩。ctf-agent 的 README 里直接给了一组非常硬的实战结果BSidesSF 2026 CTF全部 52 道题解出并拿到第一名。指标成绩/数值说明解题完成度52/52 (100%)BSidesSF 2026 CTF 实战官方 README 标注全部 challenge 解出比赛排名1st place同场比赛第一名README 标注奖金 $1,500题目覆盖6大类覆盖 pwn / rev / crypto / forensics / web / misc题目轮询5秒Poller 每 5 秒检查 CTFd 平台并拉起新题求解▎为什么这组成绩有含金量CTF自动化工具很多但真正能在完整比赛里打出成绩的并不多。原因很简单CTF题目不是固定流程题很多时候需要不断试错、换方向、验证假设。ctf-agent 的优势不在于“某一个模型特别聪明”而在于它把比赛流程做成了并行系统平台发现新题Coordinator 判断优先级Solver Swarm 同时攻击沙箱负责安全执行消息总线负责共享突破口。▸ 第一层多模型并行减少单模型卡死在错误方向上的时间▸ 第二层独立沙箱每个 solver 可以放心安装依赖、跑脚本、调试二进制▸ 第三层轨迹回读Coordinator 能根据已有尝试继续给技术指导▸ 第四层中途提示人在比赛中可以把经验和直觉注入正在运行的任务【配图BSidesSF 2026成绩截图 / Results表格截图】03使用场景它能帮你干什么ctf-agent 的核心场景当然是 CTF但它背后的“目标发现 → 多模型并行 → 沙箱执行 → 结果汇总”模式也适合很多安全学习和研究流程。▎ 场景一CTF比赛辅助解题最直接的用法把它接到 CTFd配置 token 和题目目录让它自动监听 challenge。新题一出现Solver Swarm 就开始分头攻击。▸ Web题请求构造、路径探测、弱点验证、脚本化利用▸ Pwn题二进制分析、GDB调试、pwntools脚本迭代▸ Reverse题strings/readelf/radare2/反汇编辅助分析▸ Crypto题SageMath、z3、RsaCtfTool 等工具协同尝试▸ Forensics/Stego题exiftool、volatility3、steghide、zsteg、OCR等组合使用▎ 场景二赛后复盘与训练如果你是战队教练或学习者ctf-agent 的 solver traces 很有价值。它不仅告诉你结果还会留下尝试路径哪些方向失败了哪些线索被发现了最后是怎么转到正确路径的。▸ 复盘不同模型在同一道题上的思路差异▸ 总结常见误判点反向补充自己的题型知识库▸ 把高质量轨迹整理成 writeup 或训练材料▎️ 场景三CTF工具链沙箱ctf-agent 的 Docker sandbox 本身就是一套 CTF 工具环境。每个 solver 都能在隔离容器里调用 radare2、GDB、pwntools、SageMath、volatility3、zsteg、ImageMagick、PyTorch 等工具。这对本地环境洁癖用户非常友好比赛依赖和脏脚本都放进沙箱不污染主机。▎ 场景四AI安全Agent研究对研究者来说这个项目最值得看的不是某个提示词而是它的系统设计多模型竞速、消息总线、Coordinator反馈、人工中途干预、容器化执行这些都是安全Agent落地绕不开的工程问题。【配图四大使用场景矩阵图】04部署教程手把手跑起来项目依赖比较清晰Python 3.14、Docker、至少一个模型提供商 API Key以及 Codex/Claude 相关 CLI。建议先在干净的测试机器或专用 VPS 上跑不要直接丢到主力机里折腾。▎环境要求▸ Python 3.14 —— 项目运行环境▸ Docker —— 构建并运行隔离沙箱▸ uv —— Python依赖同步和命令运行▸ Anthropic / OpenAI / Google 至少一个 API Key▸ codex CLI —— 使用 Codex solver/coordinator 时需要▸ claude CLI / claude-agent-sdk —— 使用 Claude coordinator 时需要▎第1步安装依赖并构建沙箱git clone https://github.com/verialabs/ctf-agent.gitcd ctf-agent# 安装 Python 依赖uv sync# 构建 CTF 沙箱镜像docker build -f sandbox/Dockerfile.sandbox -t ctf-sandbox .▎第2步配置凭据cp .env.example .env# 编辑 .env填入 CTFd 和模型凭据CTFD_URLhttps://ctf.example.comCTFD_TOKENctfd_your_tokenANTHROPIC_API_KEYsk-ant-...OPENAI_API_KEYsk-...GEMINI_API_KEY...▎第3步连接 CTFd 开始解题uv run ctf-solve \--ctfd-url https://ctf.example.com \--ctfd-token ctfd_your_token \--challenges-dir challenges \--max-challenges 10 \-v▎Coordinator 后端选择默认 Coordinator 使用 Claude SDK也可以切到 Codex。这个角色负责看全局、读 solver 轨迹、给出下一步建议。▸ Claude SDK coordinator默认uv run ctf-solve --coordinator claude ...▸ Codex coordinatoruv run ctf-solve --coordinator codex ... 部署小建议先用少量题目和较小 max-challenges 测试确认 CTFd token、Docker、API Key 都正常。比赛时再放大并发否则模型费用和容器资源都会涨得很快。⚠️风险警示跑之前这几件事必须知道⚠️ 这是攻击性安全自动化工具ctf-agent 会驱动模型在沙箱中执行命令、跑脚本、访问目标服务。只建议用于 CTF、靶场、自有系统或获得明确授权的测试环境。不要拿它扫描、攻击或尝试利用未经授权的互联网目标。⚠️ 成本提醒多模型竞速 多份模型消耗多个 solver 同时跑题很爽但也意味着多个模型同时消耗额度。正式比赛前请先小规模试跑估算 token、时间和容器资源成本。建议设置 challenge 数量上限并保留人工观察窗口避免无人值守烧钱。⚠️ 沙箱不是万能护身符Docker 能隔离大部分执行环境但不要把真实密钥、个人文件和生产网络暴露给比赛题目。推荐使用一次性虚拟机、专用 VPS 或隔离网络运行。写在最后CTF自动化进入“AI战队”时代ctf-agent 最有意思的地方是它把 CTF 解题从“单模型问答”推进到了“多模型竞速系统”。以前我们评估 AI 做 CTF常常是在问这个模型能不能想出答案但 ctf-agent 提出的答案更工程化让多个模型同时开打用沙箱保证执行环境用 Coordinator 观察全局用消息总线共享线索。这不是终点但方向很明确未来的安全工具会越来越像一支可调度、可观察、可干预的自动化战队。人的价值不会消失只会从重复试错转向目标判断、策略选择和风险控制。▎互动提问看完这篇聊聊你的看法▸ 如果 CTF 比赛允许 AI Agent 辅助你会愿意让它参与到什么程度▸ 多模型竞速解题最适合 Web、Pwn、Reverse 还是 Crypto▸ 你更关心它的解题率还是更关心可控性、成本和安全隔离欢迎在评论区聊聊觉得有用的话点赞 在看 转发三连支持一下 关注我持续分享网安圈硬核干货