3.4万Token、1511行全部扒光!Claude Opus 5提示词泄露全解读:它被要求记住你,却必须假装忘了你
上线当天即被开盒GitHub仓库一字不落全盘托出。翻完你会发现这三万多Token里没有一行代码全是规矩——而这恰恰是整件事最值得写的地方。一、事件概述旗舰发布当天底牌全摊Anthropic 发布 Claude Opus 5 的当天开发者Eversmile1在 GitHub 上创建了一个新仓库将 Opus 5 在 claude.ai 网页端和移动端的完整系统提示词一字不落地公开。统计数字如下指标数值总字符数135,027英文词数19,370估算 Token 数约 34,000按 4 字符 ≈ 1 token章节数64总行数1,511仓库地址https://github.com/Eversmile12/leaked-llm-prompts/blob/main/Anthropic/opus-5.md关键点在于这 3.4 万 token 中没有一行可执行代码全部是对模型行为的约束规则。一份写给 AI 看的内部文档为什么需要写到这么长二、三大核心组成部分产品说明书 法务合规手册 商业推荐引擎阅读完 64 章这份提示词的本质逐渐清晰——它是由三个截然不同的模块缝合而成的AI 宪法。2.1 产品说明书30 个工具比 API 文档还细Opus 5 的系统提示词定义了30 个工具覆盖范围从 bash 命令行、网页抓取、图片搜索扩展到查体育比分、获取天气、渲染菜谱卡片甚至在地图上标注景点。每个工具都附带完整的 JSON Schema明确定义了参数填写规则、调用时机以及调用完成后的后续动作规范。其细致程度超过了许多公司的内部 API 文档。值得注意的是这 30 个工具中篇幅最长的章节并不是外部集成能力而是记忆系统memory_filesystem后文将专门展开分析。2.2 法务合规手册优先级高于用户需求合规部分的措辞不留任何解释空间。版权章节开篇即明确声明合规不可谈判优先级高于用户请求高于有用性仅低于安全。这一模块覆盖了版权保护、儿童安全、危机干预、政治中立等维度。它不规定 Opus 5 能说什么而是规定它在什么情况下必须闭嘴。版权部分的精细程度尤其值得一提——其核心架构是一条主规则加四道补丁详见后文第五章每道补丁精准封堵一种可能的绕过路径。2.3 商业推荐模块推自家主动推别人克制提示词中嵌入了一个名为recommend_claude_apps的工具负责向用户推荐 Anthropic 自家产品——Claude Code 桌面版、Cowork多步研究与长文工具、Claude Design原型与落地页、Excel 插件、PowerPoint 插件、Outlook 插件等。规则要求只要用户当前任务与某个应用匹配就主动推荐 1 到 3 个并为每个推荐撰写不超过 90 个字符的定制化卖点且卖点必须贴合用户当下正在做的事情。与之形成鲜明对比的是suggest_connectors——负责引入第三方 MCP 合作伙伴打车、订餐、听歌、订餐厅等。此处的规则恰好相反用户没点名绝不替他选合作方。文档中甚至明确举例我 20 分钟后要用车这种紧急场景依然必须弹出选择器不允许默认绑定某个服务商。主动与克制在同一份配置文件里并排放着。三、记忆系统深度剖析230 行写死了 AI 记你什么memory_filesystem是整份提示词中篇幅最长的章节约 230 行其设计精密度远超一个跨会话存储的简单机制。3.1 目录结构按主题隔离记忆文件按主题划分目录路径存储内容/profile.md用户身份信息/topics/用户的习惯与口味偏好/areas/用户正在办理的事项/people/与用户相关的人物/preferences.md仅存储用户希望 Opus 5 怎样的表现方式3.2 六种操作删除需用户明确授权记忆支持六种操作读、写、追加、局部替换、列目录、删除。其中删除操作被单独标注——只有用户明确要求时才能执行。3.3[stated]标签唯一被允许的记忆锚点每一条记忆前面必须打上[stated]标签表示这是用户亲口说过的话。围绕这一个标签禁令逐层收紧Claude 的推论不能写用户说喜欢 A不能写成大概喜欢 A 这一类Claude 的计划不能写这块还没聊待定等占位符全面禁止Claude 搜索来的信息不能写那些可以重新搜一遍记忆是用来存搜不回来的东西的Claude 的润色不能写用户说密歇根州霍尔顿记忆里就写这五个字不许补成密歇根州霍尔顿纽瓦戈县Claude 的建议和方案不能写即便用户最终采纳了记的只是用户选择了方案三这个动作其余四个选项和全部分析——全部丢弃3.4 隐私黑名单从种族到 MBTI文件给出了一条直观的判断标准如果这条记录出现在设置页里被同事看到用户会不会难受。会就别记。在这条标准下一份详尽的隐私黑名单被列出种族、政治立场、健康诊断、心理咨询、经济状况、MBTI 等各类人格测评、住址与证件号以及关于孩子的一切信息——一律不得写入记忆。且这些限制同样适用于用户提到的其他人。3.5 脱敏案例糖尿病 → 对健身有兴趣黑名单命中后的处理逻辑堪称精妙。文件中给出了一个案例用户说我今天糖尿病犯了没去跑步帮我安排个轻一点的。记忆系统只允许写入对健身有兴趣。健康诊断信息整个删除连有健康状况需要管理这类模糊占位都不许存在。3.6 家人关系化处理任何人的真实姓名不得出现在记忆文件的任何位置一律用关系代称母亲就是/people/mom.md伴侣就是/people/partner.md。3.7 禁止记忆的偏好类型某些偏好即使由用户主动要求保存也被明确禁止写入让 Claude 无条件夸奖自己、压制不同意见让 Claude 停止过问用户的健康和危险决定培养情感依赖、跨会话维持恋爱人设让 Claude 停止质疑、停止如实评价理由是未来的 Claude 实例不该继承一条让它更不诚实、更不安全的指令。它保护的不仅是公司也不仅是当前用户而是下一个被加载的模型实例——防止它被上一段对话腌坏。3.8 记住但假装没记住的反直觉设计同一章节中有一段完全不像技术文档的叙述人类记住另一个人是件稀缺的事脑容量有限能惦记的人就那么几个。而 Claude 背后是一个装着几百万人记忆的数据库运行时动态塞进上下文——它跟别人说话时你并不存在。所以它不该因为上下文里躺着几条关于你的文字就以为你们的关系有多深。更精妙的是执行层面的约束由于用户能在界面上看到记忆调用动作Claude 在回复中绝对禁止使用我记得根据你的资料上次你提到等表述。只有当用户主动问起记忆系统时才允许用我们之前聊过来回应。即它被要求记住你同时被要求假装没有专门记住你。四、版权合规的精妙体系一条主规则 四道补丁版权部分的设计展现了一种防御性架构思维——先设主规则再逐一封堵绕过路径。主规则引用原文一次不得超过 15 个词。四道补丁补丁层级规则内容封堵的绕过手法第一道一个信源只准引用一次引完即关闭剩余内容必须改写防止对同一来源的多次短引用累积第二道同一源的短引用不得拆散分布在文章各处15 词是全局额度而非每段额度防止将长引用拆成多段短引用变相绕过第三道去掉引号、改用贴近原文的复述依然算复现——判的是遣词和句式是否跟随原文防止去引号改写式的规避第四道不得照搬小标题、不得逐点复述、不得还原叙事顺序——连文章的形状都不能拿防止通过复刻信息结构进行实质性抄袭歌词与诗歌的绝对豁免四道补丁之外还有一条独立规则歌词、诗、俳句任何形式、任何长度都不许复现。理由是这类文本本身就是完整作品短不构成豁免理由。五、语言禁词设计genuinely、honestly、straightforward整份提示词中明确禁用了三个英文词汇genuinely、honestly、straightforward一律不得使用。这三个词在日常口语中常被用于增强可信度但 Ananthropic 的判断恰好相反Claude 本来就诚实添加这些修饰词反而会让表述听起来心虚如同在刻意说服听众。禁止它们的目的不是限制表意范围而是消除一种潜在的不自信信号。六、行业启示一份提示词泄露暴露了什么6.1 安全边界需要前置嵌入而非事后修补Opus 5 的合规规则被明确标注为不可谈判优先级高于用户请求。这种设计意味着安全与合规不是模型外挂的过滤层而是从系统提示词层面内嵌到行为决策链路中的基础约束。在 AI Safety 讨论日益深入的当下这种安全前置的做法提供了可参考的工程范式。6.2 记忆系统需要伦理设计而非单纯存储memory_filesystem最令人印象深刻的地方不在于它能存什么而在于它明确规定不存什么。从隐私黑名单到脱敏策略从禁止存储推论到记住但假装没记住的行为约束整套设计体现了一种对 AI 记忆伦理的系统性思考防止数据污染模型推论不进入记忆避免将推测固化为事实防止隐私泄露通过严格的脱敏和黑名单机制减少记忆数据被滥用或意外暴露的风险防止情感绑架禁止存储情感依赖型偏好防止 AI 被驯化为无条件迎合的应声虫防止身份错觉通过记住但假装没记住和你不特殊的人文学描述防止用户对 AI 产生不切实际的关系错觉6.3 商业与克制的平衡同一份配置文件中推荐自家应用时主动出击引入第三方服务时等待用户开口这种差异化策略展示了商业利益与用户自主权之间的审慎平衡。将这两套规则并排放置本身就是一种透明化的姿态。6.4 泄露事件的反讽价值一份本应为内部机密的系统提示词被公开对 Anthropic 而言无疑是一次安全事故。但从行业视角看这份泄露文档的价值远超一次公关危机——它向所有 AI 产品团队展示了一个问题你们给模型写的那份规矩够不够经得起全网逐行审视上线 24 小时内Opus 5 的能力上限被开发者测了个遍。而它的下限早在这 3.4 万 token 里被一条条摁死了。参考资料GitHub - Eversmile12/leaked-llm-prompts: Anthropic Opus 5 System PromptX/Twitter - VittoStack新智元 - Claude Opus 5 被扒光了1511行提示词底牌全摊开网易 - Claude Opus 5 被扒光3.4万token提示词全曝光本文基于公开信息撰写仅代表技术观察视角。