
写在前面本文是我作为一个在量化和工程之间来回横跳了不到十年的从业者的实操笔记不是投资建议也不是任何产品的软文。文中所有回测数字均为示意历史业绩不代表未来表现。一、先把牌桌看清楚2026 年这已经不是”要不要用”的问题了先说一个我自己都觉得有点魔幻的对比。2023 年我在组里提”我们能不能让大模型帮忙写因子代码”被一位资深研究员当场怼回来”它连groupby的时点对齐都能写错你敢用”他说得对。2026 年的今天同一位研究员每天开着 Claude Code 跑三个终端窗口。这不是个例。NVIDIA 在今年 1 月发布的第六份《State of AI in Financial Services》里调研了全球 800 多位金融从业者数据挺能说明问题65% 的受访者表示公司已在主动使用 AI而上一年这个数字是 45%73% 的高管认为 AI 对公司未来至关重要近 100% 表示 AI 预算会增加或至少持平。其中 61% 的机构在使用或评估生成式 AI42% 在使用或评估智能体agenticAI已经实际部署了 AI Agent 的占 21%。考虑到国内订阅claude确实有点困难可以参考一下这里claudemax.shop真正让我警觉的是这条89% 的受访者说 AI 已经帮公司增加了收入、降低了成本。当一个行业里近九成的人说某个工具已经产生了可量化的回报这个工具就不再是”加分项”而是”及格线”。国内这边节奏更分化。中证报今年 3 月那篇量化私募 AI Agent 调研里几个细节我印象很深头部机构已经在自建算力甚至对外溢出技术能力而中小机构受限于成本和人力多数还处在观望或轻度试用阶段老牌百亿私募鸣石基金明确表示Agent 主要用在辅助编程环节因子挖掘等核心投研仍以既有方式为主。第三方研究员的判断更直白2026 年 AI Agent 正从”炫技”走向”普及”但在量化私募领域多数机构尚未将其作为成熟的投研工具投入策略迭代与生产。这就是我写这篇文章的原因——中间那段最大的空白不在模型能力在工作流设计。而工作流设计恰恰是策略经理这个岗位的核心职责不是研究员的也不是 IT 的。海外的样本可以对照着看。Anthropic 今年 5 月 5 日在纽约那场面向金融机构的发布会上公开的客户案例里有一条数字很扎眼Walleye Capital 这家 400 人的对冲基金100% 的员工在用 Claude Code——注意是全员不只是工程团队。同时 Citadel 提到投资专业人员的工作离不开数据和分析模型Claude for Excel 正好切进了这个场景。Anthropic 一次性放出了可在 Claude Cowork、Claude Code 里作为插件使用、也可通过 Claude Platform 以 Managed Agents 方式程序化调用的一批金融 Agent 模板并接入了 FactSet、Moody’s、Morningstar 等数据源。但同一份发布材料里还有一句被很多人忽略的话我认为它比上面所有数字都重要Anthropic 在官方仓库文档里明确写着这些 Agent 只产出供合格人工审阅的草稿它们不执行交易、不批准开户、不直接写入记账系统。记住这句话。本文剩下的部分基本都是在解释这句话对策略经理意味着什么。二、认知纠偏三个”不要”在讲怎么用之前我想先把三个最常见的幻想按死。这三条我踩过两条代价都不小。不要指望它直接给你 alpha。你问”帮我找一个夏普 3 的 A 股中频因子”它会给你一个看起来很像那么回事的公式。你回测发现 IC 0.08。你很兴奋。然后你做样本外发现是 0.01。原因很简单训练语料里那些”经典因子”早就被市场消化干净了而模型生成的”新因子”本质上是在你给定的算子集合里做组合搜索——搜索能力不等于发现能力能不能发现取决于你给它的搜索空间和评价函数。评价函数是你的活儿。不要把它当交易系统的一部分。大模型有延迟、有非确定性、有速率限制还会在极少数情况下给出格式不对的输出。任何把 LLM 放进下单链路的设计——哪怕只是”让它判断一下这单要不要撤”——在我看来都是拿净值开玩笑。它属于研究侧offline不属于执行侧online。今年金融 AI 的学术综述里也是同一个判断LLM 更适合承担离线研发、语义校验、技术面解释和投研辅助的角色。不要让它”自己评估自己”。这是最隐蔽的坑我单独放到第五节讲。那它到底强在哪强在把研究员从”实现”里解放出来让研究员回到”提问”。一个策略团队真正的瓶颈从来不是想法不够是想法验证得太慢——一个假设从提出到得到干净的样本外结论过去要三天现在可以是三小时。三天变三小时意味着什么意味着你敢去验证那些”可能没用但万一呢”的假设了。研究的产出 ≈ 假设质量 × 验证吞吐Claude 打的是后面那一项而后面那一项一旦放大十倍会反过来改变你敢提什么样的假设。三、模型路由先把钱算明白策略经理是要背成本的。所以在讲流程前先讲钱。截至 2026 年 8 月Claude 的模型线和官方价目美元 / 百万 token输入/输出是这样模型定位价格上下文可靠知识截止Claude Fable 5面向长周期智能体的下一代智能10 / 50100 万2026-01Claude Opus 5复杂智能体编码与企业级工作5 / 25100 万2026-05Claude Sonnet 5速度与智能的最佳平衡3 / 158/31 前 2 / 10100 万2026-01Claude Haiku 4.5最快、接近前沿的智能1 / 520 万2025-02来源Anthropic 官方 Models overview 与 Pricing 文档。Fable 5 于 2026 年 6 月 9 日在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 上正式可用同门的 Mythos 5 是邀请制走 Project Glasswing不对外自助开通。我们组的路由规则简单到可以贴在墙上Haiku 4.5 干脏活新闻/公告/研报的批量打标、日志清洗、因子元数据抽取。这类任务量大、单条简单、可用规则复核。Sonnet 5 是主力日常写回测脚本、写数据管道、做研究问答。八成的 token 消耗在这里。Opus 5 用在硬骨头上跨十几个文件的策略重构、复杂归因分析、需要真正”想清楚”的架构决策。Fable 5 留给长周期自治任务跨库调研、多轮因子搜索、季度级复盘。它慢但在需要连续几十步不掉链子的任务上这个溢价是值的。三个必须用满的省钱杠杆Prompt caching把项目规范、因子库文档、数据字典这些不变的前缀缓存住命中后输入成本可降到基础价的 10%。量化研究的 prompt 前缀高度重复这一条的实际收益比看上去大得多。Batch API非实时任务全部走批处理输入输出各打五折。夜间跑的全市场文本打标没有任何理由走同步接口。别用大模型做小事让 Opus 去做 JSON 格式化等于开跑车送外卖。一个粗略的量级感受一个 8 人的策略团队把 Sonnet 5 当主力、缓存和批处理都开满月度 API 支出通常落在四位数人民币到低五位数区间。对比一个研究员的人月成本这个账不用算第二遍。四、把流水线拆开六段每段的人机分工都不一样这是本文的核心。我把量化研究流程拆成六段并标注了每段可以交出去多少。这张图最重要的信息是那个趋势越靠近资金人的比重越高。从代码实现的 85% 交出去一路降到风控合规的 25%。任何试图把这条曲线拉平的做法都是在给自己埋雷。① 数据与特征接入Claude 75%脏活也是最适合交出去的活。行情落库、财报对齐、另类数据清洗、时点point-in-time处理。关键做法是先给规范再给任务。在项目根目录放一个CLAUDE.md把团队约定写死# 项目约定所有代码必须遵守 ## 数据 - 所有财报数据必须使用 PIT 快照禁止使用 report_date 直接 join必须用 ann_date - 复权统一后复权因子计算前不得混用前复权 - 停牌股在因子计算日的处理置 NaN不前向填充 ## 因子 - 输出统一为 MultiIndex (date, code) 的 Seriesfloat64 - 禁止在因子函数内部做任何形式的未来信息引用 所有 rolling/shift 操作必须显式标注窗口方向 - 每个因子必须附带一个 test_name.py至少包含时点泄露测试、 停牌股测试、极端值测试 ## 禁止事项 - 不得引入新的第三方依赖除非在 PR 描述中说明理由 - 不得修改 backtest/core/ 下的任何文件这份文件的价值在于它把”资深研究员脑子里那些不成文的规矩”变成了机器可读的约束。我们组补上这个文件之后Claude 生成代码的一次通过率从大概六成提到九成以上。数据接入还有一个大杀器是MCP。把内部行情库、因子库、回测引擎包成 MCP serverClaude 就能直接查询而不是猜。海外的做法也是这个思路——Claude 已经打通了 FactSet、SP Capital IQ、MSCI、PitchBook、Morningstar、LSEG 等数据服务也可以对接内部数仓和研究库。国内团队完全可以照着做一套自己的get_bar、get_factor、run_backtest三个工具就能覆盖大部分研究场景。② 假设生成Claude 50%这一段我给的比重最尴尬——正好一半。因为它能读但不能判断值不值得读。有效的用法不是”给我一些因子想法”而是读取 ./papers/ 下 2025 年以来的 37 篇论文摘要以及 ./research/ 下我们 自己的 12 份内部报告。 任务找出那些【我们内部报告里提到过、但从未真正实现过】的假设。 对每一条输出 1. 假设的一句话表述必须是可证伪的 2. 它依赖哪些数据字段我们的库里是否都有查 MCP 的 data_catalog 3. 为什么当时没做如果报告里写了 4. 用我们现有的算子集合最小实现路径是什么 5. 你认为它失败的最可能原因是什么 不要给我任何经典因子。不要给我你在训练数据里见过的公开因子。最后两句是重点。不加限制你会收获一堆动量反转和 PB-ROE。③ 因子/策略代码实现Claude 85%交出去最多的一段也是收益最直接的一段。Claude Code 在这里的价值不是”写代码快”是”写测试快”。我的硬性要求任何因子代码必须同时产出泄露测试。而且测试要 Claude 自己先写、自己先跑实现因子 xxx。要求 1. 先写 test_xxx.py至少覆盖时点泄露、停牌处理、全 NaN 输入、 单只股票输入、极端值 2. 跑测试全绿之后再提交因子实现 3. 用 2019-2021 数据做一次冒烟回测只报告 IC 均值和 IC_IR 不要给我任何这个因子表现不错之类的评价 4. 遵守 CLAUDE.md第 3 条那句”不要给我评价”是我吃过亏之后加的。模型有很强的取悦倾向一个 IC 0.02 的因子它也能夸出花来而人是会被夸奖影响判断的。让它报数不让它下结论。④ 回测与统计检验Claude 55%从这里开始人的比重陡增。Claude 可以帮你写多重检验校正的代码、写分层分域的稳健性检查、写各种 bootstrap。但校正参数怎么设、哪个稳健性检验是决定性的、什么样的衰减算可接受这些必须是人来定而且要在看到结果之前定。我们组的规矩是因子进入检验前先在文档里写下”什么结果算通过”签字然后才跑。这条规矩跟 Claude 没关系是做量化的基本功但在 Agent 时代它的重要性乘以了十倍——因为你现在一天能测三十个因子而不是三个。⑤ 风控与合规审查Claude 25%容量、拥挤度、交易成本、行业和风格暴露、合规限制。这一段 Claude 主要做两件事把数据整理成人能看的形式以及做 checklist 式的机械核对。决策权 100% 在人手里。这不是保守这是责任归属——出了事监管不会接受”模型说没问题”这个答案。⑥ 上线与归因复盘Claude 40%灰度、监控、偏离归因。Claude 在归因这一步意外地好用给它实盘与回测的日度偏离序列让它列出所有可能的解释并按可检验性排序它经常能想到人当时想不到的角度比如某个交易日的成交量分布异常、某类股票的停复牌集中。然后——这是整条流水线上最容易被跳过、也最值钱的一步——把归因结论写回CLAUDE.md和研究文档。图 3 里那条虚线箭头就是这个意思。你的护城河不是你用了 Claude是你的CLAUDE.md里沉淀了三年的教训而别人的是空的。五、最危险的一步让 Agent 自己迭代现在说那个我认为最该单独拎出来讲的问题。让 Claude 自动迭代优化因子技术上完全可行。国内已经有公开的实验在做这件事融量科技今年 5 月做过一次六大模型的因子挖掘横向评测实验时间 2026 年 5 月平台是 AlphaMind Claude Code数据区间 2021—2026股票池中证全指标准赛制是 20 轮迭代优化。学术侧也在往这个方向走微软亚洲研究院的 RD-Agent-Quant 就是专门面向量化投研的多智能体框架覆盖从假设生成到策略回测的全链路自动化论文被 NeurIPS 2025 接收代码已开源。知乎上那篇被广泛传播的量化 Agent 综述甚至给出了一个很有画面感的推演未来可能出现”量化工厂”——持续运行的多智能体系统7×24 不间断挖掘因子、评估有效性、构建组合、执行交易。听起来很美。但请看这张图。自动迭代的真正敌人从来不是模型能力是过拟合。道理其实是老道理当你让一个系统在同一份数据上迭代 20 轮、每轮都用回测指标做选择信号时你实际上在做的是一次 20 次的多重比较。样本内 IC 会一路走高灰色虚线因为它必然走高。而样本外在某个拐点之后开始劣化橙线——系统不是在学规律是在学噪声。这个拐点在哪取决于你的数据量、算子空间和评价函数不是固定的第 7 轮。但它一定存在而且如果你不主动去找它你会在实盘上找到它。我们组的护栏清单五条缺一条就不许跑自动迭代冻结样本物理隔离。划出最近 12—18 个月数据放在 Agent 完全访问不到的地方不同的数据库账号、不同的目录权限。不是”约定不用”是真的拿不到。整个迭代过程只允许查看一次就是最后决定上不上的那一次。多重检验校正写进评价函数。用 Deflated Sharpe Ratio 或者 BH 校正把”我试了多少次”这个信息显式地扣进分数里。让 Agent 优化的目标本身就是校正后的指标而不是让它优化原始指标、你事后再校正。这两者的效果差别巨大。成本敏感性作为一票否决。每轮迭代都必须报告在 1.5 倍和 2 倍假设成本下的表现。一个只在低成本假设下成立的因子不是因子是幻觉。迭代轮次硬上限 人工中检。我们设的是 10 轮且第 5 轮必须有人看一眼中间产物。看什么看因子的经济学解释是否还站得住。如果第 5 轮的产物已经是一个套了四层嵌套、你完全说不清它在捕捉什么的怪物停。留一个”什么都不做”的对照组。每次自动迭代实验都同时记录”如果第 1 轮就停手”的结果。你会惊讶于有多少次第 1 轮的朴素版本样本外表现更好。第 4 条里那句”说不清它在捕捉什么”是我个人最看重的判据。可解释性在这里不是合规要求是过拟合探测器。一个你能用两句话讲清楚经济逻辑的因子衰减起来通常也是可预期的一个你讲不清的因子它什么时候死、怎么死你完全没有先验。六、三个月落地路线可以直接抄给还没开始的团队一个排期。这是我们实际走过的路径也踩过其中的坑。第 1 个月建地基不碰核心投研。写CLAUDE.md把团队所有不成文规矩显式化。这件事最好由最资深的研究员主导因为规矩在他脑子里。把三个最基础的内部工具包成 MCP行情查询、因子库查询、回测调用。全员用 Claude 做代码审查、文档整理、研报摘要。目标只有一个让所有人对它的能力边界形成手感——它哪里靠谱、哪里会一本正经地胡说。第 2 个月接管实现层。因子实现、回测脚本、数据管道全面交给 Claude Code人只写规范和审代码。建立”因子必带测试”的硬规矩测试不过不进库。开始记录每个因子从假设到结论花了多少时间。这个数字是你后面向老板证明 ROI 的唯一依据。第 3 个月谨慎试探迭代。选一个已经死掉的老因子做自动迭代实验。为什么选死的因为它没有商业价值你可以放心地把它玩坏而且你知道正确答案是”它应该继续是死的”。如果你的 Agent 把一个死因子”救活”了那你的护栏有问题。五条护栏全部就位后才允许在活的因子上跑。永远不做的事把实盘持仓、成交明细、客户信息发给任何外部 API。合规上不允许商业上更不明智。如果确实需要用真实持仓做分析走企业版的零数据保留ZDR协议或者走 Bedrock / Vertex AI 的私有部署通道并且事先过法务和合规。这条没有商量余地。七、几个反直觉的教训最后说几个我自己撞出来的都是些看起来不重要、实际上很要命的东西。教训一最大的产能提升不在写代码在写测试。大部分人第一反应是用 AI 加速写因子。但因子代码本来也就几十行快不了多少。真正的变化是你现在敢给每个因子配二十个测试用例了——过去没人愿意花那个时间。代码质量的提升比代码速度的提升值钱得多。教训二模型的”顺从”是最大的风险源。你说”我觉得这个因子在小盘股上应该更有效”它大概率会帮你找到支持这个说法的证据。这不是它在骗你是它在配合你。对策永远让它同时论证正反两面或者干脆用两个独立会话一个论证成立、一个论证不成立你自己当裁判。教训三不要让它记住太多上下文。100 万 token 的上下文很诱人但一个塞满了前二十轮失败尝试的会话会带着强烈的路径依赖。该开新会话就开新会话。我的经验法则是每完成一个完整假设的验证无论成败都重开。教训四给它工具别给它答案。与其在 prompt 里贴一堆数据让它分析不如给它一个 MCP 工具让它自己查。前者它会在数据上产生幻觉后者它会诚实地告诉你查不到。教训五策略经理的角色变了而且是往上变。过去你的核心竞争力可能是”我知道怎么把这个想法实现出来”现在实现这件事的门槛塌了。新的竞争力是你知道该验证什么、什么样的证据算数、以及在哪里停手。这三样模型给不了你而且短期内也看不到它能给的迹象。八、写在最后回到开头那句被很多人忽略的话这些 Agent 只产出供合格人工审阅的草稿。我认为 2026 年这一轮真正的分水岭不在于谁的模型更好——大家用的模型其实都差不多。分水岭在于谁把”人在哪里签字”这件事想清楚了。想清楚了的团队Claude 是一个把研究吞吐放大数倍的杠杆。没想清楚的团队它是一个把过拟合速度也放大数倍的杠杆。杠杆是中性的。方向是你给的。参考资料Anthropic,Models overview/Pricing,Agents for financial services2026-05-05Anthropic,Deploying Claude across financial servicesNVIDIA,State of AI in Financial Services: 2026 Trends2026-01-22 发布800 从业者调研中国证券报《量化私募 AI Agent 落地调查投研”自动驾驶”驶入深水区》2026-03-30融量科技《六大国产大模型量化因子挖掘横向评测》2026-05国联民生金工《AI 投研新范式2026 年 AAAI 与 ICLR 前沿论文综述》2026-07Microsoft Research Asia,RD-Agent-QuantNeurIPS 2025