AI 研究员真的能发现 Alpha 吗?Qlib 与 RD-Agent 的六道闸门
能生成因子只是生产力,能证明因子不是幻觉才是研究力。
- Qlib 不是自动赚钱工具,是量化实验室的基础设施
- RD-Agent 不制造真理,只降低提出和验证候选想法的成本
- 未来函数藏在复权方式和成分股名单里,不在显眼代码里
- 人一天测十个想法靠自觉,AI 一天测一千个只能靠制度
- 奖励函数写成回测收益,自动化越强,过拟合越快
- 六 道闸门:数据审计 → 研究集 → 独立 OOS → walk-forward → 组合与成本 → 仿真实盘
大多数 AI 量化项目输在流程,不是想法
一个研究员可能三天就想出一个因子,却要花三个月确认数据有没有泄露、结果是不是偶然、扣掉成本还剩多少。这三个月绝大部分时间不在创造,而在排除错误。
市面上那些让几个 agent 争论多空、或者自动生成漂亮回测曲线的项目,跳过的正是这三个月。它们看起来聪明,但没法严肃做实验——实盘和回测之间的落差,几乎全部来自这段被跳过的流程。
Qlib 解决的是流水线问题
Qlib 的价值不是预测得更准,而是把量化研究从一堆容易失控的 notebook 变成标准化、可复现的实验流程:数据怎么读、特征怎么表达、标签怎么定义、模型怎么训练、预测怎么转成持仓、收益回撤换手怎么算,每个环节都有固定接口。
理解它之前得先分清一件事:机器学习选股学的不是「这家公司好不好」,而是「这些特征能不能对未来 横截面 收益的排序提供一点稳定信息」。 横截面是在同一时间点比较很多股票,时间序列是研究同一资产在不同时间的变化。两者的数据结构、验证方式、组合方法完全不同,很多公开项目把它们混在一起,最后结果根本没法解释。
平台完整不代表实验天然正确。三道关卡决定了结果可不可信。
第一关:point-in-time
一家公司 3 月底发布的年报,1 月份的模型不能提前看到。听起来简单,但现实里还有财报修订、指数成分调整、退市股票。如果回测只使用今天整理好的最终数据库,就会无意中把未来信息带回过去。
它通常不是一行显眼的代码,而是藏在复权方式里、藏在财务数据对齐里、藏在用今天的成分股名单去回测十年前。专业研究的第一目标不是更高收益,而是确保策略只能看到当时可得的信息。
第二关:特征和标签的定义
同一个动量因子,可以是过去 20 日收益,也可以排除最近 5 日,还可以做行业中性和市值中性。定义稍微一变,结果可能完全不同。标签同理——预测绝对收益、超额收益还是排名,决定了模型到底在学什么。
特征工程不是越多越好,而是越干净越好。很多漂亮回测本质上只是「定义游戏」的结果,换个标签定义,曲线就变了。
第三关:评估指标测的是什么
| 指标 | 含义 | 局限 |
|---|---|---|
| IC | 因子值与未来收益的相关性 | 对极端值敏感 |
| RankIC | 比较排序关系 | 丢掉幅度信息 |
| ICIR | 平均 IC 除以其波动,衡量稳定性 | 不反映可交易性 |
IC 好看不等于组合赚钱。它可能只在小市值股票里有效,可能伴随极高换手,也可能与已有因子高度重复。最终要看的是分组收益、行业与风格暴露、换手率、容量、回撤,以及扣成本后的表现。
RD-Agent 是研究助理,不是先知
如果 Qlib 是实验室,RD-Agent 更像自动研究助理:读研究材料、提出候选假设 、生成代码、跑实验、根据结果继续修改。过去研究员手动完成的「想法 → 编码 → 实验 → 复盘」循环,有机会被大幅加速。
比如系统读到一篇关于短期反转与流动性的论文,可能提出这样一个组合特征:当价格短期下跌、成交冲击上升、但长期趋势仍然稳定时,反转是否更强?接着它生成表达式,在统一数据上测试,把结果写进实验记录。
配套论文 R&D-Agent-Quant(NeurIPS 2025)给出的数据是:年化收益最高达到经典因子库的 2 倍,同时使用的因子数量减少约 70%。这个提升的来源不是 AI 凭空制造了真理,而是提出和验证候选想法的单位成本下降了。
规模化搜索会反噬
一个人一天测十个想法,研究纪律还能靠人工维持。AI 一天测一千个想法,如果没有更严格的验证系统,它很快会变成一台自动寻找历史巧合的机器。
模型不会天然敬畏样本外。你奖励它回测收益,它就会不断逼近历史数据里的缝隙。目标函数写错了,自动化程度越高,错误扩散得越快。
六道闸门
正确的组合方式不是「AI 生成因子 → 回测赚钱 → 立刻实盘」,而是分层设闸。
- 数据审计:股票池、复权、财务发布时间、停牌与退市样本,确认没有幸存者偏差和未来数据。
- 研究集:AI 可以在这里大量提出和淘汰想法, 但每次试验都要留痕——假设来源、参数范围、测试次数、失败结果。只保存成功案例,会让团队严重低估数据挖掘的成本。
- 独立 OOS:这段区间在最终检验前不能反复参与调参,否则它会从考卷变成另一份练习题。
- walk-forward:只用过去训练,在未来一段时间运行,再向前滚动。更接近真实交易中不断更新模型的过程,也能暴露市场状态变化带来的衰减。
- 组合与成本:把预测排序变成仓位,加上行业、市值、单票权重和风险预算约束,再用合理的点差、佣金、滑点和市场冲击假设。很多纸面 alpha 进入这一层就消失了。
- 仿真实盘:让策略在实时数据上只记录、不下真单,观察信号延迟、数据缺失、调仓稳定性和实际可成交价格。研究结果和工程结果都稳定,才谈得上小规模上限。
回测不是答案,而是策略接受审讯的第一间房间。好的研究平台让错误更早暴露。
人类研究员的位置
回到最初的问题:AI 研究员能发现 alpha 吗?能,但前提是先建立一套不被好看结果诱导的流程。
研究自动化之后,人的价值不会消失,只会从「写每一行代码」转向设计问题、设定证伪标准、审计数据、决定风险边界。这四件事目前没有任何自动化流程能替你做。
References
- Qlib+RD-Agent深度拆解:AI研究员真的能发现Alpha吗?量化研究平台与自动研究流程全解析 —— ApexQuant顶点量化
- R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization —— Li et al., NeurIPS 2025
- microsoft/qlib —— Microsoft Research Asia
- microsoft/RD-Agent —— Microsoft Research Asia