量化概念 02:IC 怎么算
IC 怎么算:每天横截面算一次相关,再对时间取平均;Rank IC 只比名次不比分数;0.02~0.05 就算可用。
IC 怎么算:每天横截面算一次相关,再对时间取平均;Rank IC 只比名次不比分数;0.02~0.05 就算可用。
IC(信息系数)是什么:因子给股票排的名次,和未来真实涨幅的名次,有多吻合?做量化要搞懂的第一个概念。
跑得快实录:profiling 实测 50 票纯计算不到 1 秒、全市场外推 30 秒——按决策表 Rust 取消、分区存储和 tj-web 推迟,三个大复杂度全部缓刑;把「什么时候优化」写成可对照的触发阈值。
跑得稳实录:任务表让跑批可追溯,调度写进代码不依赖宿主 cron(Docker/本地同构),备份先做、告警克制,以及「机制就绪不等于验证完成」的诚实边界。
跑得准实录:样本扩到 50 只后发现回测里 +300% 的假收益——真实价撮合在除权日权益跳变,账户换后复权口径;补全数据校验,IC 验证动量 20 日在 10/20 日窗口显著为正。
能跑阶段实录:契约先行防返工,接口文档和实际的落差,复权因子校验被真实数据推翻,验证逼出三个 bug,以及「10 万买不起一手茅台」的资金约束教训。
开工前我把设计做到了 v0.6,拆成四份文档,然后发现自己违背了刚写完的《架构不是设计出来的》:一行代码没写,却在讨论"怎么写对"。复盘哪些设计该留、哪些是阶段前移,以及如何用四阶段路线图补救。
量化投资的核心是数据加因子加策略:数据是原料,因子是加工,策略是决策。数据越多、类型越丰富,直觉上策略应该越准——信息越全,判断越准,这符合常识。 但常识不等于正确。在量化里,数据多和策略好之间,隔着一道看不见的墙。 精确的模糊 vs 模糊的精确 给一张图片不断加像素,画面越来越清晰,这是分辨率提升
量化投资的核心是因子。因子是把选股逻辑翻译成一个可计算的数字,买入因子得分高的,卖出得分低的,回测看结果。这套流程表面上是数学,但背后有个更深层的问题:因子凭什么能工作? 因子不是真理,是假设 因子有效的前提,是市场存在可以被利用的规律。但如果市场完全有效,所有信息都即时反映在价格里,任何因子都没用
量化的本质是数据加因子加策略,数据质量决定策略的下限。但个人量化最容易被忽视的陷阱,是把策略研究变成工程量——建库、爬虫、维护数据源,本末倒置。自建数据源的坑还在其次,数据源怎么选,标准只有一个:这笔钱,赚得回来吗?