量化概念 08:T+1 与涨跌停(回测和实盘的第一个落差)
T+1 和涨跌停是回测最容易忽略的两个制度规则。三个坑:用 T 日收盘价成交等于偷看未来(应为 T+1 开盘成交)、涨停买不进回测却以为买到了(收益虚高)、跌停卖不出回测却以为止损了(回撤虚低)。
T+1 和涨跌停是回测最容易忽略的两个制度规则。三个坑:用 T 日收盘价成交等于偷看未来(应为 T+1 开盘成交)、涨停买不进回测却以为买到了(收益虚高)、跌停卖不出回测却以为止损了(回撤虚低)。
做了快十年,经手的项目从几十行脚本到几十万行系统都有。有一个问题一直绕不开:复杂度到底从哪来的? 不是「为什么会有复杂度」——那个答案太简单:问题本身有复杂度,解决它就得付出复杂度。真正的问题是:为什么很多系统的复杂度,比它要解决的问题大得多?多出来的那一部分是谁加的、什么时候加的、怎么避免?
除权除息让 K 线留下"断崖",不是暴跌而是价格调整。三种价格三种用途:看盘不复权、看图前复权、算收益/做因子/跑回测一律后复权——后复权历史固定,前复权历史被未来的分红不断改写,等于偷看未来。
从 50 只 demo 到全市场生产,一个数据拉取功能长出了八套机制。回看演进链:规模 → 数据量 → 真实数据 → 失败 → 速度 → 成本 → 并发 → 接口限流 → 内存,每一层的解决都打开下一层。调用量靠估算暴露、内存靠崩溃、失败靠事故、并发靠推演、成本靠习惯、接口限流靠拒绝——demo 是单次的、小规模的、理想环境的,它把"功能正确"之外的所有维度都屏蔽了。
从雕版到活字为什么等了三四百年?材料、规模、工艺链三道门槛叠加,活字等的不是技术而是整个社会到了能支撑模块化的程度。用同样的视角看 AI 和机器人:模块化不是终点,模块化之后谁用得起、谁掌握最关键的那一环才是。
把多个因子合成一个选股信号:先各自清洗统一到一把尺子,再按权重(等权或按 IC/ICIR)加总,最后按综合分排序。三个坑:方向、重复、权重过期。
评估一个因子,四个问题:准不准(IC)、稳不稳(ICIR)、单调不单调(分层回测)、能管多久(衰减)、重复不重复(相关性)。
因子是数据的加工品,原料里有四类"脏":极端值、量纲不一、混入他因、重复信息。去极值、标准化、中性化、正交化四步怎么洗,以及清洗里的坑。
IC 怎么用:筛因子、比因子、定权重、看衰减、盯失效;以及平均 IC 会说谎、只测排序不测赚钱、历史不等于未来三个坑。
IC 怎么算:每天横截面算一次相关,再对时间取平均;Rank IC 只比名次不比分数;0.02~0.05 就算可用。