【量化系统从0到1】存储架构:不选择什么,比选择什么更重要
个人量化系统的存储选型:先刻画数据特征,再推导方案——行情/因子用 parquet、财务/任务用 SQLite、元数据用 JSON。不选择什么比选择什么更重要:DuckDB、PostgreSQL 被排除的理由,以及它们的触发条件。
个人量化系统的存储选型:先刻画数据特征,再推导方案——行情/因子用 parquet、财务/任务用 SQLite、元数据用 JSON。不选择什么比选择什么更重要:DuckDB、PostgreSQL 被排除的理由,以及它们的触发条件。
幸存者偏差(survivorship bias):用"现在还活着"的样本回测历史,把退市/破产/被并购的股票排除——它们往往亏得最惨。例:90 只 +50% 与 10 只 -90%,只看幸存者 +50%,真实平均 +36%。方向固定只高估。避免:样本含退市股、历史时点用当时存在的股票。
过拟合(overfitting)= 把历史数据里的噪声当规律背下来,参数搜索和因子挖掘是两大温床。防法核心:样本外验证(out-of-sample)——开发时不碰、最后一次性跑,看过一次就变样本内。样本内 40% 配样本外 5%,先怀疑过拟合。
beta(β)= 持仓对大盘的敏感度,是"在场"的代价;alpha(α)= 扣掉 beta 贡献后自己赚的部分,才是选股/择时的本事。例:大盘涨 20%、策略涨 25%、beta 1.2 → alpha 只有 1%。牛市里的漂亮曲线可能是 beta 撑的,熊市才检验 alpha。
夏普比率(Sharpe Ratio)= 每单位波动换来的超额收益,回答"值不值";最大回撤(Maximum Drawdown)= 净值从峰值到谷值的最大跌幅,回答"疼不疼"。回撤不对称:跌 20% 要涨 25% 回本,跌 50% 要涨 100%。两个数比年化收益更能说明策略质量。
除权除息让 K 线留下"断崖",不是暴跌而是价格调整。三种价格三种用途:看盘不复权、看图前复权、算收益/做因子/跑回测一律后复权——后复权历史固定,前复权历史被未来的分红不断改写,等于偷看未来。
把多个因子合成一个选股信号:先各自清洗统一到一把尺子,再按权重(等权或按 IC/ICIR)加总,最后按综合分排序。三个坑:方向、重复、权重过期。
评估一个因子,四个问题:准不准(IC)、稳不稳(ICIR)、单调不单调(分层回测)、能管多久(衰减)、重复不重复(相关性)。
因子是数据的加工品,原料里有四类"脏":极端值、量纲不一、混入他因、重复信息。去极值、标准化、中性化、正交化四步怎么洗,以及清洗里的坑。
IC 怎么用:筛因子、比因子、定权重、看衰减、盯失效;以及平均 IC 会说谎、只测排序不测赚钱、历史不等于未来三个坑。