【量化系统从0到1】存储架构:不选择什么,比选择什么更重要
个人量化系统的存储选型:先刻画数据特征,再推导方案——行情/因子用 parquet、财务/任务用 SQLite、元数据用 JSON。不选择什么比选择什么更重要:DuckDB、PostgreSQL 被排除的理由,以及它们的触发条件。
个人量化系统的存储选型:先刻画数据特征,再推导方案——行情/因子用 parquet、财务/任务用 SQLite、元数据用 JSON。不选择什么比选择什么更重要:DuckDB、PostgreSQL 被排除的理由,以及它们的触发条件。
幸存者偏差(survivorship bias):用"现在还活着"的样本回测历史,把退市/破产/被并购的股票排除——它们往往亏得最惨。例:90 只 +50% 与 10 只 -90%,只看幸存者 +50%,真实平均 +36%。方向固定只高估。避免:样本含退市股、历史时点用当时存在的股票。
除权除息让 K 线留下"断崖",不是暴跌而是价格调整。三种价格三种用途:看盘不复权、看图前复权、算收益/做因子/跑回测一律后复权——后复权历史固定,前复权历史被未来的分红不断改写,等于偷看未来。
量化投资的核心是数据加因子加策略:数据是原料,因子是加工,策略是决策。数据越多、类型越丰富,直觉上策略应该越准——信息越全,判断越准,这符合常识。 但常识不等于正确。在量化里,数据多和策略好之间,隔着一道看不见的墙。 精确的模糊 vs 模糊的精确 给一张图片不断加像素,画面越来越清晰,这是分辨率提升