量化概念 14:过拟合与样本外(回测越漂亮,越要警惕)
过拟合(overfitting)= 把历史数据里的噪声当规律背下来,参数搜索和因子挖掘是两大温床。防法核心:样本外验证(out-of-sample)——开发时不碰、最后一次性跑,看过一次就变样本内。样本内 40% 配样本外 5%,先怀疑过拟合。
「2026-08」的文章 清除筛选
过拟合(overfitting)= 把历史数据里的噪声当规律背下来,参数搜索和因子挖掘是两大温床。防法核心:样本外验证(out-of-sample)——开发时不碰、最后一次性跑,看过一次就变样本内。样本内 40% 配样本外 5%,先怀疑过拟合。
beta(β)= 持仓对大盘的敏感度,是"在场"的代价;alpha(α)= 扣掉 beta 贡献后自己赚的部分,才是选股/择时的本事。例:大盘涨 20%、策略涨 25%、beta 1.2 → alpha 只有 1%。牛市里的漂亮曲线可能是 beta 撑的,熊市才检验 alpha。
把多个因子合成一个选股信号:先各自清洗统一到一把尺子,再按权重(等权或按 IC/ICIR)加总,最后按综合分排序。三个坑:方向、重复、权重过期。
量化投资的核心是数据加因子加策略:数据是原料,因子是加工,策略是决策。数据越多、类型越丰富,直觉上策略应该越准——信息越全,判断越准,这符合常识。 但常识不等于正确。在量化里,数据多和策略好之间,隔着一道看不见的墙。 精确的模糊 vs 模糊的精确 给一张图片不断加像素,画面越来越清晰,这是分辨率提升
量化投资的核心是因子。因子是把选股逻辑翻译成一个可计算的数字,买入因子得分高的,卖出得分低的,回测看结果。这套流程表面上是数学,但背后有个更深层的问题:因子凭什么能工作? 因子不是真理,是假设 因子有效的前提,是市场存在可以被利用的规律。但如果市场完全有效,所有信息都即时反映在价格里,任何因子都没用
量化的本质是数据加因子加策略,数据质量决定策略的下限。但个人量化最容易被忽视的陷阱,是把策略研究变成工程量——建库、爬虫、维护数据源,本末倒置。自建数据源的坑还在其次,数据源怎么选,标准只有一个:这笔钱,赚得回来吗?