量化研究数据入门:从行情到因子
引言
量化投资的核心逻辑在于,通过系统性的数据分析,发掘市场中隐藏的规律与定价偏差,并以此构建可执行、可重复的投资策略。在这一过程中,数据是驱动整个研究流程的根基——数据的质量、维度与颗粒度,直接决定了策略的上限。对于初入量化研究领域的从业者而言,理解数据的层级结构、掌握各类数据的应用场景,是迈向策略构建的第一步。本文将从量化研究的基础数据出发,系统梳理行情数据、财务数据与因子数据的核心特征与实践要点,帮助读者建立起从原始数据到有效因子的认知框架。
一、行情数据:策略研究的底层坐标
行情数据是量化策略最基础、最直接的数据类型。它记录了证券市场交易活动的实时与历史轨迹,是所有技术分析和趋势跟踪策略的核心输入。
1.1 数据粒度与结构
按照采样频率由低到高,行情数据可分为日线数据、分钟线数据与Tick逐笔数据。其中,日线OHLCV(即开盘价Open、最高价High、最低价Low、收盘价Close、成交量Volume)是实践中最常用、覆盖最广的数据形态。这五个字段构成了绝大多数技术指标(如移动平均线、布林带、相对强弱指标)的计算基础。
日线数据的优势在于其普适性与稳定性——它消除了日内噪声,能较好地反映标的资产的中长期趋势。对于中低频策略(如日频调仓的多因子模型)而言,高质量、长时间序列的日线数据足以支撑大部分研究需求。
1.2 数据质量与来源
现实中的行情数据往往面临停牌、除权除息、数据缺失等问题。若不经清洗直接使用,将导致回测结果严重失真。除权除息会对股价产生非市场因素的跳变,因此在使用历史价格计算收益率时,必须采用后复权价格进行修正,以确保相邻交易日之间的价格变动纯粹反映市场交易行为。
以玉钺数据湖为例,其提供的A股全市场日线数据覆盖了自1990年交易所成立至今的全部历史区间。长达三十余年的时间序列,为检验策略在不同市场环境(牛市、熊市、震荡市)中的表现提供了充分的数据支持。
二、财务数据:基本面研判的依据
如果说行情数据回答的是“发生了什么”,那么财务数据则试图解释“为什么发生”。财务数据来源于上市公司定期披露的财务报告,是基本面分析和价值类因子构建的核心素材。
2.1 三大报表及其衍生指标
财务数据的骨架由资产负债表、利润表与现金流量表构成。这三张报表分别从资产状况、经营成果与现金流质量三个维度刻画企业的经营全貌。
然而,原始报表数据难以直接用于跨公司比较(因为规模不同),因此研究实践中更常用的是经过标准化处理的衍生财务指标。例如:
- ROE(净资产收益率) = 净利润 / 平均股东权益,衡量股东资本的利用效率。
- 资产负债率 = 总负债 / 总资产,反映企业的财务杠杆与偿债风险。
这些衍生指标将原始财务报表中的绝对值转化为可比的相对值,使研究者能够在不同市值、不同行业的公司之间进行横向比较。
2.2 财务数据的使用难点
使用财务数据时需要特别注意两个问题:时效性与可比性。
财务报告按季度披露,且存在明显的滞后性(年报披露截止日为次年4月30日)。在进行回测时,必须严格使用当时已发布的财报数据,避免“未来数据”的渗透,否则会夸大策略的实际表现。此外,不同行业的企业在财务特征上天然存在巨大差异(如银行业的高杠杆与软件行业的高毛利率),在构建因子时通常需要在行业内进行标准化处理,或采用行业中性化方法消除行业偏差。
三、因子数据:从原始信息到投资信号
因子是将原始数据转化为投资决策依据的桥梁。一个有效的因子,应当能够对股票未来的超额收益具有预测能力。根据底层数据来源的不同,因子可以划分为多种类型。
3.1 因子分类框架
实践中常用的因子大致可归为以下几类:
- 价值因子:以PE(市盈率)、PB(市净率)为代表,核心逻辑是寻找价格低于内在价值的低估标的。价值因子在长期维度上被全球多个市场验证有效,但其短期表现往往与市场风格切换密切相关。
- 动量因子:以过去20日收益率(或称短期反转因子)为代表,捕捉资产价格趋势的延续性。动量效应与反转效应在不同时间窗口下交替出现,是行为金融学在市场中的重要体现。
- 质量因子:以ROE、毛利率为核心,筛选盈利能力强、经营稳健的公司。质量因子在防御型策略中尤为受到重视。
- 成长因子:以营业收入同比增速、净利润同比增速为代表,捕捉企业快速扩张带来的投资机会。成长风格在流动性宽松、产业趋势明确的阶段往往表现突出。
3.2 因子的评价与筛选
并非所有逻辑合理的因子都能在实盘中产生稳定的超额收益。一个因子需要经过严格的统计学检验才能被纳入策略体系,常用的评价指标包括:
- IC(信息系数):因子值与下一期收益率之间的相关系数,衡量因子的预测方向是否准确。
- IR(信息比率):IC的均值除以标准差,反映因子预测效果的稳定性和可持续性。
- 分组回测收益率:按因子值将股票分组后观察各组收益率的单调性,验证因子是否具有区分能力。
在实践层面,因子的研究与迭代是一个动态过程。研究者往往需要从数据湖中提取数十甚至上百个原始字段,经过清洗、对齐、标准化、中性化等一系列加工步骤,最终生成可用的因子数据。这一过程对数据的获取效率与计算资源都提出了较高要求。
四、数据基础设施与研究实践
在明晰了各类数据的基本属性之后,研究者面临的现实问题是:如何高效地获取和管理这些数据?传统的做法是自行搭建数据仓库,从多个数据源分别抓取行情、财报、公司行为等数据,再进行时间戳对齐与去重清洗。这一过程耗时耗力,且容易因数据源之间的口径差异而引入错误。
现代量化研究平台倾向于提供一体化数据服务,将多源数据整合为统一的数据湖。以玉钺数据湖为例,其不仅提供全历史维度的日线行情数据,还同步提供标准化的财务数据和因子数据。研究者可以通过统一的数据接口进行查询与下载,将主要精力集中于策略逻辑的探索,而非数据清洗的重复劳动。
结论
从行情数据到财务数据,再到因子数据的加工与评价,量化研究的每一环节都离不开对数据特性的深刻理解。日线OHLCV为策略提供了时空坐标,三大报表及其衍生指标揭示了企业的基本面价值,而价值、动量、质量、成长等因子的构建则是对原始信息进行信号化提炼的关键步骤。
对于初入量化研究领域的数据从业者而言,建议从以下路径切入实践:首先,利用数据湖或类似平台浏览可用数据表,熟悉数据结构与字段含义;其次,选取一个经典因子(如PB或ROE)进行复现,完整经历数据提取、清洗、因子计算与回测的全流程;最后,在此基础上逐步拓展因子库,探索多因子组合与风险控制的优化空间。数据是量化研究的水源,而清晰的数据认知与扎实的数据处理能力,则是从中掘取价值的根本工具。