加载中...
Forest through the Trees: Building Cross-Sections of Stock Returns
我们针对给定的公司特征集构建资产收益的横截面,即作为检验资产的管理组合,以及可交易风险因子的构建模块。我们使用决策树,通过选择最优组合划分以张成投影在个股上的随机贴现因子,从而将相似股票内生地分组在一起。我们的组合具有可解释性和充分分散化,反映了众多特征及其交互作用。与数十个(甚至数百个)单一/双重排序的组合以及基于机器学习预测的组合相比,我们的横截面维度低,但样本外夏普比率和阿尔法高出多达三倍。
Abstract
We build cross-sections of asset returns for a given set of characteristics, that is, managed portfolios serving as test assets, as well as building blocks for tradable risk factors. We use decision trees to endogenously group similar stocks together by selecting optimal portfolio splits to span the stochastic discount factor, projected on individual stocks. Our portfolios are interpretable and well diversified, reflecting many characteristics and their interactions. Compared to combinations of dozens (even hundreds) of single/double sorts, as well as machine-learning prediction-based portfolios, our cross-sections are low-dimensional yet have up to three times higher out-of-sample Sharpe ratios and alphas.
AP Trees样本外夏普比率最高提升3倍
基于三个特征的36个横截面中,AP Trees(40个组合)实现的月度样本外夏普比率相比传统三重排序(32/64组合)和横截面特定因子(XSF)高出多达三倍,表明传统排序未能充分跨越SDF,遗漏了重要的资产定价信息。
传统排序未跨越SDF导致遗漏变量偏误
论文提出命题1,证明若检验资产未跨越SDF,即使模型完美定价该横截面,仍可能是对定价个股的条件SDF的严重误设。AP Trees与三重排序的夏普比率差异为传统模型的潜在误定价提供了上界。
特征交互效应贡献约一半的SDF夏普比率
移除所有跨特征交互节点后,AP Trees的样本外夏普比率平均下降约一半,证明特征间交互效应是AP Trees优于传统排序的核心驱动力。传统双重/三重排序无法有效捕捉这些复杂交互。
AP Trees优于深度学习与随机森林预测组合
基于Gu, Kelly, and Xiu(2020)最佳深度学习模型和随机森林预测构建的十分位组合,其样本外夏普比率仅为AP Trees的一半左右。表明纯收益预测目标不适合构建跨越SDF的检验资产,需要资产定价目标函数引导。
20-30个AP Tree组合即可跨越大部分SDF
在基于10个特征的大维度横截面中,AP Trees仅需约20-30个组合即可实现大部分SDF跨越性能,而传统方法需要数百个组合。AP Trees相对25×9双重排序组合的夏普比率提升约0.1(相对提升约20%),相对异常十分位组合提升80%-100%。
核心解释变量
公司特征:规模(LME)、账面市值比(BEME)、动量(r12_2)、盈利能力(OP)、投资(Investment)、异质波动率(IdioVol)、换手率(Lturnover)、短期反转(ST_Rev)、长期反转(LT_Rev)、应计(AC),共10个特征,构建决策树时每次选择三个特征进行条件排序。
被解释变量
股票超额收益率(个股超额收益作为被解释变量),通过管理组合(AP Tree节点)的收益构建随机贴现因子(SDF),以样本外夏普比率和SDF阿尔法作为主要评价指标。
样本与数据
使用CRSP/Compustat标准数据,样本期为1964年1月至2016年12月,共53年月度观测。公司特征数据来自Kenneth French Data Library。训练样本为前20年(1964-1983),验证样本为接下来10年(1984-1993),测试样本为最后23年(1994-2016)。
识别方法 / 模型设定
核心识别策略为通过决策树构建条件排序组合(AP Trees),选择同时包含最终节点和中间节点的组合集,运用LASSO进行稀疏选择(AP Pruning),并在均值和方差上进行稳健收缩(均值收缩λ0和方差收缩λ2),以样本外夏普比率最大化为目标函数跨越SDF。使用滚动窗口和交叉验证方法检验时变SDF权重。
内生性及稳健性检验
论文进行了多项稳健性检验:(1)排除极端小市值股票(规模分位数低于0.4)后结果稳健;(2)仅使用市值大于总市场0.01%的流动股票(约600只最大股票)后AP Trees仍优于三重排序;(3)使用三重交叉验证方法;(4)使用RP-PCA潜在因子进行跨越测试;(5)时变权重滚动窗口估计;(6)不同收缩参数设定下结果稳健;(7)排除单一特征极端节点以避免微盘股驱动。
更多相关数据正在补充