加载中...
War Discourse and the Cross Section of Expected Stock Returns
基于媒体新闻报道文本分析构建的战争相关因子模型能够解释预期股票收益的横截面。采用半监督主题模型从跨度160年的700万篇《纽约时报》报道中提取话语主题,战争因子能够预测由传统和机器学习构建技术衍生的测试资产以及138个异象组合的收益横截面。研究发现与以下解释一致:能够对冲战争风险的资产获得较低风险溢价,或对战争前景更敏感的资产被更高估。战争因子的收益溢价在标准效应之外具有增量信息。
Abstract
A war-related factor model derived from textual analysis of media news reports explains the cross section of expected stock returns. Using a semi-supervised topic model to extract discourse topics from 7,000,000 New York Times stories spanning 160 years, the war factor predicts the cross section of returns across test assets derived from both traditional and machine learning construction techniques, and spanning 138 anomalies. Our findings are consistent with assets that are good hedges for war risk receiving lower risk premia, or with assets that are more positively sensitive to war prospects being more overvalued. The return premium on the war factor is incremental to standard effects.
战争因子载荷显著为负,可预测股票收益横截面
以138个Hou-Xue-Zhang多空异象组合为测试资产,WarFac的月度收益溢价为-1.33%,t值为-2.87,在1%水平显著。资产对战争风险敏感性越高,预期收益越低,符合灾难风险对冲或行为高估的解释。
战争因子在机器学习非线性组合上表现最优,单因子R²达62%
以Bryzgalova等(2023)360个机器学习非线性组合为测试资产,WarFac单因子模型横截面R²为62%,高于FF6的41%、M4的40%、DHS的35%和Q5的58%,且共同定价误差不显著。
加入战争因子后主流因子模型定价误差大幅下降
在机器学习非线性组合上,FF6、M4、DHS、Q5的平均截距为3.3%,加入WarFac后降至0.5%,且统计上不显著,表明战争因子包含主流模型未捕捉的定价信息。
战争风险溢价独立于其他尾部风险与不确定性指数
控制NVIX战争、地缘政治风险(GPR)以及CAPM beta、熊市beta、下行beta、跳跃beta、尾部beta等尾部风险因子后,WarFac的负收益溢价依然显著,说明战争风险是独立的定价风险来源。
非监督LDA战争因子无定价能力,sLDA优势明显
使用Bybee等(2024)非监督LDA主题构造的战争因子在单变量和多元检验中均无显著收益溢价,而sLDA构建的WarFac在所有测试资产上均产生显著负溢价,表明半监督方法在避免前视偏差和捕捉语义变化上更优。
核心解释变量
战争因子(WarFac):基于《纽约时报》1871-2019年700万篇文章,运用半监督LDA(sLDA)提取战争话语主题权重,经滚动AR(1)回归取残差构建;亦使用其模拟组合WMP作为交易因子。
被解释变量
测试资产组合的月度超额收益,包括138个HXZ多空异象组合、1372个HXZ单变量排序组合、904个CZ单变量排序组合、360个机器学习非线性组合、128个自建多空组合以及2190个自建非线性组合。
样本与数据
新闻文本为1871-2019年《纽约时报》约700万篇文章;资产定价测试样本为1926-2018年(行业组合)和1972年7月-2016年12月(特征组合),共532个月。
识别方法 / 模型设定
采用标准两阶段横截面资产定价检验:第一阶段时序回归估计因子载荷,第二阶段横截面回归估计因子收益溢价;使用Shanken(1992)校正t统计量;通过控制变量、模拟组合、三阶段检验及因子识别协议进行稳健性验证。
内生性及稳健性检验
通过改变种子词(单种子词、五种种子词、加入自然灾害与流行病主题)、主题数量(1-50个非种子主题)、非监督LDA对比、ARMA(1,1)残差、替换测试资产、控制其他尾部风险与不确定性指数、Giglio和Xiu(2021)三阶段检验、Pukthuanthong等(2019)因子识别协议、WMP跨越检验等多种方式验证结果稳健性。
更多相关数据正在补充