加载中...
Business News and Business Cycles
我们提出一种通过商业新闻文本分析来度量经济状态的方法。基于1984年至2017年间《华尔街日报》约80万篇文章的全文,我们估计了一个主题模型,将商业新闻归纳为可解释的主题类别,并量化每个主题在不同时期所获得的新闻关注度比例。新闻关注度密切跟踪广泛的经济活动,并能够预测股票市场总体回报。文本增广向量自回归表明新闻文本在预测宏观经济动态方面具有显著的增量作用。我们进一步提取了支撑市场与商业周期预测改善的叙事内容。
Abstract
We propose an approach to measuring the state of the economy via textual analysis of business news. From the full text of 800,000 Wall Street Journal articles for 1984 to 2017, we estimate a topic model that summarizes business news into interpretable topical themes and quantifies the proportion of news attention allocated to each theme over time. News attention closely tracks a wide range of economic activities and can forecast aggregate stock market returns. A text-augmented vector autoregression demonstrates the large incremental role of news text in forecasting macroeconomic dynamics. We retrieve the narratives that underlie these improvements in market and business cycle forecasts.
构建180主题LDA模型刻画华尔街日报新闻结构
使用1984-2017年约80万篇《华尔街日报》全文文章,通过贝叶斯因子和十折交叉验证选定的180主题LDA模型,将商业新闻分解为可解释的主题。主题分为周期性、季节性和涌现性三类,大多数主题表现出强烈的时间序列持续性,支持新闻到达驱动波动率聚集的假说。
衰退主题关注度解释21%的工业产出增长变动
基于Lasso回归选择五个主题的主动集回归,衰退主题关注度每上升一个标准差,工业产出增长下降0.38个标准差(R²=0.21),就业增长下降0.61个标准差(R²=0.59)。衰退主题是所有宏观总量中最强的解释变量。
新闻关注度解释25%的股票市场波动
五个新闻主题关注度对月度市场回报的回归R²为0.25,远超CFNAI指数的2%和FRED-MD 101个宏观变量的9%。衰退主题关注度的系数为-0.35,是市场回报的最大决定因素。这表明新闻文本包含未被标准宏观数据覆盖的预期信息。
文本增广VAR中衰退新闻冲击导致产出下降1.99%
在Baker-Bloom-Davis五变量VAR中纳入衰退主题关注度,衰退新闻冲击(从第5百分位到第95百分位)在17个月后导致工业产出下降1.99%,20个月后就业下降0.92%,约为EPU冲击效应的两倍和四倍。交叉验证组Lasso确认衰退是唯一被选入VAR的主题。
新闻关注度市场择时策略夏普比率优于基准
基于在线LDA的新闻关注度市场择时策略年化夏普比率为1.04,高于买入持有策略的0.71和EPU策略的0.53。该策略在2008年和2009年金融危机期间降低市场暴露,叙事检索表明其超额收益来自于对政府干预私人部门预期的低估。
核心解释变量
新闻主题关注度(由LDA/在线LDA主题模型估计的180个主题月度关注比例)
被解释变量
宏观经济活动指标(工业产出增长、就业增长、股票市场回报、市场波动率、IPO和LBO交易量、破产申请数、行业波动率、欧洲主权CDS利差等)
样本与数据
1984年1月至2017年6月《华尔街日报》全文文章763,887篇,词汇量18,432个术语;宏观经济数据来自FRED-MD、CFNAI及Baker-Bloom-Davis公开数据;扩展样本使用1890-2017年WSJ头版摘要数据
识别方法 / 模型设定
LDA主题模型进行文本降维,Lasso回归(固定选择五个非零系数)和组Lasso进行模型选择,VAR向量自回归估计衰退新闻关注度冲击的脉冲响应,在线LDA避免前视偏差,十折交叉验证选择主题数量
内生性及稳健性检验
使用在线LDA消除前视偏差;改变VAR变量排序、控制EPU和消费者信心指数、加入VIX、时间趋势、改用六个月滞后;使用1890-2017年扩展样本;采用后选择推断方法调整p值;考虑主题交互项;使用分组Lasso进行模型选择
更多相关数据正在补充