X Facebook LINE Bookmark

AIによる景気後退の予測 — 新聞記事と金利差を組み合わせた日銀研究所の論文をわかりやすく解説

  • 日銀金融研究所の論文では、新聞記事のAI分析と経済データを組み合わせた機械学習モデルが、従来の手法より大きく高い精度で景気後退を当てた。精度の指標AUC(0.5が当てずっぽう、1が完璧)は最良のモデルで0.87〜0.93、従来手法は0.55〜0.66だった
  • 3か月先の予測では新聞記事の指標が、12か月先では長短金利差が精度を上げた。「ニュースは織り込み済み」という常識とは逆に、新聞が伝える「景気の空気」には経済統計より早い情報が含まれている
  • SHAP分析(各データの貢献度を数値にする手法)で見ると、景気後退の原因の組み合わせは毎回違う。1つの指標に頼らず、複数のデータを組み合わせて見る意味がここにある
新聞テキストと経済データを組み合わせて景気後退を予測する機械学習フレームワークのイメージ

景気後退は、事前に分かるものなのか。投資の世界では「ニュースは織り込み済み」とよく言われるが、新聞を読んでも先回りはできないのだろうか。2026年3月、日本銀行の金融研究所(IMES)が、この疑問のヒントになる論文を公開した(Forecasting Recessions Using Machine Learning on Text Data and Mixed-Frequency Predictors、IMES Discussion Paper 2026-E-7、3月30日公開)。

日本語にすると「テキストデータと混合頻度の予測変数を使った機械学習による景気後退の予測」で、名前は難しい。中身は、新聞記事のAI分析とさまざまな経済データを組み合わせて、「これから景気が悪くなるかどうか」を当てるモデルを作るという研究だ。米国株の時差を使って翌日の日本株を予測する論文と同じ読み方で、仕組みと結果を順に見ていく。

1. 景気後退の定義と「後から分かる」問題

景気後退は、経済全体の活動が数か月以上にわたって縮む状態を指す。もっとかんたんに言えば、「モノが売れない」「会社がもうからない」「仕事が減る」が続く状態だ。

日本の公式な定義

日本では、内閣府の経済社会総合研究所(ESRI)が景気基準日付を認定している。景気の山と谷を後から特定し、山から谷までの期間が景気後退期だ。主な判断材料は景気動向指数のCI一致指数(鉱工業生産、有効求人倍率、商業販売額など複数の経済指標を合成した指数)で、この指数が下がり続けていれば景気後退、上がり続けていれば景気拡張という判定になる。内閣府が2004年にまとめた分析では、戦後日本の景気循環は1周期が平均で約50か月(約4年)、そのうち景気後退期は約17か月だった。

論文はこの公式の日付を使い、ある月が景気後退期なら「1」、そうでなければ「0」とする二値の変数を予測の対象にした。モデルの答えは「hか月後に景気後退になっている確率は○%」という形で出る。

困るのは、この認定がいつも「後から」になる点だ。実際に景気が悪くなっているときには、「今が景気後退かどうか」がはっきりしない。だから、これから来るかどうかを前もって当てることに意味がある。政府や日銀が対策を打つための判断材料になるからだ。

2. 従来の景気予測が苦手だった3つのこと

景気後退を予測する研究は昔からあるが、従来の手法には苦手なことが3つあった。

従来の景気予測手法の課題
課題 具体的な内容
データの頻度がバラバラ GDP(国内総生産)は四半期ごと、鉱工業生産は月次、株価は日次や週次で発表される。頻度の違うデータをうまく組み合わせるのが難しい
数字では捉えにくい「空気」 経済指標の数字には、「企業の不安感」「市場のムード」のような、数字になっていない情報が入らない
予測モデルが単純すぎる 従来よく使われるロジスティック回帰(確率を直線的な式で当てはめる統計手法)は、データどうしの複雑な関係を捉えきれない

論文はこの3つにそれぞれ答えを用意した。頻度の違うデータは「U-MIDAS」という手法で1つのモデルに入れ、空気は新聞記事をテキストとして数値にし、モデルは機械学習に置き換えた。

3. 予測に使う19のデータと10のモデル

機械学習のモデルを作るには、「何を予測するか(目的変数)」と「何をヒントにするか(説明変数)」を決める必要がある。予測の対象は1節で書いた二値の変数で、3か月先(短期)、6か月先(中期)、12か月先(長期)の3パターンを検証している。

説明変数(予測のヒント)は4グループ・19変数

説明変数は4つのグループに分かれる19変数で、データの期間は1992年1月〜2024年12月の約33年分になる。

説明変数の一覧(論文 Table 1 より)
No. 変数名 頻度 グループ
1最終需要財在庫率指数月次景気先行指数(LI)の
構成11指標
2鉱工業用生産財在庫率指数月次
3新規求人数(除く新卒)月次
4実質機械受注(製造業)月次
5新設住宅着工床面積月次
6消費者態度指数月次
7日経商品指数(42種)月次
8マネーストック(M2)月次
9東証株価指数(TOPIX)月次
10投資環境指数(製造業)月次
11中小企業売上見通しDI月次
12長短金利差(10年−1年)週次タームスプレッド
(長短金利差)
13長短金利差(5年−1年)週次
14長短金利差(3年−1年)週次
15債務返済比率(DSR)月次金融変数
16日経225 実現ボラティリティ週次
17マクロ経済センチメント(874語辞書)週次テキスト指標
(毎日新聞)
18金融市場センチメント(19,630語辞書)週次
19経済政策不確実性指数(EPU)週次

検証の組み立てはこうなる。No.1〜11の景気先行指数の構成指標(月次)を土台にして、No.12〜16の金融データやNo.17〜19のテキストデータを足すと予測精度がどう変わるかを調べる。テキスト指標の元データは毎日新聞の経済面から取っている。

比べた予測モデルは10種類

論文は、従来手法のロジスティック回帰をベンチマーク(比較の基準)にして、9種類の機械学習モデルと比べている。

比較に使った10種類の予測モデル
モデル名 特徴(かんたんに)
ロジスティック回帰 従来手法(ベンチマーク)。シンプルだが複雑なパターンは捉えにくい
Lasso / Ridge / Elastic Net 正則化(ペナルティ付き)の線形モデル。変数が多いときに、余計な変数の影響を抑える
SVM(サポートベクターマシン) データの境界線を引く手法。RBFカーネルという仕組みで、直線では分けられないパターンも学習できる
ランダムフォレスト 多数の決定木の「多数決」で予測する。過学習に強い
LightGBM 勾配ブースティング決定木。速くて精度が高く、実務で広く使われている
KNN(k近傍法) 「似ている過去のデータ」を探して予測する。直感的で分かりやすい手法
LDA(線形判別分析) グループ間の違いがいちばん大きくなる軸を見つけて分類する
ニューラルネットワーク 脳の神経回路をまねた手法(隠れ層が1〜2層の浅い構造)

説明変数の組み合わせ(長短金利差の有無×金融変数の有無×テキスト指標4パターン×週次データの有無)は32通りある。10種類のモデルすべてで試すので、合計320パターンの予測モデルを時間軸ごとに評価したことになる。

4. 頻度の違うデータをそろえる仕組み(U-MIDAS)

この論文の道具立ての一つがU-MIDAS(制約なし混合データサンプリング)だ。名前は難しいが、やっていることは「更新の頻度が違うデータを1つのモデルに入れる工夫」になる。

天気予報で考えるU-MIDAS

天気を予測するとき、「毎月の平均気温」だけを見ても精度は低い。「毎週の降水量」「毎日の気圧の変化」のような頻度の違うデータも一緒に使ったほうが正確に当たる。ただ、月に1回のデータと毎日のデータでは「数」が違うので、単純には並べられない。U-MIDASは、この頻度の違いを統計的に処理して、すべてのデータを同じ土俵に乗せる手法だ。

3節の表のとおり、景気先行指数の構成指標と債務返済比率は月次、長短金利差と日経225の実現ボラティリティ(値動きの激しさ)とテキスト指標は週次で手に入る。たとえば、実質機械受注(企業の設備投資の意欲を示す指標)は月に1回しか発表されないが、長短金利差や新聞のセンチメントは毎週更新される。U-MIDASなら、こうした速さの違うデータを一緒に扱える。論文は月次の変数に2か月分、週次の変数に8週分(月次の約2か月分)の過去の値を使っている。

5. 新聞記事から測る「景気の空気」

ほかの景気予測の研究と違って、この論文は新聞記事をAIで分析して予測に使う。新聞には「業績悪化」「リストラ」「倒産」「物価下落」「金融不安」といった言葉が日々登場する。こうした言葉が出てくる頻度は、経済統計の数字より早く景気の変調を映すことがある。記者は企業や市場の取材を通じて、統計として集計される前の肌感覚を記事に書くからだ。

スパースPCAで取り出した3つの経済ストーリー

予測の本体で使うのは、874語の辞書で記事の明るさ・暗さを測って1本にまとめたマクロ経済センチメント(Sentiment-M)のような、集計済みの指標だ。

ただ、1本の指数では「新聞のどんな言葉が景気後退のサインになっていたか」までは分からない。そこで論文は、874語それぞれの日ごとのスコアにスパースPCA(まばらな主成分分析)という手法を当てて、言葉のまとまりを取り出している。目的は精度を上げることではなく、予測の中身を人が読めるようにすることだ。

主成分分析は、たくさんの変数を少数の「まとまり」に要約する統計の手法だ。100人の生徒のテスト結果を「文系力」「理系力」「体力」の3つにまとめる、と考えると分かりやすい。「スパース」は「まばら」の意味で、各まとまりに関係する語を少数に絞り、どの語が中心かを読み取れるようにする工夫が加わっている。この手法を874語に当てはめた結果、3つの経済ストーリー(ナラティブ)が見つかった。

新聞記事から取り出した3つの経済ナラティブ(論文 Table 4 より)
ナラティブ名 中心になる語(重みの大きい順)
企業の苦境
(Corporate Distress)
倒産、不良債権、経営破綻、人員削減。会社がつぶれたり人を減らしたりするニュースが増えると、この成分が上がる
金融不安
(Financial Distress)
金融危機、悪化、景気後退、倒産、減産。海外の金融市場の混乱が日本に波及する局面で上がる
デフレ圧力
(Deflationary Pressure)
デフレ、デフレ圧力、株価下落。モノの値段が下がり続ける心配が強まる局面で上がる

集計済みのSentiment-Mの代わりにこの3つの成分を入れても、予測精度はほぼ同じだった(AUCは3か月先0.91、6か月先0.87、12か月先0.82)。新聞の中の情報は、この3つのストーリーでおおむね言い尽くせることになる。

6. 予測精度:従来手法を0.3ポイント前後上回ったAUC

論文は、1992年1月〜2024年12月のデータのうち、2003年1月〜2024年12月をアウトオブサンプル期間(モデルの学習に使わず、その時点で手に入った情報だけで予測する期間)として検証した。この期間には、内閣府の認定で3つの景気後退期が含まれる。リーマンショック後の2008年2月〜2009年3月、欧州債務危機のころの2012年3月〜11月、コロナショックを含む2018年10月〜2020年5月だ。

AUC(予測精度の指標)の読み方

精度の比較にはAUCという指標を使う。AUCは0.5〜1.0の値をとり、0.5なら「コイン投げと同じ(ランダム)」、1.0なら「完璧な予測」になる。景気後退の月に、景気拡張の月より高い確率を付けられているかを測る指標で、値が高いほど予測モデルの性能がよい。

結果:ベンチマークを大きく上回った機械学習

予測の時間軸(3か月先・6か月先・12か月先)ごとの上位モデルと、ベンチマーク(従来手法)のAUCを並べる。

予測時間軸ごとの上位モデルとAUC(論文 Table 2 より)
時間軸 モデル 使用した追加データ AUC
3か月先 KNN テキスト(Sentiment-M)+ 週次データ 0.93
LightGBM テキスト(Sentiment-M)+ 週次データ 0.91
KNN 金利差 + 金融変数 + テキスト(Sentiment-M) 0.91
ロジスティック回帰 LI構成指標のみ(ベンチマーク) 0.66
6か月先 LightGBM 金利差 + 金融変数 + テキスト(Sentiment-M) 0.87
KNN 金利差 + 金融変数 + テキスト(Sentiment-M)+ 週次 0.86
KNN 金利差 + 金融変数 + テキスト(Sentiment-F) 0.86
ロジスティック回帰 LI構成指標のみ(ベンチマーク) 0.55
12か月先 LightGBM 金利差 + 金融変数(テキストなし) 0.88
KNN 金利差 + 金融変数(テキストなし) 0.86
KNN 金利差 + 週次(金融変数なし・テキストなし) 0.86
ロジスティック回帰 LI構成指標のみ(ベンチマーク) 0.55

短期(3か月先)では最良のKNNモデルがAUC 0.93で、ベンチマークの0.66を0.27ポイント上回った。6か月先はLightGBMが0.87と0.55で0.32ポイント、12か月先もLightGBMが0.88と0.55で0.33ポイントの差をつけている。ベンチマークのロジスティック回帰は6か月先と12か月先で0.55にとどまり、コイン投げとほとんど変わらない。

短期はテキスト、長期は金融データが役立つ(MCS分析)

320パターンのモデルのうち「統計的に優れている」と判定されたモデル群(MCS: Model Confidence Set、有意水準5%)を見ると、どの種類のデータが役立つかは予測の時間軸で大きく変わる。

MCSに残ったモデルの特徴(論文 Table 3 より)
時間軸 残存数 金利差
含有率
金融変数
含有率
テキスト
含有率
Sentiment-M
含有率
3か月先 27/320 44% 44% 96% 85%
6か月先 34/320 68% 50% 62% 53%
12か月先 24/320 75% 58% 25% 17%

3か月先の予測では、MCSに残ったモデルの96%がテキスト指標を含んでいた。短期の予測ではテキストデータがほぼ必須になる。12か月先では金利差を含むモデルが75%を占め、テキスト指標は25%に下がった。新聞は「いま起きていること」に強く、長短金利差は市場が織り込む「将来の景気見通し」を映すので、時間軸が長くなるほど金融データが大事になる。直感にも合う結果だと思う。

ベンチマークのロジスティック回帰は、どの時間軸でもMCSから外れた(統計的に劣ると判定された)。機械学習の優位は、統計のうえでも裏付けられたことになる。

週次データを足す効果は限られていた。MCSに残ったモデルのうち週次データを使うものは46〜53%で、時間軸によらず横ばいだった。月次の指標が十分にそろっていれば、週次を足しても精度はせいぜい少ししか上がらない、というのが論文の4つ目の発見になる。

7. 景気後退ごとに違う原因の組み合わせ(SHAP分析)

機械学習には「予測は当たるが、なぜその予測になったのかが分からない」というブラックボックスの問題がついて回る。政策判断に使うには大きなハードルだ。論文はこの問題にSHAPという分析手法で対処している。ゲーム理論(複数のプレイヤーが協力したときの貢献度を公平に分ける理論)に基づいて、どの変数がどれだけ予測結果に貢献したかを数値で示す手法だ。

過去の景気後退の「原因の組み合わせ」

論文は、5節の3つのナラティブがLightGBMの予測にどれだけ寄与したかをSHAPで時期ごとに分解した。景気後退のたびに、強く出た成分は違っていた。

景気後退の局面と、強く出たナラティブ(論文 7.2節の記述)
時期 強く出た成分と、背景の出来事
2000年代前半の景気後退
(2000年11月〜2002年1月)
「企業の苦境」。不良債権の処理が加速し、2001年にはスーパー大手のマイカルが経営破綻した
世界金融危機
(2008年2月〜2009年3月)
「金融不安」が支配的。「デフレ圧力」もこの時期にいちばん強く出た
東日本大震災の後
(景気後退期は2012年3月〜11月)
「企業の苦境」が再び上昇(2012年のエルピーダメモリの破綻など)。欧州債務危機の時期は「金融不安」も強い

2018年10月〜2020年5月の景気後退については、論文の本文に成分ごとの説明がない。2000年代前半は検証期間(2003年以降)より前で、モデルの学習に使った期間にあたる点も頭に入れておきたい。それでも、金融不安が主因のときもあれば、企業の倒産や人員削減が主因のときもある、という結果は読み取れる。景気後退に万能の予兆はない。単一の経済指標ではなく、複数の角度からデータを集めて機械学習でまとめて判断する方法が有効な理由は、ここにある。

8. 新聞が統計より早いという結果の受け止め

この論文でいちばん面白いのは、テキストデータの予測力が短期で特に高いという発見だ。新聞記事に含まれる空気感には、マクロ経済指標にはまだ映っていない先行情報がある。記者が「取材先の企業が急にコストカットを始めた」と書く記事は、その企業の業績悪化が統計に出るより先に出る。新聞が統計より早いというのは、直感にも合う。

手元のデータで同じ問いを試したときは、逆の結果だった。投資主体別の売買動向で将来のTOPIXを予測できるかを調べると、公表の時点で株価に織り込まれていて、予測には使えなかった。公表までに時間のかかる統計と、毎日出る新聞の言葉とでは、情報の鮮度が違う。この差が、短期の予測でテキストが役立つ理由の一つだと見ている。

現実の政策への応用にはハードルもある。機械学習の予測は確率で出るので、「景気後退が来る/来ない」を白黒はっきり決めてくれるわけではない。「景気後退の確率が60%」と言われたとき、どう動くかは結局人間が決めるしかない。

今後はSNS(X/Twitterなど)のデータや、大規模言語モデル(ChatGPTやClaudeのような生成AI)を使ったテキスト分析を組み合わせれば、さらに精度が上がる余地はある。日銀は2024年12月に大規模言語モデルを使ったテキスト分析の取り組みを日銀レビューで発表している。文章を数値にして経済を読む研究は、日銀の中で部署をまたいで広がっている。

「長期は金利差」という整理にも、日本ならではの但し書きが付く。論文の付録によると、2013年4月の量的・質的金融緩和(QQE)より後は、10年と1年の金利差が予測に寄与する度合いが緩和前より93%縮んだ。代わりにテキスト指標の重要度は27%から33%に上がった。日銀が長期金利を抑え込んでいる間は、金利差が景気の先行きを映しにくくなっていたことになる。

注意点: この論文は学術研究で、日銀の公式見解や政策判断を示すものではない。著者の個人的な見解だとIMESも明記している。過去のデータを使った検証(バックテスト)の精度が、未来の予測精度を保証するわけでもない。

9. まとめ

「AIは景気後退を予測できるか」の答え — 従来手法よりかなり高い精度

この論文は、19変数・10手法・320パターンの比較実験で、新聞テキストと経済データをAIで組み合わせると従来手法より予測が大きく当たるようになることを示した。

AIによる景気予測はまだ発展途上だが、人間の判断を補うツールとしての使い道はある。自分も経済ニュースを読むときは、「いま新聞でどんな言葉が増えているか」を意識して見るようにしている。次に確かめたいのは、運営者ノートに書いたEPUの月次データを手元の信用残と並べて、「空気」の指標が自分の売買の役に立つかどうかだ。

※本記事は公開情報に基づく情報整理であり、個人の見解を含みます。特定の銘柄の売買や投資を推奨するものではありません。投資判断はご自身の責任においてお願いいたします。

POPULAR ARTICLES