557 Views
September 01, 26
スライド概要
東京大学松尾・研究室が運営する「松尾研LLMコミュニティ」でのイベント資料などを公開します。 ◾️ 松尾研LLMコミュニティとは 松尾研LLMコミュニティは、「大規模言語モデルについて知って学べるオンライン空間」として、東京大学松尾・岩澤研究室が運営するコミュニティです。 現在、学生を中心とした10,000名以上が、原則無償で参加しています。 また、本コミュニティでは様々なイベント等を定期的に開催しております。 是非下記のリンクより参加申し込みをお待ちしております。 ◾️ 松尾研LLMコミュニティの各種リンク ・今後のイベント開催情報/参加申込;https://tr.ee/7d_W4DsImD ・松尾研LLMコミュニティ参加フォーム;https://tr.ee/RyDfuRzS55 ・過去イベントアーカイブ;https://tr.ee/wqdbFJJZ25
論文と特許の関係を分析:回帰分析とベイズ的 LLM統合因果探索の比較 Paper & Hacks #97 | 2026年9月1日 森 千尋(トロント大学コンピュータサイエンス専攻 学部2年)
自己紹介 森 千尋 トロント大学 コンピュータサイエンス専攻 学部 2 年 顔写真 関心 AIイノベーションエコシステム(産官学が連携してAI研究と社会実装を繋ぐ循環)の 分析と、それを促進するためのLLM開発・研究に興味がある。 関連活動 トロント大学の Trinity College Undergraduate Research Conference2026にて、 研究計画「Comparative Analysis of AI Innovation Ecosystems: A Citation Network Study of the University of Toronto and the University of Tokyo」を口頭 発表。 現在の研究活動 LLMATCH のご指導のもと、「論文・特許・ニュース・政策文書を統合した、AI技術の社会実装タイムライン予測シ ステムの構築」というテーマで個人研究に取り組んでいる。
目次 1. 研究の全体構想 2. 初期検証のスコープ 3. 回帰分析とベイズ的LLM統合因果探索の説明(本日のメイン) 4. 今後の研究展開 5. 質疑応答
研究の目的: 論文・特許・ニュース・政策文書を統合した、 AI技術の社会実装タイムライン予測システム 背景: AIをはじめとする科学技術とビジネスの近接化が進んでいるが、 依然として研究成果が社会実装されるまでに約5〜10年 かかる。 →このタイムラグ を理解して、研究やビジネスの戦略を練ることが重要&難しい。 目的: 研究者・企業・政策立案者が各AI技術の社会実装を見据えて、より合理的に資源分配を判断する際に役立つシステムを 構築する。 社会貢献: AIイノベーションエコシステムの促進 の一助となる。
研究の全体構想:システム設計 論文・特許・ニュース・政策文書を統合した、 AI技術の社会実装タイムライン予測システム MLTRL で成熟度レベルを 論文 特許 ニュース 判定 今後:技術ごとの到達段階をランク付け 因果構造の探索手法:ベイ ズ的LLM統合因果探索 タイムライン予測を出力 時間構造を扱う層 (マルコフ連鎖など) 政策文書 今後:現在 / 〜年後のMLTRLを 分析・予測 MLTRL(Machine Learning Technology Readiness Levels / 機械学習技術成熟度レベル) NASAが宇宙開発向けに策定したTRL を機械学習システム向けに定義し直した技術成熟度の枠組み。 研究段階から実運用までを レベル0〜9までの10段階で表す。 [1] Alexander Lavin et al. (2022) “Technology readiness levels for machine learning systems” 今後:根拠を言葉で添えたテキスト
初期検証のスコープ 論文・特許・ニュース・政策文書を統合した、 AI技術の社会実装タイムライン予測システム MLTRL で成熟度レベルを 論文 特許 ニュース 判定 今後:技術ごとの到達段階をランク付け 因果構造の探索手法:ベイ ズ的LLM統合因果探索 タイムライン予測を出力 時間構造を扱う層 (マルコフ連鎖など)今 政策文書 後:現在 / 〜年後のMLTRLを 分析・予測 全体構想の最初の一区画 ・データが揃い、情報の伝播距離が近い論文・特許に絞る。 ・因果構造の探索までを検証する。 →計量書誌学の主な手法である回帰分析と、ベイズ的LLM統合因果探索の効能を比較。 今後:根拠を言葉で添えたテキスト
統計的因果分析:2つの流派 どちらも「因果」を扱うが、推定すること・出力が異なる。 効果推定 構造推定 Effect estimation 因果探索 / Causal discovery やること やること 原因と結果を人間が先に決めたうえで、効果の大きさ を測 る手法 構造そのものをデータから推定する 代表手法 代表手法 単回帰・重回帰・傾向スコア・操作変数法 ベイズ的LLM統合因果探索・PC・GES 出力 出力 係数:[説明変数] が 1 水準上がると [目的変数]は◯倍 グラフ:どの変数からどの変数へ矢印があるか 主な違い ・効果推定では分析者が指定した目的変数への 効果量を出力 するが、説明変数間の因果構造そのものは仮定・・であり出力ではない。 ・構造推定では全変数の因果構造自体 をデータから推定する。
計量書誌学は主に回帰(効果推定)を使用してきた。 計量書誌学は「オープンアクセス義務化は引用を増やすか、助成は引用数を高めるか」など政策評価型の問いを扱ってきたため、 その答えとして係数を返す回帰(効果推定)が使われてきた。 先行研究の例 Pablo Dorta-González et al. (2025) “Linking science and industry: influence of scientific research on technological innovation through patent citations“ リサーチクエスチョン: 何が政策文書での論文引用を規定するのか — 各説明変数が政策引用に与える効果とその大きさを定量化 する。 (最小二乗法)重回帰 主な分析手法:ロバスト OLS ● 目的変数:政策引用数(Altmetric版=Model 1、Overton版=Model 2 と別々にモデル化) ● 説明変数:ニュース・ブログ言及、ソーシャルメディア言及(Twitter/Facebook)、Wikipedia言及、学術被引用数、オープンアク セス種別(gold/hybrid/green/bronze/closed)、 Journal Impact Factor、資金獲得の有無、出版年、政策類型 さらに、「ニュース/ブログ → ソーシャルメディア → 学術引用(約6か月後)→ 政策文書・Wikipedia」という時間的順序を仮説とし ている。 出力: 非標準化係数・標準化係数・95%信頼区間・p値など。グラフ・辺の向き・変数間依存構造は出力されない。 [2] Pablo Dorta-González et al. (2025) “Linking science and industry: influence of scientific research on technological innovation through patent citations”
近年の因果探索分析(構造推定)の進化 ベイジアンネットワークモデル によって、変数間の因果関係をDAG:Directed Acyclic Graph(有向非巡回グラフ)と条件付き確率で表現する。 [3] Rainer Opgen-Rhein et al. (2007) “From correlation to causation networks: A simple approximate learning algorithm and its application to high-dimensional plant gene expression data” 「実社会データの品質」と「構造学習の計算量の多さ」の問題が、 データベースアルゴリズムの出力の信頼性を脅かす 。そこで真の因果構造を回復するために、 専門家による事前知識をモデルに組み込む。 [4] Rónán Daly et al. (2011) “Learning Bayesian networks: approaches and issues” [5] Hossein Amirkhani et al. (2016) “Exploiting experts’ knowledge for structure learning of Bayesian networks”
近年の因果探索分析(構造推定)の進化: LLM統合 その専門家への依存が構造学習技術と科学の応用分野との間の障壁を生んでいる。 →専門家の代わりに LLMを、因果探索の事前知識として使う。 [6] Kristy Choi et al. (2022) “LMPriors: Pre-Trained Language Models as Task-Specific Priors” [7] Masayuki Takayama et al. (2025) “Integrating Large Language Models in Causal Discovery: A Statistical Causal Approach” LLMの知識によって推論された因果関係とデータに隠された実際の因果構造のずれによる、 LLM事前知識の不正確さ →ベイズ的LLM統合因果探索 — ソフト制約型 [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”
ソフト制約 LLM統合因果探索の仕組み:2つの LLM専門家 推論方法の異なる2種類のLLM事前知識を用意する。 保守的LLM専門家 Conservative LLM Expert 役割: 確実に成り立つ因果関係を「有向経路(辺)の存在」を表す 事前知識として渡す。 指示プロンプト: 1. シングルステップ推論で 因果関係(辺)を見つける 2. Chain-of-Thought(思考の連鎖)で、1で選ばれた各辺を再 探索的LLM専門家 Exploratory LLM Expert 役割: あり得る因果関係を全て選択。逆に、これに選ばれなかっ た関係は「あり得ない辺」として禁止する。 指示プロンプト: 1. 存在する可能性 のある辺を全て選択する。 2. 1で選ばれた各辺の潜在的な因果関係を分析し、再現率 審査 重視の事前知識 (Recall-oriented Prior)として出力。 3. 2で再度認証された辺の因果関係を分析し、「有向経路 (辺)の存在」を表す 適合率重視の事前知識 (Precision-oriented Prior)と して出力。 (保守的専門家と異なり、再審査なし。) ・ [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”
ソフト制約 LLM統合因果探索の仕組み:全体構造 保守的 LLM専門家(適合率重視の推論) 探索的 LLM専門家(再現率重視の推論) [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト制約LLM統合因果探索の仕組み:全体構造 LLM ・ 保守的 専門家によって、選ばれた因果関係 →「辺の 存在」としての事前知識( λp) ・ 探索的 LLM 専門家によって、選ばれなかった 因果関係 →「あり 得ない辺」としての禁止制約( λrの補集合) これら2種類の事前知識を統合して ”Harmonized Prior”(統合済み事前知識)とする。 [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト制約LLM統合因果探索の仕組み:全体構造 3つの主要な構造学習手法である ● スコアベース、制限ベース(ベイジアンネットワーク 分析を使用、離散データ向き) ● 勾配ベース(共分散構造分析を使用、連続 データ向き) へHarmonized Priorを組み込む方法が紹介されている。 →本検証では「スコアベース構造学習のソフト制約型」を採用。 理由は以下: ● スコアベース手法 は離散データ(本検証の変数)向き ● 事前知識への一致度 とデータへの適合度 のバランスをとるソ フト制約型は因果探索の精度を高めること が示されている [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト制約 LLM統合因果探索の仕組み:アルゴリズム 事前知識による構造制約 ・経路存在制約(λp⋂ λr⋃λpの補集合) 辺λr不在制約( ・ ) を肯定的に扱う。 ちなみに、 ・c = 0.5 → 事前知識の無効化 =c 1 → 事前知識を絶対視する ・ (ハード制約) [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト制約LLM統合因果探索の仕組み:アルゴリズム DAG(有向非巡回グラフ)の データ( D)への適 合度を同時分布により測定: : DAG(有向非巡回グラフ)における の親ノードの集合 マルコフ分解:同時分布は各変数の親ノードが与え られた場合の条件付き確率の総積( π) 対数尤度ベース(logをとる)に変換することで、 総積(π)→総和(Σ) [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト制約LLM統合因果探索の仕組み:アルゴリズム DAG(有向非巡回グラフ)と 保守的専門家( λp)と探索的専門家( λr)によ る事前知識への一致度 を計算 経路存在制約 (λp⋂λr) あり得る辺 (λr⋃λp) [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用 確実な辺はではない (λp⋂λrの補集合) 辺不在制約 (λr⋃λpの補集合)
ソフト制約LLM統合因果探索の仕組み:アルゴリズム DAG(有向非巡回グラフ)の ・事前知識への一致度 ・データへの適合度 の両方を総合的に評価し、最適な 因果構造グラフ を求める。 [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior”より引用
ソフト統合因果探索の計量書誌学分野への応用 課題1:正解構造( ground truth)がない中で、因果探索の性能をどう評価するか? 現時点での案: ● ホールドアウト検証 で予測の当てはまりを計測する。 ● 異なる LLMモデルを使った時の、出力された因果構造グラフの 一致度に着目する。 課題2:どのようなデータ・変数を使用する か?現時点での案: ● SciSciNet-v2(Northwestern大学SciSciNetにて公開)(OpenAlexとDOIで結合できる) ○ 134M論文(特許とのリンクの記録含む)から、AI分野の論文のみをフィルタリング ● OpenAlex ○ 共変量(出版年、分野、オープンアクセス経路、掲載誌、助成の記載、著者数、学術被引用数)
今後の研究展開 1. 初期検証を完了する。 2. ニュース・政策文書 を統合し、変数を広げる。 3. 社会実装タイムライン予測システム構築 に向けた拡張: ・MLTRLによる技術成熟度 のラベリング ・時間構造(状態遷移)を扱う層 の構築(マルコフ連鎖など) 初 ・期検証では因果探索の効能 に着目したが、システム構築においてはハルシ ネーションへの対応など出力・社会実装 に向けた評価も行う。
参考文献 [1] Alexander Lavin et al. (2022) “Technology readiness levels for machine learning systems” Nature Communications 13, 6039 (2022) [2] Pablo Dorta-González et al. (2025) “Linking science and industry: influence of scientific research on technological innovation through patent citations” arXiv:2502.14570 [3] Rainer Opgen-Rhein et al. (2007) “From correlation to causation networks: A simple approximate learning algorithm and its application to high-dimensional plant gene expression data” BMC Syst. Biol., vol. 1 [4] Rónán Daly et al. (2011) “Learning Bayesian networks: approaches and issues” The Knowledge Engineering Review. 26:251 [5] Hossein Amirkhani et al. (2016) “Exploiting experts’ knowledge for structure learning of Bayesian networks” IEEE Trans. Pattern Anal. Mach. Intell., vol. 39, no. 11, pp. 2154–2170 [6] Kristy Choi et al. (2022) “LMPriors: Pre-Trained Language Models as Task-Specific Priors” FMDM Workshop@NeurIPS 2022 [7] Masayuki Takayama et al. (2025) “Integrating Large Language Models in Causal Discovery: A Statistical Causal Approach” Transactions in Machine Learning Research [8] Taiyu Ban et al. (2025) “LLM-Driven Causal Discovery via Harmonized Prior” IEEE Transactions on Knowledge and Data Engineering, vol. 37, no. 4, pp. 1943-1960
謝辞 東京大学松尾・岩澤研究室、そしてLLMATCHで日頃ご指導い ただいている小橋洋平さんに、 深く感謝申し上げます。 引き続きLLMATCHで研究に取り組んでまいりますので、 どうぞよろしくお願いいたします。
ご清聴ありがとうございました!