49K Views
December 07, 22
スライド概要
マテリアルズ・インフォマティクス 連続セミナー 第一回
動画:https://youtu.be/WkStbYrGCM4
2025 Mar. 25 page69修正
2022 Dec. 14 修正
マテリアルズインフォマティクスチュートリアル
マテリアルズ・インフォマティクス 連続セミナー 第一回 データ解析学基礎 木野日織(きのひおり)
この講義の前提と対象者 本講義は以下を対象とする • 数学・統計の基礎を軽く知っている • Pythonは基礎的事項を知っている。(for文、変数の書き方、リストなど) 本講義で扱う「データ解析学」とは? • 機械学習 • データマイニング • インフォマティクス をまとめた広い概念として扱う。 注意点 • 用語定義は分野・研究者によって異なる • 本講義は「一つの見方」を提示する
階層構造図 本セミナーで階層構造図が多くでてきます。 まず、階層構造は一意ではありません。 更に、用語定義が人により変わることもあり、他の方とは階層構造が大きく異な る定義をする場合もあります。 図に書かれないノードも存在します。 支配法則を知ら ない場合の目的 変数値を予測す る 1. (大量の)観測 データを得る 2. 予測モデルを 学習する 3. 未知説明変数 への予測値を得 る 欠けが無い表形 式 予測モデルとし て相関が高い関 数を得る 予測モデル 𝑣(𝑚, 𝑣, 𝑡)を評価 する。
今回の内容 マテリアルズ・インフォマティクス連続セミナー第一回:データ解析学 基礎 本連載セミナーでの今回の内容 • データ解析学手法の系統的紹介 • データ解析学手法が用いる帰納法の(再)理解 次回以降 scikit-learnを中心したPythonスクリプトの例とその実行によりデータ解析学手法に 慣れていただく。 動画 説明が速い部分は動画を停止、巻戻しなどして御覧ください。動画はセミナー時間外の 視聴も可能です。
(マテリアルズ)インフォマティクス(MI)の実践手段 MI実践手段 計算機言語 Python Scikitlearn,pymaten。 Deep-learningを 行いたいならばほ ぼ一択。 R 非言語GUI Java MATLAB (有料) Orange Data Mining KNIME Analytics Platform (階層構造の一例) 少し前までの標 準。大量に手法 説明の教科書が ある。 自然言語処理では 標準だった。 JavaによるGUIアプ リは多い。 追加機能が多 く販売されて いる。
予測問題の解き方 予測する 演繹法 帰納法 支配法則に従っ データから予測 て予測する する。
演繹と帰納の違い 演繹 (Deduction) 帰納 (Induction) 物理法則が既知 物理法則が未知 既知の法則から結果を予測 データから法則(モデル)を学習 入力 → 物理法則 → 出力 入力 → 機械学習モデル → 出力 例:第一原理計算、化学反応論 例:機械学習、深層学習 •演繹:物理法則が分かっているため、それに従って計算する。 •帰納:法則が分からないため、多数のデータから「入力→出力」の関係を学習する。 →本講義では、主に「帰納」に基づくマテリアルズインフォマティクスを学ぶ。
予測問題とは何か? 目的 → 「入力」から「出力」を予測する 用語 •説明変数(入力) •目的変数(出力) 例 •入力:組成、温度 •出力:電気伝導率 データ形式 → 表形式(行=データインスタンス)
観測データとは何か? 観測する 本講義では以下をすべて「観測」と呼ぶ 実験 → 測定 計算 → シミュレーション結果 なぜ統一するか? → データ解析では区別しないため 例) 実験:電気抵抗を測定 計算:DFTでエネルギー計算 → どちらも「データ」として扱う 計算する 評価する カテゴリ分け 測定する 計測する 観測デー タ カテゴリ分け 計算デー タ 実験デー タ
予測問題 予測問題 演繹的アプ ローチ 帰納的アプ ローチ 支配法則を 知っている場 合の予測問題 支配法則を知 らない場合の 予測問題 (階層構造の一例)
演繹アプローチによる予測 支配法則を知っている場合 例)物体の落下速度の予測 目的:落下速度(𝑣)の予測 定数:重力定数(𝑔) 物体の速度状態を定義する変数: 質量(𝑚)、摩擦係数(𝑘)、時間(𝑡) 実行過程 𝑑𝑣 1.支配法則を得る:𝑚 = 𝑔𝑚 − 𝑘𝑣 (下を𝑣の正) 𝑑𝑡
予測結果のまとめ 実行過程(つづき) 2.支配法則を解き、 3.得たい変数(𝑚, 𝑘, 𝑡)組に対する𝑣の予測値を生成する。 表形式で表す。 ID ID1 ID2 𝑘 𝑘1 𝑘2 𝑡 𝑡1 𝑡2 𝑣 𝑣1 𝑣2 𝑚𝑁 𝑘𝑁 𝑡𝑁 𝑣𝑁 … 𝑚 𝑚1 𝑚2 … IDN 説明変数(𝑥) Ԧ 目的変数(𝑦) それぞれの行 をデータイン スタンスと呼 ぶ。
物質科学での典型的なデータ解析例 𝑥Ԧ ID 説明 説明 変数 変数 a b ID1 𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥1𝑎 𝑥1𝑏 説 目的 明 変数 変 数P 𝑜𝑏𝑠 𝑦1𝑜𝑏𝑠 𝑥1𝑃 ID2 𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥2𝑎 𝑥2𝑏 𝑜𝑏𝑠 𝑦2𝑜𝑏𝑠 𝑥2𝑃 … … IDN … 𝑜𝑏𝑠 obs 𝑥𝑁𝑎 𝑥𝑁𝑏 𝑥Ԧ𝑖 𝑥Ԧ𝑗 𝑥Ԧ𝑘 ID1 i j k ID2 ID3 𝑜𝑏𝑠 𝑥𝑁𝑃 𝑦𝑁𝑜𝑏𝑠 説明変数 index …
説明変数の特徴 典型的な解析例) 平均と標準偏差を求める。 全ての観測データを重ねて書く。 𝑥Ԧ 𝑥Ԧ 平均+𝜎 平均 index 平均−𝜎 index
説明変数の特徴 変数が𝑥𝑎 , 𝑥𝑏 , 𝑥𝑐 と3つとする。 𝑥Ԧ 典型的には 𝑥𝑐 平均+𝜎 a 平均 平均−𝜎 a b c b c 𝑥𝑐 𝑥𝑏 index 𝑥𝑎
説明変数間の関係(1) 𝑥𝑐 ? 𝑥𝑐 𝑥𝑎 𝑥𝑎 今は𝑥𝑎 , 𝑥𝑏 , 𝑥𝑐 のみなので 容易に分かる。 説明変数が多次元だと目 で判断するのは大変です。 しかし、データ解析学手法 の次元圧縮(主成分解析)で 解析可能です。
説明変数と目的変数との関係 ●濃淡:𝑦の値 𝑥𝑐 𝑥𝑐 𝑥𝑐 𝑥𝑎 𝑦~𝑎𝑥𝑎 + 𝑐𝑥𝑐 𝑦~𝑎𝑥𝑎 𝑦~𝑐𝑥𝑐 𝑎 > 0, 𝑐 > 0 𝑥𝑎 𝑦~𝑎𝑥𝑎 − 𝑐𝑥𝑐 𝑦~𝑎𝑥𝑎 𝑦~ − 𝑐𝑥𝑐 𝑦~ 𝑓 𝑥𝑎 , 𝑥𝑏 , 𝑥𝑐 𝑥𝑏 𝑦は𝑥𝑎 , 𝑥𝑐 とは相関 がほぼ無い。 y~𝑓(𝑥𝑏 ) ? の最も妥当な関係 を求めるのが 回帰 or 分類。
説明変数間の関係(2) 𝑥𝑏 𝑦 𝑦 色分けを (𝒙𝒂 vs y) に重ねると 𝑥𝑎 単一モデルで妥当に 回帰できない? 𝑥𝑎 (多次元空間でも、) 説明変数空間で分布が 分離している。 𝑥𝑎 カテゴリー毎に容易に 妥当な回帰モデルが学 習できる。 多次元では人が行うのは大変です。 →クラスタリングでカテゴリー分けできます。
予測問題 予測問題 演繹的アプ ローチ 帰納的アプ ローチ 支配法則を 知っている場 合の予測問題 支配法則を知 らない場合の 予測問題 (階層構造の一例)
帰納的アプローチによる予測 支配法則を知らない場合 1.(大量の)欠けが無い表形式の観測データがあれば ID 𝑚 𝑘 𝑡 y=𝑣 ID1 𝑚1 𝑘1 𝑡1 𝑣1 ID2 𝑚2 𝑘2 𝑡2 𝑣2 𝑚𝑁 𝑘𝑁 𝑡𝑁 𝑣𝑁 𝑦 関数𝑓 … IDN 2.観測データ{𝑥Ԧ𝑖𝑜𝑏𝑠 , 𝑦𝑖𝑜𝑏𝑠 }に合う関数𝑓を作成すれば、 𝑦𝑖𝑜𝑏𝑠 = 𝑓(𝑥Ԧ𝑖𝑜𝑏𝑠 ), 𝑥Ԧ = (𝑚, 𝑘, 𝑡) 3. 未知説明変数(𝑥Ԧ𝑖𝑛𝑒𝑤 )に対し𝑦𝑗new の妥当な予測が 可能かもしれない。 𝑦𝑗𝑛𝑒𝑤 = 𝑓(𝑥Ԧ𝑗𝑛𝑒𝑤 ) 𝑥Ԧ
用語定義 観測データに対して𝑦~𝑓(𝑥)となる関数𝑓(モデル)を得る過程 Ԧ →モデルを「学習する」という。 予測値と観測値が一致する予測モデルを求める。 相関の指標の例) 2 1 𝑁 MSE= σ𝑖 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 , MSE=Mean Squared Error 𝑁 簡単のため𝑦はスカラ。
帰納的アプローチによる予測モデル学習 問題設定: 1. 支配法則が分からない。 2. 適切な説明変数かどうか分からない。 3. (実験)観測データは観測誤差を含む。 4. データに間違いが含まれているかもしれない。 … という条件下で 有限個の(大量の)観測データから、 目的:観測データに含まれない未知説明変数の予測をする。 →支配法則に替わる予測モデルの妥当性の定量的評価が必要
用語説明 適合度(Goodness of Fit): 学習データ(訓練データ)に対して、モデルがどれだけよく一致しているかを 表す指標です。 汎化性能(Generalization Performance): 学習に使用していない未知のデータに対して、どれだけ正しく予測できるか を表す性能です。 機械学習では未知の入力 𝑥に対して妥当な出力 𝑦を予測することが目的であるため、訓練 データへの適合度よりも汎化性能が重要となる。
予測モデル学習 目的:妥当な予測モデルかの定量評価(汎化性能) 仮想的な全データ 観測データ 未知 データ 回帰モデル作成 妥当性の評価 予測モデル 適用 しかし、データが無い未知データへの定量評価は不可能。 →定量評価の実現手段なし。
予測モデル学習(代替手法) 目的:妥当な予測モデルかの定量評価(汎化性能) 仮想的な全データ 観測データ 訓練 データ テスト データ 回帰モデル作成 未知 データ 妥当性の評価 予測モデル 将来の 適用 代替手段:訓練データに無いという意味でテストデータ で擬似的な未知データへの評価とする。
予測モデル学習の各過程 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
予測モデル学習の各過程 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
予測モデル学習の各過程 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
2. モデル当てはめを行う(1) 元データ 基底関数が適切なモデル 𝑦 𝑦 𝑦 𝑥Ԧ 基底関数を増やしすぎたモデル 𝑥Ԧ 𝑥Ԧ
(回帰)予測モデル学習指針 訓練データには非常によく適合 するが、複雑なモデルとなって いる。 𝑦 しかし、未知データ●に対す る予測性能が低下する。 (Overfitting) 𝑥Ԧ
予測モデル学習指針 目的:「未知データに対する予測性能(汎化性能)の高い関数を得る」 訓練データには非常によく適合 するが、複雑なモデルとなって いる。 𝑦 しかし、未知データ●に対する 予測性能が低下する。 (Overfitting) 適度になめらかな関数 → 未知の説明変数に対しても、 妥当な予測●が期待できる。 𝑥Ԧ
2. モデル当てはめを行う(1) 訓練データに対して関数𝐿𝑟𝑒𝑔 を最適化する 線形回帰モデル 𝑓 𝑥Ԧ = 𝑤𝑝 𝑥𝑝 + 𝑤0 𝑝 𝑥Ԧ = 𝑥1 , 𝑥2 , … , 𝑥𝑃 𝑤 = 𝑤1 , 𝑤2 , … , 𝑤𝑃 𝑟𝑒𝑔 関数𝐿 𝑡𝑟𝑎𝑖𝑛 𝑁 = σ𝑖 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 訓練データ数: 𝑁 𝑡𝑟𝑎𝑖𝑛 2 を最小化して𝑤を学習
過学習への対応 問題点: • 訓練データへの誤差だけを最小化 モデルが複雑になりすぎることがある • 訓練データにはよく合うが、新しいデータでは予測精度が低下(過学習) 過学習対応方法 特徴量選択 重回帰分析に よる変数選択 正則化 L1正則化 L2正則化
過学習への対応 更に正則化項/罰則項を導入する。 𝑟𝑒𝑔 関数𝐿 𝑡𝑟𝑎𝑖𝑛 𝑁 = σ𝑖 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 2 + 𝛼 𝑤 𝑛 を最小化 n 𝑛 定義: 𝑤 𝑚 = 𝑚 𝑤𝑝 𝑚 𝑝 • • • 𝑛 モデルが複雑になりすぎることを防ぐ 不要に大きなパラメータを抑える 未知データへの予測性能(汎化性能)が向上する
2. モデル当てはめを行う(2) 第二項目:Lnノルムを含む正則化項 (Ln正則化項) L1正則化項を加えた線形回帰モデル: Lasso 不要な係数を0にし、特徴量選択も行う。 シンプルなモデルを作ることで過学習を抑える。 1 L1ノルム: 𝑤 1 = σ𝑝 |𝑤𝑝 | 2 L2ノルム: 𝑤 2 = σ𝑝 𝑤𝑝 2 L2正則化項を加えた線形回帰モデル:Ridge 係数を小さくし、過学習を抑える。 ハイパーパラメタ𝛼の値を変え、𝐿𝑟𝑒𝑔 を最適化し、 回帰モデルを学習します。
予測モデル学習の各過程 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う。 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
3. モデル評価を行う (相関度合いを示す)回帰評価指標: Mean Squared Error Root Mean Squared Error Mean Absolute Error coefficient of determination R square, R two 1 MSE = σ𝑁 Ԧ𝑖 𝑖 𝑦𝑖 − 𝑓 𝑥 𝑁 2 . RMSE = MSE. 1 MAE = σ𝑁 Ԧ𝑖 |. 𝑖 |𝑦𝑖 − 𝑓 𝑥 𝑁 𝑅2 = 1 − 2 σ𝑁 𝑖 𝑦𝑖 −𝑓 𝑥Ԧ𝑖 σ𝑁 ത 2 𝑖 𝑦𝑖 −𝑦 where 𝑦ത = 小さいほど相関が高い。 [0, ∞] 1 𝑁 , σ𝑁 𝑖 𝑦𝑖 . 大きいほど相関が高い。 [−∞, 1]
3. モデル評価を行う (相関度合いを示す)回帰評価指標を用いて テストデータに対して性能評価指標値を得る。 ← 具体的手段 ← σ𝑁 𝑖 をテストデータに対して行う。 (訓練データに対しての性能評価指標値も得られる。 ← 具体的手段 ← σ𝑁 𝑖 を訓練データに対して行う。)
予測予測モデル学習の各過程モデル学習 手段 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う。 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
4. モデルを選択する 訓練データに対するRMSE 𝑁𝑡𝑟𝑎𝑖𝑛 性能評価指標値からモデルを選択する。 RMSE 𝑡𝑟𝑎𝑖𝑛 = 1 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 𝑁 𝑖 典型的的な振る舞い RMSE テストデータに対するRMSE 𝑁𝑡𝑒𝑠𝑡 RMSE 𝑡𝑒𝑠𝑡 = 𝑅𝑀𝑆𝐸 𝑡𝑒𝑠𝑡 2 𝑖 𝑅𝑀𝑆𝐸 𝑡𝑟𝑎𝑖𝑛 𝑁𝑡𝑟𝑎𝑖𝑛 α 訓練データに過度に αの選択値 学習=過学習 1 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 𝑁 関数𝐿𝑟𝑒𝑔 = 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 𝑖 2 𝑛 +𝛼 𝑤 𝑛 2
予測モデル学習手段 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う。 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 から妥当なモデ ルを選択する。 (階層構造の一例)
予測モデル学習手段 訓練データ・テスト データに分ける 一組の訓練・テスト データに分割する。 複数の訓練・テスト データに分割する 訓練・テストデータ割 合を決めて分割する。 交差検証で複数の訓 練・テストデータに分 割する
予測モデル学習手段 訓練データ・テスト データに分ける 懸念:特にデー タインスタンス 数が少ない場合 は分け方の影響 が大きそう。 一組の訓練・テスト データに分割する。 複数の訓練・テスト データに分割する 訓練・テストデータ割 合を決めて分割する。 交差検証で複数の訓 練・テストデータに分 割する (階層構造の一例)
予測モデル学習手段 訓練データ・テスト データに分ける 一組の訓練・テスト データに分割する。 複数の訓練・テスト データに分割する 訓練・テストデータ割 合を決めて分割する。 交差検証で複数の訓 練・テストデータに分 割する (階層構造の一例)
交差検証 5分割の場合 𝒙 𝑦 𝒙1 𝑦1 𝒙𝟐 𝑦2 𝒙𝟑 𝑦3 𝒙𝟒 𝑦4 𝒙𝟓 𝑦5 𝒙𝟔 𝑦6 𝒙7 𝑦7 𝒙8 𝑦8 𝒙9 𝑦9 𝒙10 𝑦10 𝒙11 𝑦11 訓練 データ #1 #2,#3, #1,#3, #1,#2, #1,#2, #1,#2, #4,#5 #4,#5 #4,#5 #3,#5 #3,#4 𝐿の 最適化 𝑓2345 (𝑥) Ԧ 𝑓1234 (𝑥) Ԧ 𝑓1245 (𝑥) Ԧ #2 回帰 モデル #3 テスト データ #1 #2 #3 #4 #5 #4 評価 指標値 score1 score2 score3 score4 score5 #5 𝑓1345 (𝑥) Ԧ 𝑓1235 (𝑥) Ԧ ave(score), stddev(score)
交差検証 5分割の場合 𝒙 𝑦 𝒙1 𝑦1 𝒙𝟐 𝑦2 𝒙𝟑 𝑦3 𝒙𝟒 𝑦4 𝒙𝟓 𝑦5 𝒙𝟔 𝑦6 𝒙7 𝑦7 𝒙8 𝑦8 𝒙9 𝑦9 𝒙10 𝑦10 𝒙11 𝑦11 訓練 データ #1 #2,#3, #1,#3, #1,#2, #1,#2, #1,#2, #4,#5 #4,#5 #4,#5 #3,#5 #3,#4 𝐿の 最適化 𝑓2345 (𝑥) Ԧ #2 回帰 モデル #3 テスト データ #1 #2 #3 #4 評価 指標値 score1 score2 score3 #5 𝑓1234 (𝑥) Ԧ 𝑓1245 (𝑥) Ԧ 𝑓1345 (𝑥) Ԧ 𝑓1235 (𝑥) Ԧ #4 #5 score4 ave(score), stddev(score) score5
交差検証 5分割の場合 𝒙 𝑦 𝒙1 𝑦1 𝒙𝟐 𝑦2 𝒙𝟑 𝑦3 𝒙𝟒 𝑦4 𝒙𝟓 𝑦5 𝒙𝟔 𝑦6 𝒙7 𝑦7 𝒙8 𝑦8 𝒙9 𝑦9 𝒙10 𝑦10 𝒙11 𝑦11 訓練 データ #1 #2,#3, #1,#3, #1,#2, #1,#2, #1,#2, #4,#5 #4,#5 #4,#5 #3,#5 #3,#4 𝐿の 最適化 𝑓2345 (𝑥) Ԧ #2 回帰 モデル #3 テスト データ #1 #2 #3 #4 評価 指標値 score1 score2 score3 #5 𝑓1234 (𝑥) Ԧ 𝑓1245 (𝑥) Ԧ 𝑓1345 (𝑥) Ԧ 𝑓1235 (𝑥) Ԧ #4 #5 score4 ave(score), stddev(score) score5
交差検証の目的 問題 → データの分け方で結果が変わる 解決方法 → データを複数回分割して平均評価 利点 安定した評価 過学習の検出
データ解析学手法 データ解析学手 法 既に収集された データを用いる 手法 目的のために随 時にデータを収 集する手法 {𝑥}のみ Ԧ 𝑦~𝑓(𝑥) Ԧ 説明変数間の関 係性を見つける =教師なし学習 目的変数の予測 =教師あり学習 量的目的変数 質的目的変数 回帰 分類 量的目的変数 次元圧縮 クラスタリング ベイズ最適化 質的目的変数 データ集約 頻出パタンマイ ニング (階層構造の一例)
データ解析学手法の紹介 データ解析学手 法 既に収集された データを用いる 手法 𝑦~𝑓(𝑥) Ԧ 目的変数の予測 =教師あり学習 目的のために随 時にデータを収 集する手法 説明変数間の関 係性を見つける =教師なし学習 {𝑥}のみ Ԧ (階層構造の一例)
データ解析学手法の紹介 データ解析学手 法 既に収集された データを用いる 手法 𝑦~𝑓(𝑥) Ԧ 目的変数の予測 =教師あり学習 目的のために随 時にデータを収 集する手法 説明変数間の関 係性を見つける =教師なし学習 {𝑥}のみ Ԧ (階層構造の一例)
用語説明 変数のカテゴリー分け 変数 連続変数:数値が連続的に繋がる変数 離散変数:特定の値しか取らない変数。 例)数字としての原子番号、陽子 数、中性子数を決めた元素質量 質的変数/カ テゴリー変数 量的変数 連続変数 質的変数:名前;大小や差を定義できる。 離散変数 分類ラベルを 持つ変数 質的変数:名前;大小や差を定義できない 分類ラベルを持つ変数。 例)元素名、構造類型名 (階層構造の一例)
予測モデル 目的変数の 予測 量的変数のもっともらしい関数 を求める=回帰(regression) 質的変数のもっともらしい関数 を求める=分類 (classification) 量的目的変 数の予測 質的目的変 数の予測 回帰 分類 (階層構造の一例)
データ解析学ライブラリの仮定事項(1) 一般的なデータ解析学ライブラリは • 説明変数ベクトル𝑥が等長 Ԧ • 観測データの値に欠けが無い ことを仮定しています。
一般的な回帰モデル 観測データ ID 説明変数a 説明変数b … 説明変数P ID1 𝑜𝑏𝑠 𝑥1𝑎 𝑜𝑏𝑠 𝑥1𝑏 𝑜𝑏𝑠 𝑥1𝑃 𝑦1𝑜𝑏𝑠 ID2 𝑜𝑏𝑠 𝑥2𝑎 𝑜𝑏𝑠 𝑥2𝑏 𝑜𝑏𝑠 𝑥2𝑃 𝑦2𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥𝑁𝑃 𝑦𝑁𝑜𝑏𝑠 … … 𝑜𝑏𝑠 𝑥𝑁𝑎 obs 𝑥𝑁𝑏 ID 説明変数a 説明変数b ID1 𝑛𝑒𝑤 𝑥1𝑎 𝑛𝑒𝑤 𝑥1𝑏 𝑛𝑒𝑤 𝑥1𝑃 ID2 𝑛𝑒𝑤 𝑥2𝑎 𝑛𝑒𝑤 𝑥2𝑏 𝑛𝑒𝑤 𝑥2𝑃 IDN 目的変数 未知データ … … 説明変数P 1. 説明変数のサイズ が同じ。 2. 全てのセルが値を 持つ。
生データ また別の例) 第一原理計算による全エネルギー(𝐸)予測問題 𝐸𝑖 = 𝑓(周期構造定義i, {元素・原子位置}i) 生の説明変数 結晶構造ID 周期構造定義 元素・原子位置 全エネル ギー ID1 𝑎Ԧ1 , 𝑏1 , 𝑐Ԧ1 (𝑍𝑎1 , 𝑃𝑎1 ) 𝐸1 ID2 𝑎2 , 𝑏2 , 𝑐Ԧ2 (𝑍𝑎2 , 𝑃𝑎2 ) , (𝑍𝑏2 , 𝑃𝑏2 ) 𝐸2 ID3 𝑎Ԧ3 , 𝑏3 , 𝑐Ԧ3 (𝑍𝑎3 , 𝑃𝑎3 ) , (𝑍𝑏3 , 𝑃𝑏3 ), (𝑍𝑐3 , 𝑃𝑐3 ) 𝐸3 …
第一原理計算による全エネルギー予測問題 の生の説明変数の問題点 元素、原子位置は数が異なりうる。(つまり𝑥が非等長) Ԧ 𝑥が等長では無いので一般的な回帰モデルを使えない。 Ԧ 更に、 𝑎, Ԧ 𝑏, 𝑐順序を変えても同じ周期構造を定義できる。 Ԧ 同元素間で原子位置を交換しても結晶が不変。 元素、原子位置記載順序を変えても結晶が不変。 という特徴を表せない。
説明変数の加工(1) 目的:等長ベクトル𝑥に対する𝑦 Ԧ = 𝑓 𝑥Ԧ の形にしたい。 手段:加工例)動径分布関数RDF(𝑟𝑖 ) ID RDF(𝑟𝑎 ) RDF(𝑟𝒃 ) ID1 𝑜𝑏𝑠 𝑥1𝑎 𝑜𝑏𝑠 𝑥1𝑏 𝑜𝑏𝑠 𝑥1𝑃 𝑦1𝑜𝑏𝑠 ID2 𝑜𝑏𝑠 𝑥2𝑎 𝑜𝑏𝑠 𝑥2𝑏 𝑜𝑏𝑠 𝑥2𝑃 𝑦2𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥𝑁𝑃 𝑦𝑁𝑜𝑏𝑠 RDF(𝑟𝑷 ) 目的変数 … … IDN … 𝑜𝑏𝑠 𝑥𝑁𝑎 obs 𝑥𝑁𝑏 (𝑟1 , 𝑟2 , … , 𝑟𝑃 )を定めると 等長ベクトル 𝑥Ԧ = (𝑅𝐷𝐹 𝑟1 , 𝑅𝐷𝐹 𝑟2 , … , 𝑅𝐷𝐹 𝑟𝑃 ) になる。
データ解析学ライブラリの仮定事項(2) • 無単位 • 説明変数の値の範囲がほぼ同じ
説明変数の加工(2) 例)物体の落下速度の予測の説明変数の単位 • 質量𝑚[重さ] • 摩擦係数𝑘[重さ/時間] • 時間𝑡[時間] 説明変数の単位が異なる。 そして、 • 環境:気体中?液体中? • 物体の重さの範囲:車?隕石?時計?ペン? • 時間:hour, min, sec, msec,… などで想定している値の範囲も異なる。
説明変数の加工(2) 無次元、かつ値の変化幅をほぼ等しくする=データ正規化・標準化 を行う。 例) • Min-Max Normalization: [0,1]への変換。 • Z-score Normalization: 平均値0, 標準偏差1の分布への 変換。 (データ解析学を適用するライブラリはデータ正規化後の説明変数 を用いることを想定しているからです。)
説明変数の加工まとめ (データ解析学 ライブラリに適 用できる)説明 変数を得る 1. 生の説明変 数を得る 2. 等長ベクト ルへ物理変換を する 3. データ正規 化をする Min-Max Normalization Z-score Normalization (階層構造の一例)
回帰 目的変数が量的変数 回帰 線形回帰 カーネル回帰 ニューラル ネットワーク 回帰 決定木回帰 (階層構造の一例)
回帰 目的変数が量的変数 回帰 線形回帰 カーネル回帰 ニューラル ネットワーク 回帰 決定木回帰 (階層構造の一例)
線形回帰とカーネル回帰 1 𝑟𝑒𝑔 関数𝐿 = σ𝑁 𝑦𝑖 − 𝑓 𝑥Ԧ𝑖 2𝑁 𝑖 2 𝑛 + 𝛼 𝑤 𝑛 を最小化 第一項目 線形回帰 カーネル回帰 𝑁 𝑃 𝑓 𝑥Ԧ = 𝑤𝑝 𝑥𝑝 + 𝑤0 𝑝 𝑥Ԧ = 𝑥1 , 𝑥2 , … , 𝑥𝑃 𝑤 = 𝑤, 𝑤2 , … , 𝑤𝑃 𝑓 𝑥Ԧ = 𝑤𝑖 𝐾(𝑥, Ԧ 𝑥Ԧ𝑖 ) カーネル𝐾の例: RBFカーネル:𝐾 𝑥, Ԧ 𝑥′ 𝑖 = exp(−𝛾 𝑥Ԧ − 𝑥 ′ 2 2 ) RBF=radial Basis function γもハイパーパラメタ。
用語説明 類似性(Similarity):2つのデータがどれだ け似ているかを表す概念。 類似度(Similarity Measure):類似性を数 値で表す指標。値が大きいほど類似している。 距離(Distance):類似性を定量化する具体 的な尺度(metric)。距離が小さいほどデー タは類似している。 類似性 類似度 距離 基本思想:似ているデータは、似た性質・結果をもつ。 類似度が大きい(距離が小さい)データほど予測に強く寄与し、類似度が 小さい(距離が大きい)データほど寄与は小さい。
カーネル回帰 考慮すると評価指標値 が小さくなるデータイン スタンス 目的変数 𝑁 2 𝑓 𝑥Ԧ = 𝑤𝑖 exp(−𝛾 𝑥Ԧ − 𝑥𝑖 2 ) 𝑖 ? RBFカーネル:距離が近いデー タインスタンスの寄与がガウシア ンの依存性で減衰する。 係数:矛盾するデータインスタン スの寄与を小さくなる。 説明変数 𝒙𝟏 𝒙𝟐 𝒙𝟑 𝒙𝟒 説明変数空間で 距離が 大きい 距離が 小さい 𝒙 𝒙𝟓 𝒙𝟔 𝒙𝟕
類似度と距離 類似性を表す 尺度 類似度 コサイン類似 度 cos((𝑥Ԧ1 , 𝑥Ԧ2 )/(|𝑥Ԧ1 ||𝑥Ԧ2 |)) 距離 Pearson相 関関数 ユークリッド距 離(L2ノルム と同じ) マンハッタン 距離(L1ノル ムと同じ)
距離実装を変えたカーネル 𝒙𝟏 𝒙𝟐 𝒙𝟑 𝒙𝟒 𝒙 𝒙𝟓 𝒙𝟔 𝒙𝟕 RBFカーネル 𝐾 𝑥, Ԧ 𝑥 ′ = exp(−𝛾 𝑥Ԧ − 𝑥′ Ԧ 2) 近傍データインスタンスの寄与が (ユークリッド距離)2で減衰する。 データによっては他の距離実 装の方が良いかもしれない。 例) ユークリッド距離を用いたラプラシアン カーネル 𝐾 𝑥, Ԧ 𝑥 ′ = exp(−𝛾 |𝑥Ԧ − 𝑥Ԧ ′ |2 ) ユークリッド距離の一乗で減衰。 マンハッタン距離を用いたラプラシ アンカーネル 𝐾 𝑥, Ԧ 𝑥 ′ = exp(−𝛾 |𝑥Ԧ − 𝑥Ԧ ′ |1 ) これらカーネルの距離依存性もまたパラメタ。
類似度と距離 類似度・距離 データインス タンス間類似 度・距離 説明変数間類 似度・距離 (階層構造の一例)
一連のIf文(決定木)による回帰モデル 回帰 決定木 If x1 >= xvalue1 then if x2>=xvalu2A then y = yvalue1 else y = yvalue2 Else … Endif 線形回帰 予測値は階段状(非連続)になります。 カーネル回帰 ニューラル ネットワーク 回帰 決定木回帰 単一決定木回 帰 アンサンブル 決定木回帰 ランダムフォ レスト回帰 (階層構造の一例)
分類 目的変数 値の予測 量的目的 変数 質的目的 変数 回帰 分類 質的変数: 元素名:Si, H, Co, … 構造類型: bcc, fcc, hcp
用語説明 ラベル(Label):分類問題における正解(クラス)を表す値。 例: •存在/非存在 •転移温度>100K, 転移温度≦100K •構造類型名:BCC,FCC, HCP, ... 𝒙 𝑦 𝒙 𝑦 𝒙1 存在 𝒙1 転移温度>100K 𝒙𝟐 非存在 𝒙𝟐 転移温度>100K 𝒙𝟑 存在 𝒙𝟑 転移温度≦100K … … (回帰問題の答えもlabelということもある。) … …
分類 ロジスティック回帰 線形関数𝑓(𝑥)に対して、 Ԧ 𝑛 𝐶 𝑐𝑙𝑠 Lnノルム正則化項を含む𝐿 = 𝑤 𝑛 + σ𝑖 log(1 + exp −𝑦𝑖 𝑓 𝑥Ԧ𝑖 )を 𝑁 最小化 二値分類の場合: あるクラスと予測される確率は,𝑓 𝑥 を線形モデルとして 1 𝑃 𝑥Ԧ = 1 + exp(−𝑓 𝑥 ) 別なクラスと予測される確率は1 − 𝑃 𝑥Ԧ
分類:多値分類の手法例(1) ロジスティック回帰 多値分類:カテゴリーが3つ以上の場合 多値分類の手法例(1): One-vs-Rest法: 複数の線形モデル𝑓𝑘 (𝑥)(𝑘:クラスインデックス)を用いて クラス1確率: P1 𝑥Ԧ ,クラス1でない確率: 1 − 𝑃1 𝑥Ԧ クラス2確率: P2 𝑥Ԧ ,クラス2でない確率: 1 − 𝑃2 𝑥Ԧ クラス3確率: P2 𝑥Ԧ ,クラス3でない確率: 1 − 𝑃3 𝑥Ԧ 最も確率が大きいクラス名を予測値とする。
分類:多値分類の手法例(2) ロジスティック回帰 多値分類の手法例(2): 多項ロジスティック回帰(Multinominal logistic regression): 全クラス(K)を一つのモデルで同時に学習する。 Softmax関数: 𝐾 𝑃𝑘 (𝑥) = exp(𝑓𝑘 𝑥 )/ exp(𝑓𝑗 𝑥 ) 𝑗 最も確率が大きいクラス(k)を予測値とする。
予測モデル学習手段 予測モデルとし て相関が高い関 数を得る 1. 観測データ 分割を行う。 2. モデル当て はめを行う 3. モデル評価 を行う 4. モデルを選 択する 訓練データ・テ ストデータに分 ける 訓練データに対 してある関数を 最適化する テストデータに 対して性能評価 指標値を得る 性能評価指標値 からモデルを選 択する。 (階層構造の一例)
分類評価指標(1) 評価指標 混同行列例 予測値 分類評価 指標 混同行列 二値分類 混同行列 観測値 回帰評価 指標 bcc bcc 8 fcc 1 hcp 3 misc 1 多値分類 混同行列 (階層構造の一例) fcc 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33
分類評価指標(2) 二値分類混同行列 評価指標 分類評価 指標 観測値 回帰評価 指標 予測値 混同行列 二値分類 混同行列 多値分類 混同行列 (階層構造の一例) 陽性 陰性 陽 性 真陽性 True Positive (TP) 偽陰性 False Negative (FN) 陰 性 偽陽性 False Positive (FP) 真陰性 True Negative (FN)
分類評価指標(3) 評価指標 回帰評価指標 分類評価指標 混同行列から 得られる評価 指標 混同行列 正答率 再現率 (階層構造の一例) 適合率 F1スコア
分類評価指標(4) 混同行列例 観測値 予測値 bcc fcc bcc fcc hcp misc 8 1 3 1 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33 正答率(Accuracy)=(8+5+17+33)/103=0.61 再現率(Recall):fcc再現率=5/(1+5+6+8)=0.25 適合率(Precision):fcc適合率=5/(5+2+2)=0.56 𝑅𝑒𝑐𝑎𝑙𝑙×𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑡𝑜𝑛 F1スコア=2 𝑅𝑒𝑐𝑎𝑙𝑙+𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 全体の指標に対しては、例えば、加重平均を取 る。
分類評価指標(4) 混同行列例 観測値 予測値 bcc fcc bcc fcc hcp misc 8 1 3 1 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33 正答率(Accuracy)=(8+5+17+33)/103=0.61 再現率(Recall):fcc再現率=5/(1+5+6+8)=0.25 適合率(Precision):fcc適合率=5/(5+2+2)=0.56 𝑅𝑒𝑐𝑎𝑙𝑙×𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑡𝑜𝑛 F1スコア=2 𝑅𝑒𝑐𝑎𝑙𝑙+𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 全体の指標に対しては、例えば、加重平均を取 る。
分類評価指標(4) 混同行列例 観測値 予測値 bcc fcc bcc fcc hcp misc 8 1 3 1 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33 正答率(Accuracy)=(8+5+17+33)/103=0.61 再現率(Recall):fcc再現率=5/(1+5+6+8)=0.25 適合率(Precision):fcc適合率=5/(5+2+2)=0.56 𝑅𝑒𝑐𝑎𝑙𝑙×𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑡𝑜𝑛 F1スコア=2 𝑅𝑒𝑐𝑎𝑙𝑙+𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 全体の指標に対しては、例えば、加重平均を取 る。
分類評価指標(4) 混同行列例 観測値 予測値 bcc fcc bcc fcc hcp misc 8 1 3 1 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33 正答率(Accuracy)=(8+5+17+33)/103=0.61 再現率(Recall):fcc再現率=5/(1+5+6+8)=0.25 適合率(Precision):fcc適合率=5/(5+2+2)=0.56 𝑅𝑒𝑐𝑎𝑙𝑙×𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑡𝑜𝑛 F1スコア=2 =0.35 𝑅𝑒𝑐𝑎𝑙𝑙+𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 全体の指標に対しては、例えば、加重平均を取 る。
分類評価指標(4) 混同行列例 観測値 予測値 bcc fcc bcc fcc hcp misc 8 1 3 1 0 5 2 2 hcp misc 6 0 6 8 17 2 9 33 正答率(Accuracy)=(8+5+17+33)/103=0.61 再現率(Recall):fcc再現率=5/(1+5+6+8)=0.25 適合率(Precision):fcc適合率=5/(5+2+2)=0.56 𝑅𝑒𝑐𝑎𝑙𝑙×𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑡𝑜𝑛 F1スコア=2 𝑅𝑒𝑐𝑎𝑙𝑙+𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 全体の指標に対しては、例えば、加重平均を取 る。
データ解析学手法の紹介 データ解析学手 法 既に収集された データを用いる 𝑦~𝑓(𝑥) Ԧ 目的変数の予測 =教師あり学習 目的のために随 時にデータを収 集する 説明変数間の関 係性を見つける =教師なし学習 {𝑥}のみ Ԧ
説明変数間の関係性を見つける {𝑥}のみ Ԧ 説明変数間の関係 性を見つける=教 師なし学習 量的説明変数 質的説明変数 低次元表現を 得る カテゴリー分 けをする 次元圧縮 クラスタリン グ (階層構造の一例)
説明変数間の関係性(1) {𝑥}のみ Ԧ ID 説明 説明 変数a 変数b … 説明 目的 変数P 変数 ID1 𝑜𝑏𝑠 𝑥1𝑎 𝑜𝑏𝑠 𝑥1𝑏 𝑜𝑏𝑠 𝑥1𝑃 𝑦1𝑜𝑏𝑠 ID2 𝑜𝑏𝑠 𝑥2𝑎 𝑜𝑏𝑠 𝑥2𝑏 𝑜𝑏𝑠 𝑥2𝑃 𝑦2𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥𝑁𝑃 𝑦𝑁𝑜𝑏𝑠 … … IDN 𝑜𝑏𝑠 𝑥𝑁𝑎 obs 𝑥𝑁𝑏 説明変数サイズ𝑃が多くなることでデータインスタンス間の関係性が分 からなくなりがち→次元圧縮:特徴を保ったまま説明変数を低次元で表 現する。
説明変数間の関係性(2) クラスタリング:類似度を用いたデータ空間のカテゴリー分け を通して{𝑥}の特徴を得る。 Ԧ 𝑥2 𝑦 𝑥1 𝑥1
説明変数間の関係性を見つける {𝑥}のみ Ԧ 説明変数間の関係 性を見つける=教 師なし学習 量的説明変数 質的説明変数 低次元表現を 得る グループ分け をする 次元圧縮 クラスタリン グ (階層構造の一例)
次元圧縮 ID 説明 変数 a 説明 変数 b ID1 𝑜𝑏𝑠 𝑥1𝑎 ID2 𝑜𝑏𝑠 𝑥2𝑎 … 説明 変数 P 目的 変数 𝑜𝑏𝑠 𝑥1𝑏 𝑜𝑏𝑠 𝑥1𝑃 𝑦1𝑜𝑏𝑠 𝑜𝑏𝑠 𝑥2𝑏 𝑜𝑏𝑠 𝑥2𝑃 𝑦2𝑜𝑏𝑠 𝑋 次元圧縮 … … IDN 低次元表現を 得る 𝑜𝑏𝑠 𝑥𝑁𝑎 obs 𝑥𝑁𝑏 𝑜𝑏𝑠 𝑥𝑁𝑃 𝑦𝑁𝑜𝑏𝑠 説明変数行列:𝑋、サイズ 𝑁, 𝑃 一般に非正方行列 開始等式大文字X 距離行列に変 換した𝑋を用 いた次元圧縮 𝑋をそのまま 用いた次元圧 縮 主成分分解 (PCA) 開始等式大文字X 全距離を用い た多様体学習 距離範囲を制 限した多様体 学習 MDS t-SNE (階層構造の一例)
主成分分解(PCA) 分布の長軸から順に回転させた 変数の組み合わせ(変数軸)を 選ぶ。 𝑥2 PCA2 PCA1 PCAの直感 → データの広がり方向を探す。 𝑥1
主成分分析と特異値分解 𝑋(サイズ 𝑁, 𝑃 )の特異値分解(SVD) 𝑋の主成分分解(PCA) X’ = X − 𝑋ത 𝑋 = 𝑈𝑆𝑊 𝑇 N>Pの場合は 𝑈 ∈ ℝ𝑁×𝑃 , 𝑆 ∈ ℝ𝑃×𝑃 , 𝑊 ∈ ℝ𝑃×𝑃 𝑠1 0 0 0 0 𝑠2 0 0 S= 0 ⋱ 0 𝑠𝑃 s1 ≥ s2 ≥ ⋯ ≥ sP ≥ 0と取れる。 低ランク近似、例えば、2成分のみ取る。 𝑠1 0 0 S′ = 0 𝑠2 0 0 0 0 として 𝑋′ = 𝑈𝑆′𝑊 𝑇 𝑋’は低ランク近似行列 (𝑋തj = σ𝑖 𝑋𝑖𝑗 ) として 1 Σ = 𝑁−1 𝑋′𝑇 𝑋’ を特異値分解する。 Σ = 𝑉𝐴𝑉 𝑇 𝑎1 0 0 𝐴 = 0 𝑎2 0 0 0 ⋱ 𝑎𝑖 ≥ 0と取れる。大きい順に並べる q次元目の寄与率= 𝑎𝑞 / σ𝑁 𝑞 𝑎𝑞 𝑄 Q次元目までの累積寄与率=Σ𝑞 𝑎𝑞 / σ𝑁 𝑞 𝑎𝑞 (説明変数間とデータインスタンス間がある。)
次元圧縮 低次元表現を 得る 次元圧縮 開始等式大文字X 距離行列に変 換した𝑋を用 いた次元圧縮 𝑋をそのまま 用いた次元圧 縮 主成分分解 (PCA) 開始等式大文字X 全距離を用い た多様体学習 距離範囲を制 限した多様体 学習 MDS t-SNE 距離関係を(あ る程度)保った まま、低次元表 現を求める手法。 (階層構造の一例)
説明変数間の関係性を見つける {𝑥}のみ Ԧ 説明変数間の関係 性を見つける=教 師なし学習 量的説明変数 低次元表現を 得る 次元圧縮 質的説明変数 カテゴリー分 けをする クラスタリン グ (階層構造の一例) 目的:ラベルが存在しない デ ータをグループ分け 例) 類似材料の自動分類
クラスタリング クラスタリング 類似度 各クラスタが独立 クラスタ間に系統 的な関係がある データインス タンス間類似 度 等方的なクラスタ リング k-Mean法 非等方的なクラス タング 階層クラスタリン グ法 ガウス混合分布法 上位クラスタ間距 離定義が異なる階 層クラスタリング 法 (階層構造の一例) 説明変数間類 似度
各クラスタが独立である手法 k-Means法 ガウス混合法 等方的なクラスタリング 非等方的なクラスタリング クラスター数(K) クラスター中心𝜇Ԧ𝑘 (𝑘) クラスタ𝐶𝑘 に属するデータインスタンス𝑥Ԧ𝑖 クラスター数(K) クラスター中心𝜇Ԧ𝑘 分散共分散行列Σ𝑘 各クラスタへの寄与確率 距離の和 𝐾 𝑁 2 (𝑘) 𝐽 = 𝑥Ԧ𝑖 − 𝜇Ԧ𝑘 𝑘 𝑖 を最小化する。 𝑁 𝑥Ԧ 𝜇, Ԧ Σ ~exp(− 1 2 𝑥Ԧ − 𝜇 𝑇 Σ−1 𝑥Ԧ − 𝜇 ) 𝐾 𝑝 𝑥Ԧ = 𝑤𝑘 𝑁 𝑥Ԧ 𝜇Ԧ𝑘 , Σ𝑘 𝑘
階層クラスタリング クラスタリン グ 類似度 クラスタ間に 系統的な関係 がある 各クラスタが 独立 等方的なクラ スタリング 非等方的なク ラスタリング 階層クラスタ リング法 k-Mean法 ガウス混合分 布法 上位クラスタ 間が異なる距 離定義方法 データインス タンス間類似 度 (階層構造の一例) • ある距離が近い順にクラスタを階層的に生成する。 • 上位のクラスター間の距離実装には様々な定義がある。 説明変数間類 似度
補足(1) よくある質問 「説明変数はどう選択するのか?」 この質問がなぜ起きたのか: (仮定:演繹法の世界では) 原理から出発した最適な選択法があるはずだから。 しかし、仮定が成立しない。データ解析学は演繹法の世界の話では無い。
補足(2) The fourh paradigm 主体 帰納法 演繹法 人が 第一段階 仮説の検証→法則 第二段階 法則の適用 計算機が 第四段階 “新帰納法” 第三段階 シミュレーション The Fourth Paradigm: Data-intensive Scientific Discovery, Tony Hey, Microsoft Pr.
帰納法と新帰納法の違い 主体の変更、量の変更 第一段階/帰納法 人が 法則仮説 人が 事実と 合うか? 妥当な法則 第四段階/“新機能法”
妥当な説明変数 質問:「説明変数はどう選択するのか?」 答え:「新機能法なので試行錯誤で妥当なものを選択する。」 他にも • ハイパーパラメタの最適化 • 回帰をするとして • 回帰モデルの選択 • カーネル回帰の場合 にカーネルの形 なども試行錯誤の対象になる。
補足(3) 予測モデルと説明変数 仮想的な全データ 観測データ 未知 データ 訓練 データ テスト データ モデル学習 妥当性の評価 予測モデル 適用 利用 説明変数 適用 予測モデルだけでなく、説明 変数も未知データに適用する ように作成(加工)する。
補足(4) データ解析学“部族”の カテゴリー分け例 データ解 析学者 Symbolist Connectionist Evolutionist Bayesian Analogizer 論理: 決定木 脳の動き: ニューラルネッ トワーク 生物: 進化論的手法 確率、ノイズ を取り入れる 類似性を用いた手 法:カーネル回帰、 多様体学習。 The Master Algorithm: How the Quest for the Ultimate Learning Machine Will Remake Our World, Pedro Domingos, Basic Books
以上です。