【人工知能・深層学習】論文紹介:LoopedTransformer

>100 Views

September 26, 26

スライド概要

M2の千さんが、LoopedTransformerについて説明を行いました。本論文では、推論能力を高めるためには、パラメータ数の増加だけでなく、計算の深さが重要であるという観点から、同じTransformerブロックを繰り返し適用するLooped Transformerを検討しています。本手法は、重みを共有したまま内部の隠れ状態を反復的に更新することで、パラメータ数を増やさずに計算の深さを確保します。実験では、複数の推論タスクにおいて、同じパラメータ数の浅いモデルを上回り、同じ計算量の深い非ループモデルに匹敵、あるいは上回る性能を示しました。一方、同じ計算量の非ループモデルと比較すると、言語予測や知識記憶を測る課題では劣る傾向が見られました。また、理論的には、T個のダミートークンを作業領域として備えた構成により、TステップのCoTをT回のループで模倣できることを示しています。さらに、通常のTransformerでも、対応するブロックの重みを近づける正則化によって、言語予測性能をほぼ維持しながら推論性能を改善できることを報告しています。

profile-image

立教大学大学院人工知能科学研究科における瀧雅人准教授が主催する研究室で2020年度からスタートしているまだ若い組織です。 最先端の深層学習について、高度化・説明性向上などをテーマに深く幅広く研究しています。 また医療や神経科学・物理学におけるデータ分析や、産業への社会実装にも携わっています。 研究室内のPaper Reading活動の記録として、研究室学生の発表資料を公開しています。 ご興味をお持ちの方は、HPをご確認ください。

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
1.

ジャーナルクラブ 論文紹介 REASONING WITH LATENT THOUGHTS: On the Power of Looped Transformers 千 智元(セン チゲン・Zhiyuan Qian)瀧研究室 2026 / 09 / 26

2.

https://arxiv.org/abs/2502.17416 1

3.

従来LLMの性能を高めるアプローチ [OpenAI 2020] 計算量・データ量 ・モデルサイズ の拡大に伴い、トークン予測の 損失が低下する。 幅と深さの配分による損失の差は 、広い範囲で小さい。 アーキテクチャの工夫よりも、計算量・データ量・モデルサイズの拡大が性能向上に支配的 Kaplan et al. (2020). Scaling Laws for Neural Language Models. arXiv: 2001.08361, 2020. 2

4.

言語モデルの推論能力をどう高めるか? 推論能力を高める鍵は、モデルの大きさだけでなく「深さ」 [Meta FAIR 2024] 推論タスクに得意 Ye et al. (2024). Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process. 3

5.

推論能力を高める鍵は、モデルの大きさだけでなく深さ 同じサイズで深いモデルほどヘッド数を減らしているのは、総パラメータ数をおおむね揃えて比較するため 同程度のパラメータ数でも、層が深いモデルほど、推論問題で高い正答率を保つ Ye et al. (2024). Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process. 4

6.

一般的なモデルを深くする方法 計算の回数は増えるが、それに伴ってパラメータ数、計算量も増加 5

7.

パラメータを増やさずに「深さ」を増やせるか? → Looped Transformer:同じ層の繰り返し のTransformer る を に る Looped Transformer 同じ のTransformer のTransformer: を る 4組の を に る るパラメータ、4 の 計算 Looped Transformer: 1組の Transformer層 パラメータ、4 Transformer層 の 計算 Transformer層 Transformer層 パラメータ Transformer層 実質的な深さは等しい。 Transformer層 Transformer層 Transformer層 Transformer層 とに る を に同じ を とに る を Looped Transformer:層を再利用し、パラメータを追加せずに実質的な深さを増やす 6

8.

目次 1. Language Modeling with Looped Models • 人工的 推論タスクで、ループによる深さの効果を確認する 2. Language Modeling with Looped Models • 一般的 テキストで学習しても、推論への強みが現れることを確認する 3. Looping-Inspired Regularization • ループ構造の利点を モデルの訓練にも取り込める 4. Theoretical Analysis For Looped Models • ループで、どのよう 計算・推論を実現できるかを 論的に示す 5. 中心論文から広がる2つの問い 7

9.

推論タスクで直接訓練したループモデルは、 少ないパラメータでも、同じ実質的な深さの非ループモデルに匹敵する性能を示す Looped Models on Simple Reasoning Tasks

10.

実験設定:モデル設定 9

11.

n-ary addition/p-hop induction/i-GSM 10

12.

ループ型モデルは、少ないパラメータでも、 同じ計算量の深い モデルとほぼ同等の正解率を達成 11

13.

ループ型モデルは、少ないパラメータでも、 同じ計算量の深い モデルとほぼ同等の正解率を達成 モデル パラメータ 精度 12 12倍 100% ベースライン 1 1倍 0.1% ループ 1倍 99% ベースライン 1 *12 12

14.

まとめ 同じパラメータ数で比較(学習条件:推論 課題のみで学習) • ループ型は、浅い る モデルを大きく上 同じ計算量(FLOPs)で比較 • ループ型は、深い モデルとほぼ同等 次の問い 一般的なテキストで事前学習した言語モデルでも、同様の効果は見られるか? 13

15.

一般的なテキストで学習しても、ループ型モデルは推論に強みを示す Language Modeling with Looped Models 14

16.

一般的なテキストで学習しても、ループ型モデルは推論に強みを示す 前の節:人工的に生成した推論タスクで学習・評価 今回:一般テキストを含む2,500億トークンで、次トークン予測を事前学習 結果: ① 性能比較:少ないパラメータでも高い推論性能 同じ計算量の深い モデルに対し、知識・次トークン予測では劣る一方、数学・推論で は匹敵し、一部で上 る。 ② 帰納バイアス:推論に有利な学習傾向 PPLだけでは説明でき い推論性能の高さが見られ、ループ構造が推論に 利に働くこと を示唆する。 ③ スケーリング:反復によって推論性能が向上 ループ 数を増やした構成ほど性能が向上する傾向があり、特に推論を必要とする課題で 効果が大きい。→ Chain-of-Thoughtである可能性 15

17.

ループ型モデルは、少ないパラメータでも高い推論性能を発揮する 同じ計算量の24層モデルと比較:知識・言語モデリングでは劣るが、推論では匹敵・凌駕 正解の次トークンに、どれだけ高い確率を割り 当てられるかを表す指標。 Perplexity 低いほど、言語モデリング性能が高い。 0% ら、ループ化によって、浅い モ デルから改善してい いことを意味し、 100% ら、ループモデルが モデルと 同じ性能に達したことを意味し、 100%を超えると、ループモデルが デルを上 ったことに る。 ループによる計算の深さの追加は、特に推論課題で効果を発揮する。 例:4 を6 ループするモデルは、24 の モデルを上 る。 →帰納バイアス? モ 16

18.

ループ型モデルが推論に有利な帰納バイアスを持つ可能性がある 推論に有利な帰納バイアスがあるかを確認するため、 事前学習の途中で定期的に評価を行い、検証損失(Perplexityの対数)と、下流タスクの正解率との関係 をプロットし、線形回帰で傾向を確認する。 同程度の言語予測性能(log perplexity)でも、ループ型モデルは推論を要する課題で高い 正答率を示す傾向がある。これは、推論に有利な帰納バイアスを示唆する。 17

19.

深さによる性能の伸びは、QAでは ループによる性能の伸びは、 モデル、基礎推論ではループモデルが大きい モデルの深さを増やした場合の約半分 D:実質的な深さ ループによる性能の伸びは、 モデルの深さを増やした場合の約1.2倍 α:log(D)に対する正答率の伸び 知識の想起や読解を含むQAでは、通常の層追加による性能の伸びが大きい。一方、基礎的な 推論課題(Reasoning Primitives)では、同じ層の反復でも同等以上の伸びが得られた。 18

20.

繰り返すことで推論が強くなる性質は、CoTと共通している可能 深さによる性能の伸びは、QAでは モデル、基礎推論ではループモデルが大きい 性がある。 ループによる性能の伸びは、 モデルの深さを増やした場合の約半分 ループによる性能の伸びは、 モデルの深さを増やした場合の約1.2倍 • CoTは、言語トークンを生成し、それを次の入力として計算を進める。 • ループモデルは、同じブロックを繰り返し適用し、内部の隠れ状態を更新 D:実質的な深さ α:log(D)に対する正答率の伸び する。 知識の想起や読解を含むQAでは、通常の層追加による性能の伸びが大きい。一方、基礎的な では、ループモデルは言葉にせずにCoTの計算を再現できるか?→ 推論課題(Reasoning Primitives)では、同じ層の反復でも同等以上の伸びが得られた。 Theoretical Analysis For Looped Models 19

21.

まとめ ループモデルは、同じ実質的 深さの非ループモデル より少 いパラメータで、推論タスクに強みを示す。 一方、Perplexityや知識の記憶を測るタスクでは劣る 傾向がある。 同程度のPerplexityで比較しても推論性能が高く、 ループ構造には推論に有利な帰納バイアスが示唆され る。 Next Step Perplexityを悪化させずに、 ループ構造の推論上の利点を取り込めるか? 20

22.

パープレキシティの性能を維持しながら、推論性能を高める Looping-Inspired Regularization 21

23.

正則化でループモデルの強みを取り込む 目的: • 通常モデルのPerplexity(次のトークンを正しく予測する能力)を維持しながら、ループモデルの 推論能力を取り入れる。 提案: • 通常モデルをループ型モデルに近い構造へと導く「正則化」を提案する。具体的には、複数の層 からなるブロック間で、対応する重みが似るように促す。 数式: 例: ブロック1 ブロック2 ブロック3 第1 ─────── 第5 ─────── 第9 第2 ─────── 第6 ─────── 第10 第3 ─────── 第7 ─────── 第11 第4 ─────── 第8 ─────── 第12 L:モデル全体の 数 k:1ブロックの 数、i:ブロック番号、j:ブロック内の の位置 G:比較する重みの種類。たとえばAttentionのQuery行列 22

24.

訓練終了時のパラメータグループ間Cosine類似度 24層のモデルを4層ずつ6ブロックに分け、正則化強度 λ=10で訓練。縦軸・横軸はブロック番号(0〜5)を表す。 異なるブロック間でも類似度は約0.97〜0.99、正則化によって対応する重みの方向が近づいたことが分かる。 23

25.

重みを完全に共有しなくても、ブロック間の重みを似せることで、 次のトークンの予測性能を保ちながら、推論性能を高められる Baseline vs Looped Baseline vs Regularized 正則化によって、推論に有利な性質を得られる。 24

26.

重みを完全に共有しなくても、ブロック間の重みを似せることで、 次のトークンの予測性能を保ちながら、推論性能を高められる 1ブロックの層数 正則化強度 λ=10 25

27.

まとめ ブロック間の対応する重みを近づける正則化により、 通常モデルのPerplexityをほぼ維持しながら、推論性能が向上した。 Next Step Looped Transformerは、CoTの計算 を再現できるかを確認する。 26

28.

Looped Transformerは、CoTの計算を再現できる Theoretical Analysis For Looped Models 27

29.

Looped Transformerは、CoTの計算を再現できる • 列 v に対して、CoTを m ステップ進めた の • 列vの • パラメータ ろに、ダミートークン # を m 個追加 をm ループするLooped Transformer CoTの m ステップと同じ出力を、m 回のループで再現する。 28

30.

Looped Transformerは、CoTの計算を再現できる CoTの m ステップと同じ出力を、m 回のループで再現する。 29

31.

REASONING WITH LATENT THOUGHTS: On the Power of Looped Transformers まとめ 本論文は、多くの推論課題では、パラメータ数を増やすこと以上に、計算の深さを確保することが重 要であると示唆する。 実験では、Looped Transformerが同じパラメータ数の浅いモデルを上回り、複数の推論課題で同じ FLOPsの深い非ループモデルに匹敵、あるいは上回った。一方、同じFLOPsのモデルと比較すると、言 語予測のperplexityや、知識記憶を主に測るclosed-book QAでは劣った。 理論的には、T個のダミートークンを作業領域として追加し、モデル構成を拡張することで、Tステッ プのCoTと同じ出力をT回のループで再現できることを示した。これは表現能力に関する結果であり、 通常の学習で同じ計算過程が獲得されることを保証するものではない。 30

32.

本論文から広がる2つの問い ① Looped Transformerで、反復による推論能力を引き出すには、モデル構造や訓練方法に どのような工夫が有効か? → Scaling up Test-Time Compute with Latent Reasoning, NeurIPS 2025 ② 言葉にせず内部の状態を更新することが推論に役立つなら、既存のモデルにも取り入れ られるのではないか? 層をループさせる構造を導入しなくても、事前学習済み Transformerに、言語化しない多段階推論(Latent Thought Reasoning)を学習させられる か? → Training Large Language Models to Reason in a Continuous Latent Space(Coconut) 31

33.

反復を推論に活かすには、どんな工夫があるか? Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171

34.

モデルの構造: 各ループで同じ重みを共有し、入力表現 e を注入する仕組み Prelude:入力を埋め込み層とTransformer層に通し、入力表現 e を作る Recurrent Block:入力表現 e と直前の状態 sᵢ₋₁ を受け取り、潜在状態を更新する Coda:最後の潜在状態から、次のトークンの確率分布を出力する 33

35.

反復回数をランダムに変えて訓練する 反復回数のランダム化 • 訓練時に反復回数 r をサンプリングする • さまざまな計算量で予測できるように学習する 逆伝播の打ち切り • 主実験では、最後の最大8回の反復だけで逆伝播する • 長い反復でも、訓練メモリと逆伝播の計算量を抑える 最初の24回 最後の8回 順伝播:潜在状態を計算 実行する 実行する 逆伝播:勾配を計算 この区間はさかのぼらない この区間を通して計算する 34

36.

推論時の追加計算による性能改善 35

37.

本論文から広がる2つの問い ① Looped Transformerで、反復による推論能力を引き出すには、モデル構造や訓練方法に どのような工夫が有効か? → Scaling up Test-Time Compute with Latent Reasoning, NeurIPS 2025 ② 言葉にせず内部の状態を更新することが推論に役立つなら、既存のモデルにも取り入れ られるのではないか? 層をループさせる構造を導入しなくても、事前学習済み Transformerに、言語化しない多段階推論(Latent Thought Reasoning)を学習させられる か? → Training Large Language Models to Reason in a Continuous Latent Space(Coconut) 36

38.

非ループモデルにも潜在推論を学ばせられるか? Training Large Language Models to Reason in a Continuous Latent Space https://arxiv.org/abs/2412.06769 37

39.

単語に変換せず、隠れ状態を次の入力へ渡す CoT: • 中間の推論を単語として生成し、次の入力に加える 「提案手法」Coconut:Chain of Continuous Thought • 最後の隠れ状態を、 単語に変換せず、 次の位置の入力埋め込みとして直接使う 38

40.

潜在推論の価値は、正答率と推論に必要な計算の両面で評価 39

41.

まとめ CoTは、中間の推論をトークンとして生成し、後続の計算に利用することで、多段階の計算を可 能にする。 Looped Transformerは、同じブロックを反復して潜在状態を更新し、パラメータ数を増やさず に実効的な深さを増やす。 中心論文は、この構造が推論に有利な帰納バイアスを持つことを実験的に示し、補助的な作業 領域を備えた構成ではCoTを模倣できることを理論的に示した。 2つの問い: ① 反復を活用した推論を実現するために、モデル構造や訓練方法にどのような工夫があるか? → 訓練時から反復回数をランダムに変え、さまざまな計算量で予測するように学習する。 ② 既存のTransformerにも、言語化しない多段階推論を学習させられるか? → 最後の隠れ状態を次の入力埋め込みとして再入力する。 CoTを段階的に連続表現へ置き換える追加学習によって、潜在推論を学習させられる。 40