---
title: Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight)
tags: 
author: [品川政太朗](https://image.docswell.com/user/sei_shinagawa)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/PEXQ4ZW1JX.jpg?width=480
description: 2026年8月30-31日最先端NLP勉強会の発表資料です。 Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight) について紹介するための資料です。現状は仮スライドで、当日までに差し替え予定です
published: August 20, 26
canonical: https://image.docswell.com/s/sei_shinagawa/K1Q7N4-Beyond_Language_Modeling_An_Exploration_of_Multimodal_Pretraining
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/PEXQ4ZW1JX.jpg)

2026.08.30-31 最先端NLP勉強会
Beyond Language Modeling:
An Exploration of Multimodal Pretraining
Shengbang Tong, David Fan, John Nguyen, Ellis Brown, ほか（Meta FAIR / New York University）
ICML 2026 (spotlight)
紹介者：品川 政太朗


# Page. 2

![Page Image](https://bcdn.docswell.com/page/3EK9Z8VMED.jpg)

Beyond Language Modeling: An Exploration of Multimodal Pretrainingの概要
従来のよくあるVLM学習
• 学習済みの画像エンコーダ（＋画像デコーダ）を学習済みLLMに結合して学習
• LLMの影響が強くて何が効いてるのかよくわからない
本論文の貢献
Unified multimodal model (画像生成ありVLM)でマルチモーダル事前学習の効果を検証した
• 学習済みLLMをやめて、一からtextとimage-captionペアで学習（※画像エンコーダのみ固定）
• 「画像を混ぜると言語能力が落ちる」ようなモダリティ競合は起きるか、あるいは相補的かを
5軸で検証した
Visual
Representation
Data
World Model
Architecture
Scaling
どんな視覚表現
が最適か
データを混ぜる
と何が起きるか
世界モデル能力
の出どころ
容量をどう割り
当てるか
modality で法則
は違うのか
1


# Page. 3

![Page Image](https://bcdn.docswell.com/page/L73WD2M275.jpg)

（個人的）面白ポイント
著者勢はYann LeCun組（World Model勢）
• まず動画などの実データから物理現象などの因果関係を学習していくべき派
• native multimodal pre-trainingの皮をかぶっているが思想がだだ洩れなのが良い
• この論文の出版後、主要な著者勢がFAIRからAMI Labsに移籍している
2


# Page. 4

![Page Image](https://bcdn.docswell.com/page/87DKPZ66JG.jpg)

Unified language modelとは
•
•
•
•
ここではvisionのencoder/decoderが一体化し、理解/生成ができるモデル
LLM部分は未学習からスタート
vision encoder/decoderは学習済み
RAE decoderはvision encoderの埋め込みから画像を生成するよう学習したモデル
RAE decoderなど
LLM
vision
encoder
(SigLIP2など)
3


# Page. 5

![Page Image](https://bcdn.docswell.com/page/VJPKNYZZE8.jpg)

この論文で扱っているデータ（interleaved dataはなし）
4


# Page. 6

![Page Image](https://bcdn.docswell.com/page/2EVVKGWMEQ.jpg)

知見１：vision encoderとdecoderの埋め込み表現は共有した方が良い
テキストベンチマーク
画像生成ベンチマーク
VQA
SigLIP2（+RAE decoderが画像関係のベンチマークで突出）
5


# Page. 7

![Page Image](https://bcdn.docswell.com/page/57GLQ8DXEL.jpg)

知見２：言語とvisionは事前学習から混ぜると相補関係になる
言語タスク（DCLM, Notes）のPPLがマルチモーダルデータの追加で改善
• 動画予測が絡むと良い
• ただしimage-caption (MetaCLIP)を追加すると悪化
• 著者「captionの分布がテキストの分布と離れているからでは？」
• Actionのデータを含めると改善する
動画予測→
image-caption→
Action条件付き
動画予測→
6


# Page. 8

![Page Image](https://bcdn.docswell.com/page/4EQYK915JP.jpg)

知見２：言語とvisionは事前学習から混ぜると相補関係になる
vision token数固定でtext tokens数を増
やすと画像生成能力が向上
• 著者ら「GenEval などは複雑な text
prompt に条件づけられるため、言
語能力が高いモデルほど prompt を
理解でき、text-image alignment も
向上する」
VQAのみ単に増やすよりも、他モダリ
ティの
一般データを使う方が性能向上に寄与
7


# Page. 9

![Page Image](https://bcdn.docswell.com/page/KJ4WPXRV71.jpg)

知見３：NVMの能力獲得には一般のマルチモーダルデータが有効
NWM (Navigation World Model)
• Action（自然言語や水平方向の並進(dx, dy)回転(dyaw)）に条件づけられた動画予測
• 動画フレーム4枚 ＋ Action → 次の動画フレーム
• 評価方法
• 色々な経路をサンプリングして、ゴール画像とのLPIPSが最小の経路を選ぶ
• ATE（Absolute Trajectory Error）予測軌跡と正解軌跡の対応点の距離
• RPE（Relative Pose Error）連続時刻間の相対移動・相対回転が正しい
論文：https://arxiv.org/abs/2412.03572 (CVPR 2025 Best Paper Honorable Mention)
8


# Page. 10

![Page Image](https://bcdn.docswell.com/page/LE1Y9NQ47G.jpg)

知見３：NVMの能力獲得には一般のマルチモーダルデータが有効
50B/100B事前学習の比較
• マルチモーダルデータを混ぜると、
NWMタスクの性能（ATEとRPE）が
改善
• 特に一般動画（Video）が効果的
200B事前学習におけるNWMデータの
割合の影響
• マルチモーダルデータが十分なら
NWMはわずか1%で下がり切る
9


# Page. 11

![Page Image](https://bcdn.docswell.com/page/GEWGQ4MZJ2.jpg)

知見４：MoEにしておくとvision/text/multimodal expertが自然に分かれて高性能
• FFN層をvision/textに分けると性能が向上する→MoEでモデル自身に分担させる
• 層が深くなるにつれ、text→multimodal/visionにexpertの割合が変わる
• vision expertは理解・生成両方のタスクで使われる（ピアソン相関0.9）
※top-k個のexpertを選べる設定
10


# Page. 12

![Page Image](https://bcdn.docswell.com/page/47ZLW2QLJ3.jpg)

知見５：MoEにするとスケーリング則におけるデータのギャップが減る
IsoFLOP 解析：Chinchilla的なスケーリング則を見る
• 計算量固定で計算最適なmodel size, data size探索
• 言語：DCLM の validation loss
• 視覚：CC12M の diffusion loss
Dense
MoE
model data
model data
lang
0.47
0.53
lang
0.41
0.59
vision
0.37
0.63
vision
0.36
0.64
MoE に す る と langvision間の差が縮まる
11


# Page. 13

![Page Image](https://bcdn.docswell.com/page/YJ6WGV6MJV.jpg)

本論文の限界
SoTAの性能を出しているとかはない。ウリはあくまで統制された実験を
した点
• 画像は256トークンで固定（vision encoderで16x16トークンに圧縮）
• 事前学習LLMを使うより良いことを示したわけではない
• interleaved dataを全く使ってない（一応動画+Actionは形式的には
interleaved dataだが・・・）
• モデルの大きさは2.3B（active 1.5B）
12


# Page. 14

![Page Image](https://bcdn.docswell.com/page/GJ5MVD6QJ4.jpg)

所感
やはり動画、動画が本質。我々はWebデータを集めたりデータ合成する
より全員GoProとかつけて一般動画を撮りまくればPhysical AIでもいいと
こいける気がしている
13


# Page. 15

![Page Image](https://bcdn.docswell.com/page/9E2938MW7R.jpg)

補足資料
14


# Page. 16

![Page Image](https://bcdn.docswell.com/page/D7Y416X9EM.jpg)

補足1：モダリティの切り替えと attention 構造
系列のつくり方
画像・動画フレームは &lt;BOI&gt; I₁, I₂, …, I₂₅₆ &lt;EOI&gt; で囲む。学習時にも同
じ記号を使い、動画の場合は各フレームを個別に BOI / EOI で囲む
attention mask の hybrid 構造
text
通常の causal
同一画像内
推論時の手順
1. text を autoregressive に生成する
2. &lt;BOI&gt; を生成した時点で text 生成を停止
frame 間
bidirectional
causal
※ Appendix C。最近の any-to-any モデルを理解するうえでも参考になる部分
3. noise latent を挿入
4. 25-step Euler で flow matching を回す（画像フレーム全体の latent block
をまとめて更新）
navigation は行動もテキストで与える
5. &lt;EOI&gt; を追加
6. text の autoregressive 生成を再開
→ 構造的に T → I → T を一続きの sequence として実行できる。画像生成
中は「次の visual token を1個ずつ AR 生成」しているのではない点が重
要
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 28
15


# Page. 17

![Page Image](https://bcdn.docswell.com/page/VENY2Z1DJ8.jpg)

補足2：なぜ SigLIP latent から画像を戻せるのか（RAE）
SigLIP などの semantic feature は本来、画像再構成のための表現ではない
。しかし RAE (Representation Autoencoder) の decoder を学習しておけ
ば SigLIP latent → pixels を実現できる
層が深くなるほどのトレードオフ
ImageNet accuracy
PSNR
12.8% → 86.3%
29.6 dB → 20.9 dB
→ 深い特徴ほど pixel fidelity は下がり、semantic information は上がる。
Figure 16 では、初期層は碁盤や猫の細部まで忠実に再構成される一方、後
段では意味内容は保たれるが細部が滑らかになる
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 17
損失の設計と予測ターゲット
損失は L = λ_LM · L_LM + λ_flow · L_flow。既定は λ_LM = 1、λ_flow = 3
予測ターゲットは visual representation に依存する。RAE (SigLIP 2) では x-pred が v-pred を一貫して上回り（DPG 0.63 → 0.65）、言語への影響も
小さい。一方 VAE (FLUX.1) では x-pred にすると granularity を上げたときに text perplexity が跳ね上がる
→ 低次元表現では x-pred は不安定になりやすく、高次元表現では恩恵がある
16


# Page. 18

![Page Image](https://bcdn.docswell.com/page/Y79P1Z58E3.jpg)

補足3：3名の査読者の評価・指摘・回答
Reviewer KJGE
Reviewer 9ReQ
評価 unified multimodal pretraining という重要でタ
イムリーな問題。from-scratch かつ統制された設定で
representation / data / architecture / MoE / scaling を
切り分けている。future unified multimodal models の
reference paper になり得る
評価 pretrained initialization の confound を避けた
from-scratch study。4軸の体系的比較。world
modeling の emergence。MoE が language の
parameter-hungry 性と vision の data-hungry 性の違
いを緩和するという分析
指摘 データ品質と distribution shift の分析が浅い／
評価が proxy 寄り／interleaved data 未対応／typo・
writing／standard video generation benchmark がない
／DreamLLM・Emu・NExT-GPT との比較が弱い
指摘 text 能力を主に perplexity で評価している／
GenEval・DPGBench のbias と絶対性能／qualitative 比
較の不足／raw pixel が text PPL で最良な理由が不明／
BAGEL と逆の結論に見える
回答 Qwen3-Embedding-8B による t-SNE、DCLM と
の cosine distance、caption length を追加。image 側
にも bias はあるが text 側の shift の方が大きいと説明
。interleaved は future work と認めた
回答 332 model × 14 benchmark で ρ = −0.8468。
qualitative 例を追加。BAGEL の「MoE」は本論文の
modality-specific FFN に近いと整理
Reviewer P1j7
評価 （上2名と同様に実証研究としての価値を評価
）
指摘 text → vision の転移の mechanism が説明され
ていない／cosine distance と DCLM PPL の関係が単純
ではない／diffusion language models のように
objective 自体を統一する方向も検討に値する
回答 VQA では強い text prior が質問理解と回答生成
を助け、T2I では複雑な prompt の理解が alignment を
助ける可能性を説明。LLaVA 型 baseline との比較を提
示。diffusion-style language modeling は有望な方向と
認めた
最終判定：Strong Accept + Accept + Accept → Spotlight。AC は “strong empirical study and meaningful conclusion” を採択理由に挙げている
17


# Page. 19

![Page Image](https://bcdn.docswell.com/page/G78D41YZ7D.jpg)

補足4：データの内訳と、その他の実験結果
Dense モデルの scaling law
学習データ
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Table 2
I/T データソースの相補性
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 10
expert の共有設計（Table 1）
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 5
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Table 1
MetaCLIP を understanding に、Shutterstock を generation に割り当てると両者の
長所を取れる。データは capability ごとに独立に選べる可能性がある
256 expert / 16 active で、No Shared・Global Shared・Per-Modality Shared を比
較。per-modality の shared expert が全指標で最良で、モダリティごとに必要な容
量が違うことを示唆
18


