3.2K Views
August 20, 26
スライド概要
2026年8月30-31日最先端NLP勉強会の発表資料です。
Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight) について紹介するための資料です。現状は仮スライドで、当日までに差し替え予定です
某生成AI企業でVLMの開発や研究をしています。奈良先端大で客員助教をしています。 まとめたスライドをこちらで公開します。
2026.08.30-31 最先端NLP勉強会 Beyond Language Modeling: An Exploration of Multimodal Pretraining Shengbang Tong, David Fan, John Nguyen, Ellis Brown, ほか(Meta FAIR / New York University) ICML 2026 (spotlight) 紹介者:品川 政太朗
Beyond Language Modeling: An Exploration of Multimodal Pretrainingの概要 従来のよくあるVLM学習 • 学習済みの画像エンコーダ(+画像デコーダ)を学習済みLLMに結合して学習 • LLMの影響が強くて何が効いてるのかよくわからない 本論文の貢献 Unified multimodal model (画像生成ありVLM)でマルチモーダル事前学習の効果を検証した • 学習済みLLMをやめて、一からtextとimage-captionペアで学習(※画像エンコーダのみ固定) • 「画像を混ぜると言語能力が落ちる」ようなモダリティ競合は起きるか、あるいは相補的かを 5軸で検証した Visual Representation Data World Model Architecture Scaling どんな視覚表現 が最適か データを混ぜる と何が起きるか 世界モデル能力 の出どころ 容量をどう割り 当てるか modality で法則 は違うのか 1
(個人的)面白ポイント 著者勢はYann LeCun組(World Model勢) • まず動画などの実データから物理現象などの因果関係を学習していくべき派 • native multimodal pre-trainingの皮をかぶっているが思想がだだ洩れなのが良い • この論文の出版後、主要な著者勢がFAIRからAMI Labsに移籍している 2
Unified language modelとは • • • • ここではvisionのencoder/decoderが一体化し、理解/生成ができるモデル LLM部分は未学習からスタート vision encoder/decoderは学習済み RAE decoderはvision encoderの埋め込みから画像を生成するよう学習したモデル RAE decoderなど LLM vision encoder (SigLIP2など) 3
この論文で扱っているデータ(interleaved dataはなし) 4
知見1:vision encoderとdecoderの埋め込み表現は共有した方が良い テキストベンチマーク 画像生成ベンチマーク VQA SigLIP2(+RAE decoderが画像関係のベンチマークで突出) 5
知見2:言語とvisionは事前学習から混ぜると相補関係になる 言語タスク(DCLM, Notes)のPPLがマルチモーダルデータの追加で改善 • 動画予測が絡むと良い • ただしimage-caption (MetaCLIP)を追加すると悪化 • 著者「captionの分布がテキストの分布と離れているからでは?」 • Actionのデータを含めると改善する 動画予測→ image-caption→ Action条件付き 動画予測→ 6
知見2:言語とvisionは事前学習から混ぜると相補関係になる vision token数固定でtext tokens数を増 やすと画像生成能力が向上 • 著者ら「GenEval などは複雑な text prompt に条件づけられるため、言 語能力が高いモデルほど prompt を 理解でき、text-image alignment も 向上する」 VQAのみ単に増やすよりも、他モダリ ティの 一般データを使う方が性能向上に寄与 7
知見3:NVMの能力獲得には一般のマルチモーダルデータが有効 NWM (Navigation World Model) • Action(自然言語や水平方向の並進(dx, dy)回転(dyaw))に条件づけられた動画予測 • 動画フレーム4枚 + Action → 次の動画フレーム • 評価方法 • 色々な経路をサンプリングして、ゴール画像とのLPIPSが最小の経路を選ぶ • ATE(Absolute Trajectory Error)予測軌跡と正解軌跡の対応点の距離 • RPE(Relative Pose Error)連続時刻間の相対移動・相対回転が正しい 論文:https://arxiv.org/abs/2412.03572 (CVPR 2025 Best Paper Honorable Mention) 8
知見3:NVMの能力獲得には一般のマルチモーダルデータが有効 50B/100B事前学習の比較 • マルチモーダルデータを混ぜると、 NWMタスクの性能(ATEとRPE)が 改善 • 特に一般動画(Video)が効果的 200B事前学習におけるNWMデータの 割合の影響 • マルチモーダルデータが十分なら NWMはわずか1%で下がり切る 9
知見4:MoEにしておくとvision/text/multimodal expertが自然に分かれて高性能 • FFN層をvision/textに分けると性能が向上する→MoEでモデル自身に分担させる • 層が深くなるにつれ、text→multimodal/visionにexpertの割合が変わる • vision expertは理解・生成両方のタスクで使われる(ピアソン相関0.9) ※top-k個のexpertを選べる設定 10
知見5:MoEにするとスケーリング則におけるデータのギャップが減る IsoFLOP 解析:Chinchilla的なスケーリング則を見る • 計算量固定で計算最適なmodel size, data size探索 • 言語:DCLM の validation loss • 視覚:CC12M の diffusion loss Dense MoE model data model data lang 0.47 0.53 lang 0.41 0.59 vision 0.37 0.63 vision 0.36 0.64 MoE に す る と langvision間の差が縮まる 11
本論文の限界 SoTAの性能を出しているとかはない。ウリはあくまで統制された実験を した点 • 画像は256トークンで固定(vision encoderで16x16トークンに圧縮) • 事前学習LLMを使うより良いことを示したわけではない • interleaved dataを全く使ってない(一応動画+Actionは形式的には interleaved dataだが・・・) • モデルの大きさは2.3B(active 1.5B) 12
所感 やはり動画、動画が本質。我々はWebデータを集めたりデータ合成する より全員GoProとかつけて一般動画を撮りまくればPhysical AIでもいいと こいける気がしている 13
補足資料 14
補足1:モダリティの切り替えと attention 構造 系列のつくり方 画像・動画フレームは <BOI> I₁, I₂, …, I₂₅₆ <EOI> で囲む。学習時にも同 じ記号を使い、動画の場合は各フレームを個別に BOI / EOI で囲む attention mask の hybrid 構造 text 通常の causal 同一画像内 推論時の手順 1. text を autoregressive に生成する 2. <BOI> を生成した時点で text 生成を停止 frame 間 bidirectional causal ※ Appendix C。最近の any-to-any モデルを理解するうえでも参考になる部分 3. noise latent を挿入 4. 25-step Euler で flow matching を回す(画像フレーム全体の latent block をまとめて更新) navigation は行動もテキストで与える 5. <EOI> を追加 6. text の autoregressive 生成を再開 → 構造的に T → I → T を一続きの sequence として実行できる。画像生成 中は「次の visual token を1個ずつ AR 生成」しているのではない点が重 要 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 28 15
補足2:なぜ SigLIP latent から画像を戻せるのか(RAE) SigLIP などの semantic feature は本来、画像再構成のための表現ではない 。しかし RAE (Representation Autoencoder) の decoder を学習しておけ ば SigLIP latent → pixels を実現できる 層が深くなるほどのトレードオフ ImageNet accuracy PSNR 12.8% → 86.3% 29.6 dB → 20.9 dB → 深い特徴ほど pixel fidelity は下がり、semantic information は上がる。 Figure 16 では、初期層は碁盤や猫の細部まで忠実に再構成される一方、後 段では意味内容は保たれるが細部が滑らかになる Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 17 損失の設計と予測ターゲット 損失は L = λ_LM · L_LM + λ_flow · L_flow。既定は λ_LM = 1、λ_flow = 3 予測ターゲットは visual representation に依存する。RAE (SigLIP 2) では x-pred が v-pred を一貫して上回り(DPG 0.63 → 0.65)、言語への影響も 小さい。一方 VAE (FLUX.1) では x-pred にすると granularity を上げたときに text perplexity が跳ね上がる → 低次元表現では x-pred は不安定になりやすく、高次元表現では恩恵がある 16
補足3:3名の査読者の評価・指摘・回答 Reviewer KJGE Reviewer 9ReQ 評価 unified multimodal pretraining という重要でタ イムリーな問題。from-scratch かつ統制された設定で representation / data / architecture / MoE / scaling を 切り分けている。future unified multimodal models の reference paper になり得る 評価 pretrained initialization の confound を避けた from-scratch study。4軸の体系的比較。world modeling の emergence。MoE が language の parameter-hungry 性と vision の data-hungry 性の違 いを緩和するという分析 指摘 データ品質と distribution shift の分析が浅い/ 評価が proxy 寄り/interleaved data 未対応/typo・ writing/standard video generation benchmark がない /DreamLLM・Emu・NExT-GPT との比較が弱い 指摘 text 能力を主に perplexity で評価している/ GenEval・DPGBench のbias と絶対性能/qualitative 比 較の不足/raw pixel が text PPL で最良な理由が不明/ BAGEL と逆の結論に見える 回答 Qwen3-Embedding-8B による t-SNE、DCLM と の cosine distance、caption length を追加。image 側 にも bias はあるが text 側の shift の方が大きいと説明 。interleaved は future work と認めた 回答 332 model × 14 benchmark で ρ = −0.8468。 qualitative 例を追加。BAGEL の「MoE」は本論文の modality-specific FFN に近いと整理 Reviewer P1j7 評価 (上2名と同様に実証研究としての価値を評価 ) 指摘 text → vision の転移の mechanism が説明され ていない/cosine distance と DCLM PPL の関係が単純 ではない/diffusion language models のように objective 自体を統一する方向も検討に値する 回答 VQA では強い text prior が質問理解と回答生成 を助け、T2I では複雑な prompt の理解が alignment を 助ける可能性を説明。LLaVA 型 baseline との比較を提 示。diffusion-style language modeling は有望な方向と 認めた 最終判定:Strong Accept + Accept + Accept → Spotlight。AC は “strong empirical study and meaningful conclusion” を採択理由に挙げている 17
補足4:データの内訳と、その他の実験結果 Dense モデルの scaling law 学習データ Tong et al., "Beyond Language Modeling", ICML 2026 — Table 2 I/T データソースの相補性 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 10 expert の共有設計(Table 1) Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 5 Tong et al., "Beyond Language Modeling", ICML 2026 — Table 1 MetaCLIP を understanding に、Shutterstock を generation に割り当てると両者の 長所を取れる。データは capability ごとに独立に選べる可能性がある 256 expert / 16 active で、No Shared・Global Shared・Per-Modality Shared を比 較。per-modality の shared expert が全指標で最良で、モダリティごとに必要な容 量が違うことを示唆 18