生成AIの基盤モデルとしてのCVPR 2026とJust image Transformers

2.1K Views

July 18, 26

スライド概要

第67回 コンピュータビジョン勉強会@関東(前編)で発表する内容です。
お題は、Back to Basics: Let Denoising Generative Models Denoiseです。

profile-image

サラリーマン研究員。

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

(ダウンロード不可)

関連スライド

各ページのテキスト
1.

関東CV勉強会 / CVPR2026読み会 生成AIの基盤モデルとしての CVPR 2026と Just Image Transformers 自己紹介 全体傾向 JiTの主張 CVPR全体の雰囲気、Back to Basics / Just image Transformers の主張 CVPR overview + JiT deep dive 尾崎安範 2026-07

2.

Short rest 発表時間があまるので、 大切なお知らせをします。 Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

3.

Short rest 【ご報告】無職なう お仕事募集中! Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

4.

Self Introduction 【ご報告】無職なう お仕事募集中! 尾崎安範 (あるふ) Yasunori Ozaki (alfredplpl) 研究開発 アニメ生成基盤モデル: AnimeGen-T2Vなど 0から作った基盤モデル: CommonArtなど LLMを含めた生成AIの設計から製品まで 理由保存(なぜ?を研究する) Source: alfredplpl.github.io/research.html AnimeGenで「桜並木を歩く少女」を生成した例 02

5.

【ご報告】無職なう お仕事募集中! Self Introduction 0から作った基盤モデルたちの紹介 画像生成 Source: alfredplpl.github.io/research.html 動画生成 音生成 02

6.

Short rest 閑話休題。CVPR本編へ Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

7.

OVERVIEW まず、CVPR 2026のタイトルを眺めてみよう Source: CVPR2026 O penAccess titles; local title frequency script 03

8.

OVERVIEW CVPR 2026は生成AIの基盤モデル関連がおおそう CVPR 2026 OpenAccessの全タイトルを集計した結果が以下の通り 1 3D / video 2 生成・拡散 3 言語・推論 3D: 480 generation: 318 multimodal: 284 video: 378 diffusion: 232 vision-language: 236 motion / dynamicも上位 training: 173 reasoning: 230 今日のゴール: 生成・拡散の例として Just Image Transformersを 生成AIの基盤モデル設計として読む Source: CVPR2026 O penAccess titles; local title frequency script 03

9.

Paper Introduction Back to Basics: Let Denoising Generative Models Denoise Tianhong Li1, Kaiming He1 1MIT Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

10.

Important Assumption 論文の重要な前提として、多様体仮説がある。 画像生成における多様体 (image manifold) 仮説とは、 「自然画像はピクセル空間全体にばらばらに存在するのではなく、 意味のある画像だけが低次元の“なめらかな構造”の上に分布している」 という仮説 画像生成において、 なぜか多様体を直接予測するのではなく、 ノイズ予測(ε-pred)や速度予測(v-pred)するのが 実験的に良いとDDPMとか言っている Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

11.

JiT Short Claim Back to Basicsの主張とは 尾崎が超訳すると 「画像生成モデルは素直に画像生成しろ」 ということである。 Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

12.

JIT DESIGN 素直に実装したJust image Transformerの仕組み ざっくりとした画像生成の流れ 1.ノイズがのった画像をパッチ分割する 2.パッチ分割された画像を Transformerでノイズ除去する 3.ノイズ除去したパッチをくっつける VAEとかややこしいのは一切使わない! ※ 厳密に言うとやや違う (これはv-lossでx-predしてるため。論文読んでね。) Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT 09

13.

JIT EVIDENCE 実験結果を見ると、実は素直に実装しただけでも強いとわかる Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT 10

14.

JiT Novelty したがって、JiTの新規性とは、 「素直に実装した画像生成は 有効であることを実験で示した。 なぜなら多様体仮説があるから」 ということなのである Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026

15.

GOAL 今日のゴール: 生成AIの基盤モデル設計 生成AIの基盤モデルそのものは素直に作れ • JiTは素直な仮説で素直に作った • Back to Basics: 基本にもどれ • 結局、モデルはスケーリングすればよい • The Bitter Lessons: 苦い教訓 • 素直な仮定と素直な手法が一番 • それがだめなときに、複雑な手法 Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT 09