---
title: 生成AIの基盤モデルとしてのCVPR 2026とJust image Transformers
tags:  #コンピュータビジョン #生成ai #text-to-image #拡散モデル #aiアート  
author: [あるふ](https://image.docswell.com/user/alfredplpl)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/L7LMR8LXJR.jpg?width=480
description: 第67回 コンピュータビジョン勉強会＠関東（前編）で発表する内容です。 お題は、Back to Basics: Let Denoising Generative Models Denoiseです。
published: July 18, 26
canonical: https://image.docswell.com/s/alfredplpl/Z8N989-2026-07-18-082234
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/L7LMR8LXJR.jpg)

関東CV勉強会 / CVPR2026読み会
生成AIの基盤モデルとしての
CVPR 2026と
Just Image Transformers
自己紹介
全体傾向
JiTの主張
CVPR全体の雰囲気、Back to Basics / Just image Transformers の主張
CVPR overview + JiT deep dive
尾崎安範
2026-07


# Page. 2

![Page Image](https://bcdn.docswell.com/page/4EMYR6M3EW.jpg)

Short rest
発表時間があまるので、
大切なお知らせをします。
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 3

![Page Image](https://bcdn.docswell.com/page/PER9RPVRJ9.jpg)

Short rest
【ご報告】無職なう
お仕事募集中！
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 4

![Page Image](https://bcdn.docswell.com/page/P7XQR3ZYEX.jpg)

Self Introduction
【ご報告】無職なう
お仕事募集中！
尾崎安範 （あるふ）
Yasunori Ozaki (alfredplpl)
研究開発
アニメ生成基盤モデル: AnimeGen-T2Vなど
0から作った基盤モデル: CommonArtなど
LLMを含めた生成AIの設計から製品まで
理由保存（なぜ？を研究する）
Source: alfredplpl.github.io/research.html
AnimeGenで「桜並木を歩く少女」を生成した例
02


# Page. 5

![Page Image](https://bcdn.docswell.com/page/37K9RY847D.jpg)

【ご報告】無職なう
お仕事募集中！
Self Introduction
0から作った基盤モデルたちの紹介
画像生成
Source: alfredplpl.github.io/research.html
動画生成
音生成
02


# Page. 6

![Page Image](https://bcdn.docswell.com/page/LJ3W892DJ5.jpg)

Short rest
閑話休題。CVPR本編へ
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 7

![Page Image](https://bcdn.docswell.com/page/8JDKMGZ2EG.jpg)

OVERVIEW
まず、CVPR 2026のタイトルを眺めてみよう
Source: CVPR2026 O penAccess titles; local title frequency script
03


# Page. 8

![Page Image](https://bcdn.docswell.com/page/VEPKR3DL78.jpg)

OVERVIEW
CVPR 2026は生成AIの基盤モデル関連がおおそう
CVPR 2026 OpenAccessの全タイトルを集計した結果が以下の通り
1 3D / video
2 生成・拡散
3 言語・推論
3D: 480
generation: 318
multimodal: 284
video: 378
diffusion: 232
vision-language: 236
motion / dynamicも上位
training: 173
reasoning: 230
今日のゴール: 生成・拡散の例として
Just Image Transformersを
生成AIの基盤モデル設計として読む
Source: CVPR2026 O penAccess titles; local title frequency script
03


# Page. 9

![Page Image](https://bcdn.docswell.com/page/27VVR4167Q.jpg)

Paper Introduction
Back to Basics: Let Denoising Generative Models Denoise
Tianhong Li1, Kaiming He1
1MIT
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 10

![Page Image](https://bcdn.docswell.com/page/5JGLM1227L.jpg)

Important Assumption
論文の重要な前提として、多様体仮説がある。
画像生成における多様体 (image manifold) 仮説とは、
「自然画像はピクセル空間全体にばらばらに存在するのではなく、
意味のある画像だけが低次元の“なめらかな構造”の上に分布している」
という仮説
画像生成において、
なぜか多様体を直接予測するのではなく、
ノイズ予測（ε-pred）や速度予測（v-pred）するのが
実験的に良いとDDPMとか言っている
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 11

![Page Image](https://bcdn.docswell.com/page/47QYRDP9EP.jpg)

JiT Short Claim
Back to Basicsの主張とは
尾崎が超訳すると
「画像生成モデルは素直に画像生成しろ」
ということである。
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 12

![Page Image](https://bcdn.docswell.com/page/KE4W8ZXRJ1.jpg)

JIT DESIGN
素直に実装したJust image Transformerの仕組み
ざっくりとした画像生成の流れ
１．ノイズがのった画像をパッチ分割する
２．パッチ分割された画像を
Transformerでノイズ除去する
３．ノイズ除去したパッチをくっつける
VAEとかややこしいのは一切使わない！
※ 厳密に言うとやや違う
（これはv-lossでx-predしてるため。論文読んでね。）
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT
09


# Page. 13

![Page Image](https://bcdn.docswell.com/page/L71Y2RNVJG.jpg)

JIT EVIDENCE
実験結果を見ると、実は素直に実装しただけでも強いとわかる
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT
10


# Page. 14

![Page Image](https://bcdn.docswell.com/page/G7WGR143E2.jpg)

JiT Novelty
したがって、JiTの新規性とは、
「素直に実装した画像生成は
有効であることを実験で示した。
なぜなら多様体仮説があるから」
ということなのである
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT, CVPR 2026


# Page. 15

![Page Image](https://bcdn.docswell.com/page/4JZLRP2GE3.jpg)

GOAL
今日のゴール: 生成AIの基盤モデル設計
生成AIの基盤モデルそのものは素直に作れ
• JiTは素直な仮説で素直に作った
• Back to Basics: 基本にもどれ
• 結局、モデルはスケーリングすればよい
• The Bitter Lessons: 苦い教訓
• 素直な仮定と素直な手法が一番
• それがだめなときに、複雑な手法
Paper: Back to Basics: Let Denoising Generative Models Denoise / JiT
09


