---
title: JDLA主催 CVPR 2026 技術報告会 コンピュータビジョン技術の最前線
tags:  #cvpr #ai #deep learning #学会報告 #マルチモーダルai  
author: [モルフォ](https://image.docswell.com/user/Morpho)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/4JZL5RX9E3.jpg?width=480
description: 2026年7月29日に、日本ディープラーニング協会主催（JDLA）の「CVPR2026技術報告会」にてモルフォの技術者が登壇した際の、当日の発表資料です。 詳細はテックブログをご覧ください。 https://techblog.morphoinc.com/
published: October 09, 26
canonical: https://image.docswell.com/s/Morpho/KVJED2-2026-10-09-110000
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/4JZL5RX9E3.jpg)

CVPR 2026 技術報告会
コンピュータビジョン技術の最前線
2026年7⽉29⽇
リサーチャー ⻑⼭‧プラディプト


# Page. 2

![Page Image](https://bcdn.docswell.com/page/YE6W9R4DEV.jpg)

⽬次
1
2
3
はじめに
株式会社モルフォのご紹介
CVPR⼊⾨
CVPRとは何か‧なぜ重要か
ビジネスパーソン向けの基礎知識
今年のトレンド
注⽬分野‧重要論⽂のご紹介
⼩休憩
4
5
Technical Deep Dive
モルフォ視点で注⽬技術を深堀り
質疑応答
10min
15min
30min
5min
25min
30min
※ 本スライド資料は、弊社の技術ブログ (morpho tech blog) にて後⽇公開予定です
Copyright © 2026 Morpho, Inc. All Rights Reserved.
2


# Page. 3

![Page Image](https://bcdn.docswell.com/page/GE5MN8Q8E4.jpg)

株式会社モルフォの紹介
Copyright © 2026 Morpho, Inc. All Rights Reserved.
3


# Page. 4

![Page Image](https://bcdn.docswell.com/page/97295KPVJR.jpg)

株式会社モルフォについて
2004 2011 166
創業
東証マザーズ上場
（現グロース市場）
グループ社員
5
123
61
特許
海外売上比率
カ国
代表取締役社長
平賀 督基
海外展開
%
Masaki Hilaga
画像処理 / AI技術の研究・製品開発
スマートデバイス・車載モビリティ・DX向けソフトウェア事業を
グローバルに展開
33
億
グループ売上
16
%
研究開発費率
2025年10月期時点
Copyright © 2026 Morpho, Inc. All Rights Reserved.
4


# Page. 5

![Page Image](https://bcdn.docswell.com/page/DJY4KN5Q7M.jpg)

事業領域
先進のイメージイング・テクノロジーにより、利便性・安心安全・生産性の向上に貢献する
・スマートフォン
・PC/タブレット端末
スマート
デバイス
・車載カメラ
・ドライブレコーダー
・OCR
・監視カメラ 等
車載
モビリティ
DX
Copyright © 2026 Morpho, Inc. All Rights Reserved.
5


# Page. 6

![Page Image](https://bcdn.docswell.com/page/V7NYRXN2E8.jpg)

スマートデバイス｜画像処理（古典手法 × Deep Learning）
動画手振れ補正
ノイズ除去AI技術
ナイトモード向けダイナミックレンジ補正
超解像技術
Copyright © 2026 Morpho, Inc. All Rights Reserved.
6


# Page. 7

![Page Image](https://bcdn.docswell.com/page/YJ9PM8RD73.jpg)

車載モビリティ｜自動車向け AI技術
車室外カメラ
車室内カメラ
テレマティクス
自動運転・運転支援
乗員状態認識
クラウド連携サービス
物体検知技術
OMS: 乗員姿勢推定
道路劣化診断
オートキャリブレーション
DMS: ドライバー認識
動画のAI要約
Copyright © 2026 Morpho, Inc. All Rights Reserved.
7


# Page. 8

![Page Image](https://bcdn.docswell.com/page/GJ8DL8W5JD.jpg)

DX｜分野別ソリューション事例
OCR
画像解析AIソリューション
建設DX
旧字体認識・新字への変換
転倒検知・物体検出
橋脚補強現場 DX
アナログメーター読み取り
Copyright © 2026 Morpho, Inc. All Rights Reserved.
8


# Page. 9

![Page Image](https://bcdn.docswell.com/page/LJLMLRN3ER.jpg)

新規事業開発
Wearable Device
視覚障碍者向けデバイスの開発
障害物検知
Photogrammetry
計測・三次元再構成
横断歩道認識
Copyright © 2026 Morpho, Inc. All Rights Reserved.
9


# Page. 10

![Page Image](https://bcdn.docswell.com/page/47MYMRXM7W.jpg)

モルフォは画像処理と AI技術領域に特化した
ソフトウェア研究開発カンパニーです
Copyright © 2026 Morpho, Inc. All Rights Reserved.
10


# Page. 11

![Page Image](https://bcdn.docswell.com/page/P7R9VRNLE9.jpg)

ビジネスパーソン向け CVPR ⼊⾨
CVPR とは何か、なぜ重要か
Copyright © 2026 Morpho, Inc. All Rights Reserved.
11


# Page. 12

![Page Image](https://bcdn.docswell.com/page/PJXQZR867X.jpg)

CVPRとは？
CVPR
Conference on Computer Vision and Pattern Recognition
初回は1983年にT.KanadeとD.Balladが開催
毎年、6月から7月頃に開催されるComputer Vision系の国際会議
開催地は主にアメリカ国内
画像：https://x.com/CVPR/status/1996681273419714810
Copyright © 2026 Morpho, Inc. All Rights Reserved.
12


# Page. 13

![Page Image](https://bcdn.docswell.com/page/3JK98RKGJD.jpg)

CVPRとは？
⼈間の⽬と脳が持つ⾼次視覚機能を理解し、
コンピューターによる再現‧実装を⽬指す分野
CVPR
Conference on Computer Vision and Pattern Recognition
国際会議
コンピュータービジョン
パターン認識
初回は1983年にT.KanadeとD.Balladが開催
毎年、6月から7月頃に開催されるComputer Vision系の国際会議
開催地は主にアメリカ国内
画像：https://x.com/CVPR/status/1996681273419714810
Copyright © 2026 Morpho, Inc. All Rights Reserved.
13


# Page. 14

![Page Image](https://bcdn.docswell.com/page/LE3W28Z5E5.jpg)

AI関連の国際会議
画像処理の
国内会議だと
MIRU が有名
出典：https://www.kamishima.net/archive/MLDMAImap.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
14


# Page. 15

![Page Image](https://bcdn.docswell.com/page/8EDKZMRY7G.jpg)

Google Scholar Metricsによる学術誌ランキング
CVPRは論⽂⾃体の数‧引⽤数ともに世界トップレベルの学会です！
(h5-indexが450→過去5年間で450回以上引⽤された論⽂数が450本以上存在）
出典： https://scholar.google.com/citations?view_op=top_venues
Copyright © 2026 Morpho, Inc. All Rights Reserved. 15


# Page. 16

![Page Image](https://bcdn.docswell.com/page/V7PKDRW2J8.jpg)

過去に発表された AI 系重要論⽂ピックアップ
2009
2014
2015
2022
ImageNet
R-CNN
FCN
LDM
ImageNet: A Large-scale
Hierarchical Image
Database
Rich feature hierarchies
for accurate object
detection and semantic
segmentation
Fully Convolutional
Networks For Semantic
Segmentation
High-Resolution Image
Synthesis With Latent
Diﬀusion Models
Jonathan Long, et al.
Robin Rombach, et al.
セグメンテーションにおける線形
層を捨て全てConvolutionで表現
10.1109/CVPR.2015.7298965
代表的な画像⽣成基盤モデルであ
るStable Diﬀusionの元論⽂
10.1109/CVPR52688.2022.01042
Jia Deng, et al.
後にAlexNetによって第３次AI
ブームの⽕つけ役となる
ImageNetデータセットを提供
https://www.image-net.org/
Ross Girshick, et al.
CNNによる物体検出の先駆け
10.1109/CVPR.2014.81
Copyright © 2026 Morpho, Inc. All Rights Reserved.
16


# Page. 17

![Page Image](https://bcdn.docswell.com/page/2JVV1R8XJQ.jpg)

Longuet-Higgins Prize
概要
● Test-of-Time Award (時の試練賞)
○
○
○
○
現在の研究に最も⼤きな影響を与えた過去の論⽂を表彰
ちょうど10 年前に発表された論⽂が対象 (CVPR 2016)
ImageNet/R-CNN/FCNはいずれも受賞経歴あり
前年度は FCN と GoogLeNet
GoogLeNet
Going Deeper with Convolutions
Christian Szegedy, et al.
計算量とパラメータ数を⼤幅に削減したCNNアーキテクチャ
当時としては最も深い 22 層のアーキテクチャを実現
「より Deep に」を加速させる契機となる
10.1109/CVPR.2015.7298594
Copyright © 2026 Morpho, Inc. All Rights Reserved.
17


# Page. 18

![Page Image](https://bcdn.docswell.com/page/5EGL2M5RJL.jpg)

Longuet-Higgins Prize
CVPR 2026
今年の受賞は YOLO と ResNet
YOLO
ResNet
You Only Look Once: Uniﬁed, Real-Time Object Detection
Deep Residual Learning for Image Recognition
Joseph Redmon, et al.
Kaiming He, et al.
従来は複数段のフェーズが必要だった物体検出パイプラインを、単⼀の
ニューラルネットワークで置き換えられることを⽰した記念碑的論⽂。
要素技術としては置き換えられつつも、現代に⾄るまで「YOLO シリーズ」
というブランドとして活躍。
10.1109/CVPR.2016.91
レイヤーの前後に残差接続を取り付けるだけというシンプルなアイデアで、
GoogLeNet の 2~7 倍程度の深さ (50~152層) での学習を初めて実現。
現代のニューラルネットに必要不可⽋な基礎設計であり、最重要技術と
⾔っても過⾔では無い。
10.1109/CVPR.2016.90
Copyright © 2026 Morpho, Inc. All Rights Reserved.
18


# Page. 19

![Page Image](https://bcdn.docswell.com/page/4JQYPRZY7P.jpg)

Longuet-Higgins Prize
来年の受賞予想
来年の受賞候補は……？
Copyright © 2026 Morpho, Inc. All Rights Reserved.
19


# Page. 20

![Page Image](https://bcdn.docswell.com/page/K74WY83ZE1.jpg)

Longuet-Higgins Prize
来年の受賞予想
来年の受賞候補は……？
本命？: FPN
現代でも基本モジュールとして利⽤される
マルチスケール特徴量融合⼿法を提案
対抗①？: pix2pix
条件付き⽣成モデルを利⽤した i2i 変換
というタスクを⼀般化
対抗②？: PointNet
点群データをニューラルネットで直接扱う
研究路線の出発点
Copyright © 2026 Morpho, Inc. All Rights Reserved.
20


# Page. 21

![Page Image](https://bcdn.docswell.com/page/LJ1Y621DEG.jpg)

CVPR ⼊⾨ まとめ
CVPR は CV 分野のトップカンファレンス！
重要な AI 系論文を多数生み出した実績
画像：https://x.com/CVPR/status/1996681273419714810
Copyright © 2026 Morpho, Inc. All Rights Reserved.
21


# Page. 22

![Page Image](https://bcdn.docswell.com/page/GJWGWR8872.jpg)

CVPR 2026 の概要
Copyright © 2026 Morpho, Inc. All Rights Reserved.
22


# Page. 23

![Page Image](https://bcdn.docswell.com/page/4EZL5R8973.jpg)

CVPR 2026 開催情報
概要
開催地: デンバー (コロラド州)
会場: Colorado Convention Center
会期: 2026年 6⽉3⽇(⽔) 〜 7⽇(⽇)
スケジュール
Denver
6/3 - 6/4:
ワークショップ‧チュートリアル
6/5 - 6/7:
メインカンファレンス‧エキスポ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
23


# Page. 24

![Page Image](https://bcdn.docswell.com/page/Y76W9RPD7V.jpg)

CVPR2026の開催地:デンバー (コロラド州)
●
●
●
●
アメリカ中⻄部に位置する
結構歴史がある(今年150周年)
標⾼約 1,600m に位置(Mile-high city)
デンバー国際空港 (敷地⾯積が成⽥の 10 倍程
度)
出典: http://images.flydenver.com/Airport-Facilities
Copyright © 2026 Morpho, Inc. All Rights Reserved.
24


# Page. 25

![Page Image](https://bcdn.docswell.com/page/G75MN8K874.jpg)

デンバー (コロラド州)
●
歴史とモダンが融合する魅力的な街並み
○
○
○
●
Lower-Downtown（LoDo）地区：19世紀末の美しい赤レン
ガ建築が立ち並ぶエリア。
ユニオン駅（ Union Station)
Big Blue Bear：会場（コンベンションセンター）を覗き込む、
高さ12mの青いクマ。
南西部・ラテン文化の影響が色濃い豊かな食文化
○
○
メキシコ文化が強く反映された、本格的なタコスなどのグル
メを市内で楽しめる。
デンバー名物の青唐辛子「グリーンチリ」など、鮮やかな
ローカルフードが魅力 。
Copyright © 2026 Morpho, Inc. All Rights Reserved.
25


# Page. 26

![Page Image](https://bcdn.docswell.com/page/9J295KWVER.jpg)

CVPR2026主なコンテンツ
Workshops(153) &amp; Tutorials(19)
Tutorialは教育的・体系的な内容Workshopは
より実践的
Oral Session
(全141件の講演 (4トラック
×6セッション枠）
注目度の高い論文が発表される
Poster Session
Key Notes
最も活発にやり取りが行われる
並行して企業ブースもあり
著名な方が講演
●
●
●
Programmable Biology: Generative AI for Molecular Design(分子の自動設計 )
Transforming Computing with Quantum-Centric Supercomputing (量子融合計算 )
Scaling Laws vs. Neural Laws: Toward More Natural Artificial Vision (脳に学ぶ視覚 )
出典: https://x.com/cvpr
Copyright © 2026 Morpho, Inc. All Rights Reserved.
26


# Page. 27

![Page Image](https://bcdn.docswell.com/page/DEY4KNLQJM.jpg)

CVPR 2026 の新たな取り組み
プログラムにおける2つの変更点：新しい論文トラックと、コミュニティの計算資源利用に関する初の取り組み
新トラック
Findings
背景 — CVPRはすべての優れた論文を採録しきれなかった—
他の学会でもすでに見られる傾向。
計算資源報告イニシアチブ
Compute Reporting
目的： CVPRコミュニティ内の計算資源利用の実態を把握する。
18
選定方法 — エリアチェアが、CVPRで紹介するにふさわしい質の
高い論文を選定。
26
172
Compute Gold Star
Eﬃcient CVPR
Transparency
Champion
卓越した効率性を達成
優れた計算効率を実証
詳細で網羅的なログを提供
公開方法 — これらの論文は「Findings」として別途公開される。
制約 — Findings論文は他の査読付き会議・論文誌には投稿で
きない。
Copyright © 2026 Morpho, Inc. All Rights Reserved.
27


# Page. 28

![Page Image](https://bcdn.docswell.com/page/VJNYRX4278.jpg)

CVPR 2026 論⽂
Copyright © 2026 Morpho, Inc. All Rights Reserved.
28


# Page. 29

![Page Image](https://bcdn.docswell.com/page/YE9PM8QDJ3.jpg)

投稿‧採択論⽂数の推移
CVPR 2026 Highlights
投稿数 (Submissions)
16,092
ALL-TIME HIGH
前年⽐ +23.7%
採択数 (Accepted)
4,071
ALL-TIME HIGH
前年⽐ +41.5%
採択率 (Acceptance Rate)
25.3%
Copyright © 2026 Morpho, Inc. All Rights Reserved.
29


# Page. 30

![Page Image](https://bcdn.docswell.com/page/GE8DL8G5ED.jpg)

発表‧収録トラック
オーラル (Oral) 141 件
Oral
141
Highlight
575
Poster
3,355
Findings Track
941
24のセッションに分かれて⼝頭発表
ハイライト (Highlight) 575 件
ポスターのうち、上位論⽂と認定されたもの
ポスター (Poster) 3,355 件
オーラル‧ハイライト以外の全て採択論⽂
Findings Track 941 件
本開催とは別枠‧査読者の興味を引いたRejected論⽂
Copyright © 2026 Morpho, Inc. All Rights Reserved.
30


# Page. 31

![Page Image](https://bcdn.docswell.com/page/LELMLRG37R.jpg)

Award 選定プロセス
Oral
141
Highlight
575
Award Candidates 74論文
各Talk sessionで用意
↓
🏆Award 5論文
Poster
3,355
Findings Track
941
Copyright © 2026 Morpho, Inc. All Rights Reserved.
31


# Page. 32

![Page Image](https://bcdn.docswell.com/page/4JMYMRQMJW.jpg)

Award 種別
Best Paper 1 件 👑
Best Paper Honorable Mention（次点） 2 件
Best Student Paper 1 件 👑
Best Student Paper Honorable Mention（次点） 1 件
Copyright © 2026 Morpho, Inc. All Rights Reserved.
32


# Page. 33

![Page Image](https://bcdn.docswell.com/page/PJR9VR8L79.jpg)

最優秀論⽂賞 次点 (Honorable Mention)
Best Student Paper
Honorable Mention
Best Paper
Honorable Mention
Best Paper
Honorable Mention
ChordEdit
SAM 3D
NitroGen
ChordEdit: One-Step Low-Energy
Transport for Image Editing
SAM 3D: 3Dfy Anything in Images
NitroGen: A Foundation Model
for Generalist Gaming Agents
Liangsi Lu, et al.
⾼速なテキストベース画像編集⼿法
単⼀画像から3D形状‧テクスチャ‧レ
イアウトを復元する3D基盤モデル
https://chordedit.github.io/
https://ai.meta.com/research/sam3d/
Xingyu Chen, et al.
Loïc Magne, et al.
ゲームプレイ動画から学習した
Vision-to-Action 基盤モデル
https://nitrogen.minedojo.org/
Copyright © 2026 Morpho, Inc. All Rights Reserved.
33


# Page. 34

![Page Image](https://bcdn.docswell.com/page/PEXQZRL6JX.jpg)

最優秀学⽣論⽂賞 (Best Student Paper)
TRELLIS.2
Native and Compact Structured Latents for 3D Generation
Jianfeng Xiang, et al.
https://microsoft.github.io/TRELLIS.2/
オープンソースの⾼品質 text-to-3D モデル。
各ボクセルに特徴量ベクトルが付随する
ような3D表現 (Omni-Voxel) を提案。
更にスパース VAEを組み合わせることで
コンパクトな潜在表現を獲得し、現実的な
計算量で⽣成アルゴリズム (フローマッチング)
を実現。
Copyright © 2026 Morpho, Inc. All Rights Reserved.
34


# Page. 35

![Page Image](https://bcdn.docswell.com/page/3EK98RLGED.jpg)

最優秀論⽂賞 (Best Paper)
D4RT
“dart” (/dɑːt/, /dɑɹt/)
Eﬃciently Reconstructing Dynamic Scenes One D4RT at a Time
Chuhan Zhang, et al.
https://d4rt-paper.github.io/
ダイナミック 4D 再構成 + トラッキング⼿
法。単⼀の動画から、動的なシーン全体の
3D構造と カメラの軌跡、物体の動きを同
時に効率よく推定 するニューラルネット
ワーク⼿法。従来のパイプ ラインと異な
り、全てのタスクを統⼀された表現 へと統
合することで、圧倒的な計算速度の向上と
⾼い精度の両⽴を同時に達成した画期的な
アプローチ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
35


# Page. 36

![Page Image](https://bcdn.docswell.com/page/L73W283575.jpg)

次のパートからは最先端の研究
およびトレンドにフォーカスします！
Copyright © 2026 Morpho, Inc. All Rights Reserved.
36


# Page. 37

![Page Image](https://bcdn.docswell.com/page/87DKZM4YJG.jpg)

CVPR 2026 のトレンド
モルフォ視点で注⽬の分野‧論⽂のご紹介
Copyright © 2026 Morpho, Inc. All Rights Reserved.
37


# Page. 38

![Page Image](https://bcdn.docswell.com/page/VJPKDRM2E8.jpg)

CVPR 2026 のトレンド
CVPR 2026 採択論⽂数
4,071 本
調査の概要
全てを読むことは現実的に不可能
対象
CVPR 2026 採択論文の
タイトル (全件)
せめて、トレンドだけでも把握したい...
● 最先端の⼿法は？
● 流⾏の分野は？
● 多くの論⽂に共通するトピックは？
手法
テキストマイニング
(自然言語処理)
CVPR 2026 全論⽂のタイトルを
テキストマイニング
比較対象
過去4年 (CVPR 2022-2025)
と同様の調査を実施
Copyright © 2026 Morpho, Inc. All Rights Reserved.
38


# Page. 39

![Page Image](https://bcdn.docswell.com/page/2EVV1R9XEQ.jpg)

ユニグラム分析
ワードクラウド
Copyright © 2026 Morpho, Inc. All Rights Reserved.
39


# Page. 40

![Page Image](https://bcdn.docswell.com/page/57GL2MZREL.jpg)

ユニグラム分析
出現頻度 top 30
CVPR 2026 論⽂のタイトルに⽤いられた単語のランキング
Copyright © 2026 Morpho, Inc. All Rights Reserved.
40


# Page. 41

![Page Image](https://bcdn.docswell.com/page/4EQYPRLYJP.jpg)

ユニグラム分析
出現頻度 top 30
今年も同じトレンドが継続 (⾚字は今年新しく top 30 ⼊りしたワード)
Copyright © 2026 Morpho, Inc. All Rights Reserved.
41


# Page. 42

![Page Image](https://bcdn.docswell.com/page/KJ4WY8DZ71.jpg)

ユニグラム分析
急上昇ワード: 概要
vlm: Vison-Language Model
mllm: Multimodal Large Language Model
LLM 関連ワードの流⼊が顕著
‧Vision-language を代表にマルチモーダルが⼀般化
reasoning / vlm / mllm / token / autoregressive /
multimodal
強化学習 (RL) の再来
‧VLM や⽣成モデルの post-training として急成⻑
reinforcement / reward / optimization
エージェント化
‧認識‧⽣成の完成モデルを⾏動として使う⽅向
agent / planning
Copyright © 2026 Morpho, Inc. All Rights Reserved.
42


# Page. 43

![Page Image](https://bcdn.docswell.com/page/LE1Y62ZD7G.jpg)

ユニグラム分析
急上昇ワード: 特記事項
Mamba アーキテクチャブームの収束
‧順位は #114 → #357 (Δpp: -0.7) と急落
‧予想ほど Vision タスク向けの改良が進まなかったと考えられる
“spatial”: 空間リーズニング‧空間知能の急拡⼤
‧増分の 46% 分は “spatial reasoning” と “spatial intelligence” に由来
‧VLM/MLLM の空間推論能⼒関連ワード
“hierarchical”: VLM や multimodal の派⽣現象
‧LLM/VLM ベースシステムの⻑⽂脈‧多ステップの問題を
解決するアルゴリズムとして階層化の利⽤が拡⼤
Copyright © 2026 Morpho, Inc. All Rights Reserved.
43


# Page. 44

![Page Image](https://bcdn.docswell.com/page/GEWGWR98J2.jpg)

CVPR 2026 のトレンド
モダリティ語の推移
多様化‧複合化が顕著
●
language 系語彙は2022年以降に急伸
2024年以降は約17%で⾼⽌まり
●
multimodal 系は2024年6.6%
→ 2026年15.8% へ拡⼤
image 系語彙を上回る
●
video / 3Dも2018年⽐では増加
視覚モダリティ側も拡⼤
●
image は相対的に減少
Copyright © 2026 Morpho, Inc. All Rights Reserved.
44


# Page. 45

![Page Image](https://bcdn.docswell.com/page/47ZL5R99J3.jpg)

CVPR 2026 のトレンド
タスク語の推移
「認識」から「⽣成‧理解」へ
●
generation: 2.7% → 11.5%
2024年以降、最多のタスク語
●
detection / segmentation:
ピーク後に低下
recognition / estimation も同様
●
reconstruction / understanding
editing も上昇
○
⽣成‧構成‧理解へ裾野が拡⼤
Copyright © 2026 Morpho, Inc. All Rights Reserved.
45


# Page. 46

![Page Image](https://bcdn.docswell.com/page/YJ6W9RKDJV.jpg)

CVPR 2026 のトレンド
1
マルチモーダル AI (VLM / MLLM)
2
動画⽣成‧理解‧⻑⽂脈化
3
⽣成モデル基礎技術の成熟
4
3D / 4D 空間知能と Gaussian Splatting
5
Vision-to-Action (Embodied AI / ロボティクス / VLA / 世界モデル)
視覚タスクが⾔語‧指⽰‧推論の枠組みに吸収
静⽌画中⼼から、時間‧物語‧マルチビュー⻑時間理解へ
拡散モデルは基盤化し、速度‧制御‧少ステップ⽣成‧フローマッチングへ
3D 再構成から、汎化可能な空間‧世界表現へ拡張
⾒る‧答えるモデルから、環境内で判断し⾏動するモデルへ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
46


# Page. 47

![Page Image](https://bcdn.docswell.com/page/GJ5MN8P8J4.jpg)

CVPR 2026 のトレンド
1
マルチモーダル AI (VLM / MLLM)
2
動画⽣成‧理解‧⻑⽂脈化
3
⽣成モデル基礎技術の成熟
4
3D / 4D 空間知能と Gaussian Splatting
5
Vision-to-Action (Embodied AI / ロボティクス / VLA / 世界モデル)
視覚タスクが⾔語‧指⽰‧推論の枠組みに吸収
静⽌画中⼼から、時間‧物語‧マルチビュー⻑時間理解へ
本⽇は 1,2,5 の分野を紹介
拡散モデルは基盤化し、速度‧制御‧少ステップ⽣成‧フローマッチングへ
3D 再構成から、汎化可能な空間‧世界表現へ拡張
⾒る‧答えるモデルから、環境内で判断し⾏動するモデルへ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
47


# Page. 48

![Page Image](https://bcdn.docswell.com/page/LE3W283GE5.jpg)

CVPR 2026 のトレンド
マルチモーダル AI
Copyright © 2026 Morpho, Inc. All Rights Reserved.
48


# Page. 49

![Page Image](https://bcdn.docswell.com/page/8EDKZM4N7G.jpg)

マルチモーダルAI
出典: https://vnext.co.jp/v-blog/what-is-multimodal-ai.html
Copyright © 2026 Morpho, Inc. All Rights Reserved.
49


# Page. 50

![Page Image](https://bcdn.docswell.com/page/V7PKDRMNJ8.jpg)

代表的なマルチモーダルAI研究分野 (⼀例)
CVPR 2026 では、特に VLM と MLLM の躍進が顕著
Vision
Vision-Language
(VLM / MLLM)
画像‧動画 + ⾔語
Vision-Language
Action
(VLA)
画像‧動画 + ⾔語 + ⾏動

Audio
Sensor
Omni
Sensor Fusion
Omni-Modal /
Any-to-Any
Audio-Visual
映像 + ⾳声
Speech /
Audio-Language
Camera + LiDAR
+ Radar + IMU
etc.
任意モダリティ間の
統合理解‧⽣成
⾳声‧⾳響 + ⾔語
このパートでは主に VLM / MLLM のみを扱います（VLA は独⽴項⽬として扱います）
Copyright © 2026 Morpho, Inc. All Rights Reserved.
50


# Page. 51

![Page Image](https://bcdn.docswell.com/page/2JVV1R9YJQ.jpg)

VLM / MLLM
VLM / MLLM: 画像‧動画 + テキストを⼊⼒し、テキストを⽣成
●
●
出⼒が画像+テキスト、あるいは画像のみの
場合、VLM に含めないことが多い
MLLM は VLM より広い概念で、
⾳声などの他モダリティも⼊⼒に含める
CLIP (ICML 2021) による Vision-Language
統合理解が分野の出発点
●
CLIP ⾃⾝はテキストではなく埋め込み表現
を⽣成するので、現代では「VLM」に
分類されないことが多い
引用: https://openai.com/ja-JP/index/clip/
Copyright © 2026 Morpho, Inc. All Rights Reserved.
51


# Page. 52

![Page Image](https://bcdn.docswell.com/page/5EGL2MZWJL.jpg)

VLM / MLLM
VLM の応⽤例:
Visual Question Answering
(VQA)
●
●
●
与えられた画像とテキストに
対応する、適切な返答を
⾏うタスク
現代の AI チャットボットに
おける「当たり前の機能」
右図は LLaVA の実例
引用: https://llava-vl.github.io/
Copyright © 2026 Morpho, Inc. All Rights Reserved.
52


# Page. 53

![Page Image](https://bcdn.docswell.com/page/4JQYPRLQ7P.jpg)

CVPR 2026 におけるマルチモーダルの特徴
「VLM」/「MLLM」概念の再編成
●
従来は、LLM の拡張から
「テキストを出⼒するモデル」という
理解が⼀般的
●
CVPR 2026 では「視覚⾔語統合型
マルチモーダル基盤モデル」に移⾏
○
例: Rex-Omni (物体検出)
“Rex-Omni is a 3B-parameter Multimodal
Large Language Model (MLLM) that
redefines object detection and a wide
range of other visual perception tasks as a
simple next-token prediction problem.”
引用: https://rex-omni.github.io/
Copyright © 2026 Morpho, Inc. All Rights Reserved.
53


# Page. 54

![Page Image](https://bcdn.docswell.com/page/K74WY8DYE1.jpg)

CVPR 2026 におけるマルチモーダルの特徴
Omni-modal / Any-to-Any の標榜
●
「何でも⼊⼒‧何でも出⼒」を
⽬指す論⽂の増加
●
多くのモダリティがトークン化
(Tokenize) によって、LLM の
枠組みで扱えるようになった
ことが主要因
引用:
https://openaccess.thecvf.com/content/CVPR2026/papers/Li_UniM_A_Unified_Any-to-Any_Interl
eaved_Multimodal_Benchmark_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
54


# Page. 55

![Page Image](https://bcdn.docswell.com/page/LJ1Y62ZNEG.jpg)

論⽂紹介: Molmo2
完全にオープンソースな動画 VLM
●
●
●
ソースコードからモデルウェイト、
学習データの作成⽅法に⾄るまで
再現実装可能なレベルで公開
○ ただし、⼀部データセットは既存
データセットに由来
8B モデルは多くのタスクにおいて
オープンモデル中最良の評価
Video Pointing タスクでは Gemini 3 Pro を
上回る評価
○ 内容に沿ったフレームと座標を返すタスク
引用:
https://openaccess.thecvf.com/content/CVPR2026/papers/Clark_Molmo2
_Open_Weights_and_Data_for_Vision-Language_Models_with_Video_C
VPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
55


# Page. 56

![Page Image](https://bcdn.docswell.com/page/GJWGWR6M72.jpg)

論⽂紹介: OmniGen2
統合型 Vision-Language マルチモーダル⽣成モデル
●
●
⼀つの統合アーキテクチャで様々なタスクを実現 (画像理解/t2i/editing/i2i)
画像⽣成ヘッドとして、⾃⼰回帰ではなく拡散モデルを採⽤
○ スケーリング特性が理由。初代 OmniGen は⾃⼰回帰を採⽤
引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Wu_OmniGen2_Towards_Instruction-Aligned_Multimodal_Generation_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
56


# Page. 57

![Page Image](https://bcdn.docswell.com/page/4EZL5RYM73.jpg)

CVPR 2026 のトレンド
Vision-to-Action
Copyright © 2026 Morpho, Inc. All Rights Reserved.
57


# Page. 58

![Page Image](https://bcdn.docswell.com/page/Y76W9RD57V.jpg)

Vision-to-Action
CVPR 2026 のポスターセッション会場には Expo (企業展⽰) が併設
⾃⽴型ロボットが今年の主役 (主観)
●
特にヒューマノイドロボットは印象的
「⾒て動く (Vision-to-Action)」能⼒
企業ブース
ロボット①
ロボット②
Copyright © 2026 Morpho, Inc. All Rights Reserved.
58


# Page. 59

![Page Image](https://bcdn.docswell.com/page/G75MN83G74.jpg)

Vision-to-Action台頭の背景
● LLM → VLM → VLA — モダリティが「⾏動」まで拡張
● CVPR 2026 でも関連ワークショップ‧チュートリアル多数
● キーワードは分散しているが、存在感は明確に増⼤
例: The Seventh Annual Embodied Artificial Intelligence Workshop
https://embodied-ai.org/cvpr2026/
Copyright © 2026 Morpho, Inc. All Rights Reserved.
59


# Page. 60

![Page Image](https://bcdn.docswell.com/page/9J295KZDER.jpg)

Vision-to-Action 関連⽤語
実は「Vision-to-Action」は、本発表で便宜的につけた名称
主に以下のようなキーワードが対応
タスク単位
実現アプローチ
Embodied AI
Vision-Language-Action (VLA)
⾝体性を持つエージェントが、
環境を理解し相互差評する
研究領域
視覚‧⾔語‧⾏動を接続し、
指⽰からロボット動作を直接⽣成
Physical AI
物理世界での知覚‧予測‧
制御を重視する
世界モデル (World Model)
⾏動後の未来を予測し、計画や制御の
内部シミュレーターとして利⽤
引用:
https://www.sciencedirect.com/science/article/pii/S20958
0992500815X
Copyright © 2026 Morpho, Inc. All Rights Reserved.
60


# Page. 61

![Page Image](https://bcdn.docswell.com/page/DEY4KNRMJM.jpg)

VLA の⼀般的なアーキテクチャ
Vision-/Language-Encoder と
Action Decoder の 3 層構造
●
●
Vision Encoder と Language Encoder が
環境‧指⽰を特徴量へ変換
Action Decoder が両者を統合して
ロボットの⾏動を出⼒
○ 世界モデルは、Action の意思決定
判断材料の⼀つとして利⽤
引用: https://arxiv.org/abs/2405.14093
Copyright © 2026 Morpho, Inc. All Rights Reserved.
61


# Page. 62

![Page Image](https://bcdn.docswell.com/page/VJNYRXD378.jpg)

論⽂紹介: Motus
VLA / 世界モデル統合⼿法
●
●
従来のロボティクス関連⼿法は、
各サブタスクごとに別々のモデルを
利⽤することが⼀般的
(VLA / World Model / Joint Prediction など)
Motus は Mixture-of-Transformers (MoT)
というアーキテクチャで統合
○ 独⽴性を維持しつつ、 Joint Attention
で情報を結合
引用:
https://openaccess.thecvf.com/content/CVPR2026/papers/Bi_Motus_A_Unifi
ed_Latent_Action_World_Model_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
62


# Page. 63

![Page Image](https://bcdn.docswell.com/page/YE9PM8GPJ3.jpg)

論⽂紹介: DriveMoE
End-to-End⾃動運転向けVLA⼿法
●
●
●
●
(Action の対象はロボティクスに限らない)
⾃動⾞の⾃動運転では⼀般に、マルチカメラ
⼊⼒から次の⾏動を決定
→ 全カメラの⼀律処理は⾼コスト
提案⼿法では、Mixture-of-Experts (MoE) の
アイデアを応⽤し、重い視覚処理を適⽤する
カメラのルーティング‧選別する仕組みを実現
処理の軽量化と⾼性能化の両⽴
引用:
https://openaccess.thecvf.com/content/CVPR2026/papers/Yang_DriveMoE_
Mixture-of-Experts_for_Vision-Language-Action_Model_in_End-to-End_Auto
nomous_Driving_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
63


# Page. 64

![Page Image](https://bcdn.docswell.com/page/GE8DL8VXED.jpg)

「認識」から「⾏動」へ
過去の CVPR = 「認識 (Recognition)」が主役 (学会名の &quot;R&quot;)
次の主役として「⾏動 (Action)」が加わりつつある
「⾒る学会」から「⾒て動く学会」への転換点
Copyright © 2026 Morpho, Inc. All Rights Reserved.
64


# Page. 65

![Page Image](https://bcdn.docswell.com/page/LELMLR5N7R.jpg)

CVPR2026のトレンド
動画⽣成‧理解‧⻑⽂脈化
Copyright © 2026 Morpho, Inc. All Rights Reserved.
65


# Page. 66

![Page Image](https://bcdn.docswell.com/page/4JMYMR3QJW.jpg)

CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化
Vision TransformerにおけるSelf-Attentionは系列⻑に対して2乗の計算量でスケールす
るため、⻑⽂脈の処理には重⼤なボトルネックが存在する。
⻑⽂脈のタスク：3D姿勢追跡,⼤規模再構成
Copyright © 2026 Morpho, Inc. All Rights Reserved.
66


# Page. 67

![Page Image](https://bcdn.docswell.com/page/PJR9VRQK79.jpg)

CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化
Test-time training (TTT)
Learning to (Learn at Test Time): RNNs with Expressive Hidden
States, ICML 2025
One-Minute Video Generation with Test-Time Training,CVPR 2025
従来のように拡⼤し続けるKey-Valueキャッシュに依存するのではなく、テ
スト時トレーニング（TTT）は、⼊⼒系列の⽂脈情報を局所モデルの「⾼速
重み（Fast Weights）」として保存する。
⾃⼰監視型オンライン学習
フォワードパス（順伝播）の中で勾配降下法を直接実⾏し、⼊⼒された視覚
トークンを局所重みに圧縮する。
線形計算量 O(N)
局所モデルの隠れパラメータは⼀定サイズであるため、⼊⼒コンテキスト⻑
に対して完全に線形スケーリングが成⽴する。
Copyright © 2026 Morpho, Inc. All Rights Reserved.
67


# Page. 68

![Page Image](https://bcdn.docswell.com/page/PEXQZR55JX.jpg)

CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化
ViT3: UnlockingTest-Time Training in Vision (Best paper 候補)
●
●
●
●
体系的な実証研究 ：視覚シーケンスにおける TTT設計を検証
6つの設計指針の抽出 ：より効果的な視覚 TTTを実現する実用的な
ガイドラインを提示
新アーキテクチャ「 ViT3」の提案 ：線形計算量と並列計算を両立す
る純粋なTTTモデル
優れたパフォーマンス ：先進的線形モデルと同等以上、 Vision
Transformerに迫る精度を達成
Semantic Segmentationの結果
Han, et al, Vit3: Unlocking Test-Time Training in Vision, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
68


# Page. 69

![Page Image](https://bcdn.docswell.com/page/3EK98R6RED.jpg)

CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化
tttLRM: Test-TIme Training for Long Context and Autoregressive 3D
Reconstruction (Highlight論文)
●
●
●
●
「tttLRM」の提案 ：TTT層の導入により、長文脈かつ自己回帰的な 3D再構成を線形
計算量で実現。
LaCTブロックによる重み更新 ：パッチ分割された入力画像をトークン化し、 LaCTブ
ロック内で対応する Fast Weightsを効率的に更新。
仮想トークンによるデコード ：更新された高速重みを仮想トークンでクエリし、高品質
な新規視点合成向けに 3Dガウシアン等へとデコード。
優れた再構成性能と実用性 ：ストリーミングデータからの段階的な再構成をサポート
し、物体・シーンの双方で従来モデルを上回る精度を達成。
LaCT Block
Copyright © 2026 Morpho, Inc. All Rights Reserved.
Wang, et al, ttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction CVPR 2026
69


# Page. 70

![Page Image](https://bcdn.docswell.com/page/L73W286G75.jpg)

CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化
ZipMap: Linear-Time Stateful 3D Reconstruction via Test-time Training
●
●
●
「ZipMap」の提案 ：Window Attentionとラージチャンク TTT層を組み合わせ、線形
時間かつ双方向の 3D再構成を実現するモデルを開発。
Single passでの一括予測 ：カメラポーズ、深度マップ、ポイントマップを 1回の線形
処理で同時予測し、シーン情報を TTTの高速重みに圧縮保存。
圧倒的な高速化とリアルタイム応用 ：700フレーム以上を 10秒未満（H100）で処理
しつつ、新規視点からのリアルタイムなクエリ（再構成）やストリーミング再生をサ
ポート。
Jin, et al, ZipMap: Linear-Time Stateful 3D Reconstruction via Test-time Training, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
70


# Page. 71

![Page Image](https://bcdn.docswell.com/page/87DKZMVNJG.jpg)

５分休憩
Copyright © 2026 Morpho, Inc. All Rights Reserved.
71


# Page. 72

![Page Image](https://bcdn.docswell.com/page/VJPKDRVNE8.jpg)

Technical Deep Dive
● Anti-forgetting sampling strategy
○
“Does YOLO Really Need to See Every Training Image in Every Epoch?”
● フローマッチングの動向
○
⽣成モデルの基礎技術として定着しつつあるフローマッチングを紹介
Copyright © 2026 Morpho, Inc. All Rights Reserved.
72


# Page. 73

![Page Image](https://bcdn.docswell.com/page/2EVV1RZYEQ.jpg)

Technical Deep Dive:
Anti-forgetting sampling strategy
Does YOLO Really Need to See Every Training Image in Every Epoch?
CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
73


# Page. 74

![Page Image](https://bcdn.docswell.com/page/57GL2M4WEL.jpg)

YOLOというのは
Redmon, et. al. You Only Look Once: Unified, Real-Time Object Detection, CVPR 2016
YOLO (You Only Look Once) は、卓越した⾼速推論性能によって⾃動運転、スマートシティ監視、製品
の外観検査、リテール店舗解析まで、あらゆる産業で不可⽋な物体検出AIのスタンダードとして君臨し
ています。本発表では、未だ改善の余地が⼤きい「学習コストの⾮効率性」に対する新たな解決アプ
ローチを提案します。
Copyright © 2026 Morpho, Inc. All Rights Reserved.
74


# Page. 75

![Page Image](https://bcdn.docswell.com/page/4EQYPRGQJP.jpg)

課題：推論は⾼速、しかし学習は？
推論の効率性: &quot;You Only Look Once&quot; の名の通り、⼀度の⾛査で検
出を完了。
学習の⾮効率性: 従来の学習パイプラインでは、全エ
ポックで「全画像」を処理し続ける必要がある。
リソースの浪費: すでに学習済みの画像も、未学習の難しい画
像と同じ頻度で処理されるため、学習時間が膨⼤になる。
すべてのエポックで、すべての画像を使って学
習する必要があるのでしょうか？
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
75


# Page. 76

![Page Image](https://bcdn.docswell.com/page/KJ4WY85Y71.jpg)

先⾏研究の限界：なぜ精度低下を招くのか？
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
⼿法分類 (代表例)
アプローチ内容
Dataset Pruning
(Deep Learning on a Data Diet)
初期の損失（Loss）や勾配統計量に基づき、冗
⻑または価値の低い「不要画像」を決定して永
久に排除‧削減する。
限界と失敗の理由（論⽂からの指摘）
不可逆性と忘却:
⼀度削減されたサンプルは⼆度と再訪（revisit）で
きない静的なプロセスのため、モデルは特定のパター
ンを忘却し、残存データに過学習（Overﬁt）する。
現実との乖離とスケーラビリティ:
Dataset Distillation
(Fetch and Forge )
データセット全体の挙動を近似する、少数の
「⼈⼯合成画像」を最適化技術により⽣成し、
リアルデータと置き換える。
複雑な⼆段階最適化や⽣成モデルのコストが⾮常
に⾼い。さらに、合成画像は実世界のノイズやオク
ルージョン（遮蔽）、コンテキスト（⽂脈）を捉えき
れないため精度が低下する。
結論：
物体検出のような複雑なタスクでは、画像を完全に捨て去る「間引き」は精度低下を招く。「いつ、何を⾒るか」の適
その他のアプローチ：カリキュラム学習や⾃⼰ペース学習（Self-paced
learning）は難解な画像を徐々に導⼊しますが、それらの画像の継続的な参
加（continuous participation）を維持できないため、同様に最適化を破綻させます。
応的な制御が必要。
●
●
Ding Qi, et. al. Fetch and forge: Efficient dataset condensation for object detection. Proceedings of the Advances
in Neural Information Processing Systems, 37: 119283–119300, 2024
Mansheej Paul, et. al. Deep learning on a data diet: Finding important examples early in training. In Proceedings
of the Advances in Neural Information Processing Systems, pages 20596– 20607, 2021.
Copyright © 2026 Morpho, Inc. All Rights Reserved.
76


# Page. 77

![Page Image](https://bcdn.docswell.com/page/LE1Y62WN7G.jpg)

提案：学習充⾜度 (Learning Suﬃciency)
論⽂では、各画像が「どれだけ⼗分に学習されたか」を定量化する指標を導⼊しました。
指標の意味: 単なる損失（Loss）ではなく、検出の精度と再現率の最⼩値を使⽤することで、モデル
の確信度をより正確に反映。
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
77


# Page. 78

![Page Image](https://bcdn.docswell.com/page/GEWGWRRMJ2.jpg)

難易度別の動的サンプリング
学習充⾜度に基づいて、画像を3つのレベルに分類し、間隔反復学習 (SRS) の概念を取り⼊れます。
Easy (簡単): Continuous review
10エポック以上未使⽤のものを優先サンプリングし、最⼩限の
リソースで忘却を防⽌。
Moderate (中程度): Short term coverage
2エポック未使⽤の画像をカバレッジ。学習を安定させ境界を明
確化する。
Hard (困難): Full coverage
未習得の難解な画像は常に学習対象。遮蔽や⼩さな物体などへの
対応⼒を維持。
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
78


# Page. 79

![Page Image](https://bcdn.docswell.com/page/47ZL5RRMJ3.jpg)

全体アーキテクチャ (AFSS)
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
79


# Page. 80

![Page Image](https://bcdn.docswell.com/page/YJ6W9RR5JV.jpg)

実験結果
学習進展に伴い、Hard画像がModerate・Easyへと動的に推移する様子
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
80


# Page. 81

![Page Image](https://bcdn.docswell.com/page/GJ5MN88GJ4.jpg)

実験結果
不要画像の段階的削減により、精度向上と1.54倍の高速化を両立
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
81


# Page. 82

![Page Image](https://bcdn.docswell.com/page/9E295KKD7R.jpg)

実験結果
他手法が精度を落とす中、AFSSのみが精度向上（47.2 AP）と最高速（1.54x）を達成
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
82


# Page. 83

![Page Image](https://bcdn.docswell.com/page/D7Y4KNNMEM.jpg)

まとめ
「全⾛査」からの脱却: 推論が&quot;Look Once&quot;なら、学習も「必要な時に、必要なだけ⾒る」べき。
忘却防⽌の重要性: 学習済みの画像を完全に捨てるのではなく、SRS（間隔反復）で賢く復習する
ことが精度維持の鍵。
AFSSの成果: 学習速度 1.43x 加速 と 精度向上 を両⽴した、次世代のYOLO学習パラダイム。
Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026
Copyright © 2026 Morpho, Inc. All Rights Reserved.
83


# Page. 84

![Page Image](https://bcdn.docswell.com/page/VENYRXX3J8.jpg)

Technical Deep Dive
フローマッチングの動向
Copyright © 2026 Morpho, Inc. All Rights Reserved.
84


# Page. 85

![Page Image](https://bcdn.docswell.com/page/Y79PM88PE3.jpg)

フローマッチングとは
●
●
●
連続的な変換に基づく⽣成モデル
画像⽣成を中⼼に急速に利⽤が拡⼤
○ 拡散モデルよりも⾼速との報告多数
○ CVPR でも関連研究が増加
(例: Best Student Paper の TRELLIS.2)
有名な採⽤例:
○ Stable Diﬀusion 3 (画像⽣成)
○ π₀ / π₀.₅ (ロボティクス向け VLA)
出典: https://arxiv.org/abs/2412.06264
Copyright © 2026 Morpho, Inc. All Rights Reserved.
85


# Page. 86

![Page Image](https://bcdn.docswell.com/page/G78DL88X7D.jpg)

アルゴリズム Overview
●
フローマッチングの⽣成過程は常微分⽅程式 (ODE) で記述
○
○
v は学習対象の速度場、 p_prior は事前分布 (e.g. ガウス分布)
⽣成データは、 ODE の解 X_1 として得られる
ノイズ (t = 0)
●
データ (t = 1)
以下の損失関数 (フローマッチング損失) を最⼩化することで、速度場 v を学習
○
○
ざっくりといえば、サンプル間の線形補間 (直線) を学習したいというモチベーション
最適な v で⽣成した場合、理論上は X_1 がデータ分布に従う
Copyright © 2026 Morpho, Inc. All Rights Reserved.
86


# Page. 87

![Page Image](https://bcdn.docswell.com/page/L7LMLRRNJR.jpg)

ありがちな解説
ノイズ
データ
“フローマッチングは、ノイズをデータへ変換する⽣成モデルです。
拡散モデルを発展させた⼿法として提案され、
最適輸送に基づく直線的な⽣成経路を学習することで、
⾼速かつ⾼品質な画像⽣成を実現します。”
…実は、上記の説明は誤解だらけ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
87


# Page. 88

![Page Image](https://bcdn.docswell.com/page/4EMYMRRQEW.jpg)

ありがちな解説
ノイズ
データ
“フローマッチングは、ノイズをデータへ変換する⽣成モデルです。
拡散モデルを発展させた⼿法として提案され、
最適輸送に基づく直線的な⽣成経路を学習することで、
⾼速かつ⾼品質な画像⽣成を実現します。”
…実は、上記の説明は誤解だらけ
Copyright © 2026 Morpho, Inc. All Rights Reserved.
88


# Page. 89

![Page Image](https://bcdn.docswell.com/page/PER9VRRKJ9.jpg)

誤解① 「ノイズとデータを結ぶ」？
A: フローマッチングは、ノイズ分布からの変換に限定されません
●
●
●
画像⽣成 (e.g. text-to-image) では、事前分布としてガウス分布がよく⽤いられる
典型的な拡散モデルは、このガウス事前分布を前提として定式化される
⼀⽅、フローマッチング⾃体は、特定の事前分布を仮定しない
○ 下図は、two-moons 分布から eight-gaussians 分布への変換の実例
事前分布 (two-moons)
学習された軌道
データ分布 (eight-gaussians)
Copyright © 2026 Morpho, Inc. All Rights Reserved.
89


# Page. 90

![Page Image](https://bcdn.docswell.com/page/P7XQZRR5EX.jpg)

誤解② 「拡散モデルの発展型」？
A: 単純な上位互換ではありません
●
●
●
フローマッチングの事前分布設計の⾃由度が⾼いことは事実
しかし、⼀般にフローマッチングから拡散モデルは直接導出できない
○ データとは独⽴なガウス分布を事前分布として選んだ特殊ケースに限り、
適切な変数変換のもとで対応することが知られている
現代的には、より上位な概念が存在し、それらの異なる派⽣⼿法として理解される
○ [研究者向け解説] 両者はマルコフ制約 path-space KLD 最⼩化問題として統⼀的に記述され、
本質的な差は参照 mixture of bridges (Q) の選択によって定まる
拡散モデル (SBGM) / Q: Markovian SDE
一般化された連続時間生成モデル
(path-space KLD 最小化問題 )
フローマッチング / Q: データカップリングと Brownian bridge の mixture &amp; ノイズゼロ極限
Copyright © 2026 Morpho, Inc. All Rights Reserved.
90


# Page. 91

![Page Image](https://bcdn.docswell.com/page/37K98RRR7D.jpg)

誤解③ 「フローマッチングは最適輸送」？
A: 問題設定レベルで別物です
●
●
●
最適輸送†: 輸送コストを最⼩化する
カップリングを求める問題
○ 訓練データ間の対応付けを決定
フローマッチング: 与えられたカップリング
に基づいた速度場を学習
両者は組み合わせて利⽤されることも多く、
混乱の原因になりがち
○ AI 研究者もよく混同しているので注意
3
最適輸送
100
A
150
(A, X) と (B, Y) の
ペアが最適
5
Y
B
フローマッチング
X
TIPS
カップリングと速度場の同時最適化を行う問題は、
最適輸送分野においてはBenamou-Brenier 定式化として知ら
れます。また、 BB 定式化を拡散過程へと一般化したものは(動
的) Schrödinger Bridge 問題と呼ばれます。
X
A と X を結ぶ
実際の経路を学習
A
†
Monge-Kantorovich の定式化に基づく
Copyright © 2026 Morpho, Inc. All Rights Reserved.
91


# Page. 92

![Page Image](https://bcdn.docswell.com/page/LJ3W288GJ5.jpg)

誤解④ 「軌道が直線的」？
A: 通常は曲がった軌道が⽣成されます
●
●
●
●
前提知識: なぜ直線が重要？ → 直線ならば ODE を数値的に解きやすい
学習で直線的な軌道を利⽤するが、それは⽣成軌道の直線性を意味しない
軌道の形状はデータカップリングに依存
ラフにいえば、与えられたカップリングに交差が含まれない場合に限り直線となる
○ OT-CFM† や RectiﬁedFlow‡などの最適輸送関連⼿法は、部分的に実現可能
独立カップリング Gaussian-to-Gaussian の生成軌道
交差による軌道の平均化
†
Tong, A., “Improving and generalizing ﬂow-based generative models with minibatch optimal transport”, arXiv e-prints, Art. no. arXiv:2302.00482, 2023. doi:10.48550/arXiv.2302.00482.
Liu, X., Gong, C., and Liu, Q., “Flow Straight and Fast: Learning to Generate and Transfer Data with Rectiﬁed Flow”, arXiv e-prints, Art. no. arXiv:2209.03003, 2022. doi:10.48550/arXiv.2209.03003.
‡
Copyright © 2026 Morpho, Inc. All Rights Reserved.
92


# Page. 93

![Page Image](https://bcdn.docswell.com/page/8JDKZMMNEG.jpg)

正しい説明
ノイズ
データ
“フローマッチングは、分布の連続変換を記述する⽣成モデルです。
拡散モデルよりシンプルなアルゴリズムとして提案されました。
最適輸送と組み合わせることで⽣成軌道が直線になり、
より⾼速かつ⾼品質な画像⽣成を実現できます。”
Copyright © 2026 Morpho, Inc. All Rights Reserved.
93


# Page. 94

![Page Image](https://bcdn.docswell.com/page/VEPKDRRN78.jpg)

Technical Deep Dive: フローマッチング
論⽂紹介
(CVPR 2026)
Copyright © 2026 Morpho, Inc. All Rights Reserved.
94


# Page. 95

![Page Image](https://bcdn.docswell.com/page/27VV1RRY7Q.jpg)

論⽂紹介: Just Image Transformer (JiT)
Tianhong Li, and Kaiming He “Back to Basics: Let Denoising Generative Models Denoise”
●
●
●
「⾃然画像の多様体仮説」は広く信じられる
○ 低次元多様体に分布するというもの
○ ⼀⽅、速度場にはそのような仮説
は知られていない
[仮説] 速度場ではなく、⾃然画像を直接予測
すれば、学習の難易度が下がるのでは？
○ 拡散モデルでは「x-pred.」として知られる
実験的に良好な結果が得られる
○ swissroll 分布の再現において、x-pred 以外は
⾼次元化によって破綻
注: パラメータ変換は事前分布のガウス性に強く依存
⼀般に⾮ガウスのケースでは、 x-/ε-pred ⾃体が ill-deﬁned
引用:
https://openaccess.thecvf.com/content/CVPR2026/papers/Li_Back_to_Basics_Let_Denoising
_Generative_Models_Denoise_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
95


# Page. 96

![Page Image](https://bcdn.docswell.com/page/5JGL2MMW7L.jpg)

論⽂紹介: Improved Mean Flow (iMF) 1/3
Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models”
●
MeanFlow† というフローマッチングの派⽣⼿法が最近話題
○ たった 1 ステップでの⽣成が可能だと主張
○ 「ある時刻の速度ベクトル v」の代わりに「ある時刻
から別の時刻へ移動する平均速度ベクトル u」を学習
○ Mean Flow 恒等式 (右下) を活⽤することで、
蒸留を使わずに効率的な学習を実現
引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf
†
Geng, Z., Deng, M., Bai, X., Zico Kolter, J., and He, K., “Mean Flows for One-step Generative Modeling”, arXiv e-prints, Art. no. arXiv:2505.13447, 2025. doi:10.48550/arXiv.2505.13447.
Copyright © 2026 Morpho, Inc. All Rights Reserved.
96


# Page. 97

![Page Image](https://bcdn.docswell.com/page/47QYPRRQEP.jpg)

論⽂紹介: Improved Mean Flow (iMF) 2/3
Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models”
●
●
しかし、後続研究において Mean Flow の学習は不安定
と報告が多数挙がる
iMF は、学習ターゲットが推論モデル (u) に依存する
ことが原因だと分析
→ 損失関数評価を u から v に戻すことで改善
引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
97


# Page. 98

![Page Image](https://bcdn.docswell.com/page/KE4WY88YJ1.jpg)

論⽂紹介: Improved Mean Flow (iMF) 3/3
Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models”
引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf
Copyright © 2026 Morpho, Inc. All Rights Reserved.
98


# Page. 99

![Page Image](https://bcdn.docswell.com/page/L71Y622NJG.jpg)

フローマッチングの動向: まとめ
●
フローマッチング: 拡散モデルに続く、⽣成モデルの⼀種
○
●
●
シンプルさと⾼品質性が特徴
アルゴリズムに対する誤解が⽐較的多い
○
フローマッチングそのものは最適輸送ではない
○
⼀般的な設定では直線軌道になることは稀
CVPR 2026 の関連論⽂を紹介
○
Just Image Transformer (JiT): 再パラメータ化による品質向上
○
Improved Mean Flow (iMF): 1-ステップアルゴリズムの改善
Copyright © 2026 Morpho, Inc. All Rights Reserved.
99


# Page. 100

![Page Image](https://bcdn.docswell.com/page/G7WGWR2ME2.jpg)

全体のまとめ
1.
2.
3.
CVPR ⼊⾨
○ AIブームの最先端をゆく、CV分野最⾼峰の国際学会
○ 年々増加する論⽂数、トレンド合わせた分野拡⼤
CVPR 2026 のトレンド
○ 全論⽂タイトルからトレンドワード抽出
○ CVPR 2026 におけるトピックの動向を紹介
■ マルチモーダル AI
■ Vision-to-Action
■ 動画⽣成
Technical Deep Dive
○ Anti-forgetting sampling strategy
○ フローマッチングの動向
Copyright © 2026 Morpho, Inc. All Rights Reserved. 100


# Page. 101

![Page Image](https://bcdn.docswell.com/page/4JZL5RDME3.jpg)



