126 Views
October 09, 26
スライド概要
2026年7月29日に、日本ディープラーニング協会主催(JDLA)の「CVPR2026技術報告会」にてモルフォの技術者が登壇した際の、当日の発表資料です。
詳細はテックブログをご覧ください。
https://techblog.morphoinc.com/
CVPR 2026 技術報告会 コンピュータビジョン技術の最前線 2026年7⽉29⽇ リサーチャー ⻑⼭‧プラディプト
⽬次 1 2 3 はじめに 株式会社モルフォのご紹介 CVPR⼊⾨ CVPRとは何か‧なぜ重要か ビジネスパーソン向けの基礎知識 今年のトレンド 注⽬分野‧重要論⽂のご紹介 ⼩休憩 4 5 Technical Deep Dive モルフォ視点で注⽬技術を深堀り 質疑応答 10min 15min 30min 5min 25min 30min ※ 本スライド資料は、弊社の技術ブログ (morpho tech blog) にて後⽇公開予定です Copyright © 2026 Morpho, Inc. All Rights Reserved. 2
株式会社モルフォの紹介 Copyright © 2026 Morpho, Inc. All Rights Reserved. 3
株式会社モルフォについて 2004 2011 166 創業 東証マザーズ上場 (現グロース市場) グループ社員 5 123 61 特許 海外売上比率 カ国 代表取締役社長 平賀 督基 海外展開 % Masaki Hilaga 画像処理 / AI技術の研究・製品開発 スマートデバイス・車載モビリティ・DX向けソフトウェア事業を グローバルに展開 33 億 グループ売上 16 % 研究開発費率 2025年10月期時点 Copyright © 2026 Morpho, Inc. All Rights Reserved. 4
事業領域 先進のイメージイング・テクノロジーにより、利便性・安心安全・生産性の向上に貢献する ・スマートフォン ・PC/タブレット端末 スマート デバイス ・車載カメラ ・ドライブレコーダー ・OCR ・監視カメラ 等 車載 モビリティ DX Copyright © 2026 Morpho, Inc. All Rights Reserved. 5
スマートデバイス|画像処理(古典手法 × Deep Learning) 動画手振れ補正 ノイズ除去AI技術 ナイトモード向けダイナミックレンジ補正 超解像技術 Copyright © 2026 Morpho, Inc. All Rights Reserved. 6
車載モビリティ|自動車向け AI技術 車室外カメラ 車室内カメラ テレマティクス 自動運転・運転支援 乗員状態認識 クラウド連携サービス 物体検知技術 OMS: 乗員姿勢推定 道路劣化診断 オートキャリブレーション DMS: ドライバー認識 動画のAI要約 Copyright © 2026 Morpho, Inc. All Rights Reserved. 7
DX|分野別ソリューション事例 OCR 画像解析AIソリューション 建設DX 旧字体認識・新字への変換 転倒検知・物体検出 橋脚補強現場 DX アナログメーター読み取り Copyright © 2026 Morpho, Inc. All Rights Reserved. 8
新規事業開発 Wearable Device 視覚障碍者向けデバイスの開発 障害物検知 Photogrammetry 計測・三次元再構成 横断歩道認識 Copyright © 2026 Morpho, Inc. All Rights Reserved. 9
モルフォは画像処理と AI技術領域に特化した ソフトウェア研究開発カンパニーです Copyright © 2026 Morpho, Inc. All Rights Reserved. 10
ビジネスパーソン向け CVPR ⼊⾨ CVPR とは何か、なぜ重要か Copyright © 2026 Morpho, Inc. All Rights Reserved. 11
CVPRとは? CVPR Conference on Computer Vision and Pattern Recognition 初回は1983年にT.KanadeとD.Balladが開催 毎年、6月から7月頃に開催されるComputer Vision系の国際会議 開催地は主にアメリカ国内 画像:https://x.com/CVPR/status/1996681273419714810 Copyright © 2026 Morpho, Inc. All Rights Reserved. 12
CVPRとは? ⼈間の⽬と脳が持つ⾼次視覚機能を理解し、 コンピューターによる再現‧実装を⽬指す分野 CVPR Conference on Computer Vision and Pattern Recognition 国際会議 コンピュータービジョン パターン認識 初回は1983年にT.KanadeとD.Balladが開催 毎年、6月から7月頃に開催されるComputer Vision系の国際会議 開催地は主にアメリカ国内 画像:https://x.com/CVPR/status/1996681273419714810 Copyright © 2026 Morpho, Inc. All Rights Reserved. 13
AI関連の国際会議 画像処理の 国内会議だと MIRU が有名 出典:https://www.kamishima.net/archive/MLDMAImap.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 14
Google Scholar Metricsによる学術誌ランキング CVPRは論⽂⾃体の数‧引⽤数ともに世界トップレベルの学会です! (h5-indexが450→過去5年間で450回以上引⽤された論⽂数が450本以上存在) 出典: https://scholar.google.com/citations?view_op=top_venues Copyright © 2026 Morpho, Inc. All Rights Reserved. 15
過去に発表された AI 系重要論⽂ピックアップ 2009 2014 2015 2022 ImageNet R-CNN FCN LDM ImageNet: A Large-scale Hierarchical Image Database Rich feature hierarchies for accurate object detection and semantic segmentation Fully Convolutional Networks For Semantic Segmentation High-Resolution Image Synthesis With Latent Diffusion Models Jonathan Long, et al. Robin Rombach, et al. セグメンテーションにおける線形 層を捨て全てConvolutionで表現 10.1109/CVPR.2015.7298965 代表的な画像⽣成基盤モデルであ るStable Diffusionの元論⽂ 10.1109/CVPR52688.2022.01042 Jia Deng, et al. 後にAlexNetによって第3次AI ブームの⽕つけ役となる ImageNetデータセットを提供 https://www.image-net.org/ Ross Girshick, et al. CNNによる物体検出の先駆け 10.1109/CVPR.2014.81 Copyright © 2026 Morpho, Inc. All Rights Reserved. 16
Longuet-Higgins Prize 概要 ● Test-of-Time Award (時の試練賞) ○ ○ ○ ○ 現在の研究に最も⼤きな影響を与えた過去の論⽂を表彰 ちょうど10 年前に発表された論⽂が対象 (CVPR 2016) ImageNet/R-CNN/FCNはいずれも受賞経歴あり 前年度は FCN と GoogLeNet GoogLeNet Going Deeper with Convolutions Christian Szegedy, et al. 計算量とパラメータ数を⼤幅に削減したCNNアーキテクチャ 当時としては最も深い 22 層のアーキテクチャを実現 「より Deep に」を加速させる契機となる 10.1109/CVPR.2015.7298594 Copyright © 2026 Morpho, Inc. All Rights Reserved. 17
Longuet-Higgins Prize CVPR 2026 今年の受賞は YOLO と ResNet YOLO ResNet You Only Look Once: Unified, Real-Time Object Detection Deep Residual Learning for Image Recognition Joseph Redmon, et al. Kaiming He, et al. 従来は複数段のフェーズが必要だった物体検出パイプラインを、単⼀の ニューラルネットワークで置き換えられることを⽰した記念碑的論⽂。 要素技術としては置き換えられつつも、現代に⾄るまで「YOLO シリーズ」 というブランドとして活躍。 10.1109/CVPR.2016.91 レイヤーの前後に残差接続を取り付けるだけというシンプルなアイデアで、 GoogLeNet の 2~7 倍程度の深さ (50~152層) での学習を初めて実現。 現代のニューラルネットに必要不可⽋な基礎設計であり、最重要技術と ⾔っても過⾔では無い。 10.1109/CVPR.2016.90 Copyright © 2026 Morpho, Inc. All Rights Reserved. 18
Longuet-Higgins Prize 来年の受賞予想 来年の受賞候補は……? Copyright © 2026 Morpho, Inc. All Rights Reserved. 19
Longuet-Higgins Prize 来年の受賞予想 来年の受賞候補は……? 本命?: FPN 現代でも基本モジュールとして利⽤される マルチスケール特徴量融合⼿法を提案 対抗①?: pix2pix 条件付き⽣成モデルを利⽤した i2i 変換 というタスクを⼀般化 対抗②?: PointNet 点群データをニューラルネットで直接扱う 研究路線の出発点 Copyright © 2026 Morpho, Inc. All Rights Reserved. 20
CVPR ⼊⾨ まとめ CVPR は CV 分野のトップカンファレンス! 重要な AI 系論文を多数生み出した実績 画像:https://x.com/CVPR/status/1996681273419714810 Copyright © 2026 Morpho, Inc. All Rights Reserved. 21
CVPR 2026 の概要 Copyright © 2026 Morpho, Inc. All Rights Reserved. 22
CVPR 2026 開催情報 概要 開催地: デンバー (コロラド州) 会場: Colorado Convention Center 会期: 2026年 6⽉3⽇(⽔) 〜 7⽇(⽇) スケジュール Denver 6/3 - 6/4: ワークショップ‧チュートリアル 6/5 - 6/7: メインカンファレンス‧エキスポ Copyright © 2026 Morpho, Inc. All Rights Reserved. 23
CVPR2026の開催地:デンバー (コロラド州) ● ● ● ● アメリカ中⻄部に位置する 結構歴史がある(今年150周年) 標⾼約 1,600m に位置(Mile-high city) デンバー国際空港 (敷地⾯積が成⽥の 10 倍程 度) 出典: http://images.flydenver.com/Airport-Facilities Copyright © 2026 Morpho, Inc. All Rights Reserved. 24
デンバー (コロラド州) ● 歴史とモダンが融合する魅力的な街並み ○ ○ ○ ● Lower-Downtown(LoDo)地区:19世紀末の美しい赤レン ガ建築が立ち並ぶエリア。 ユニオン駅( Union Station) Big Blue Bear:会場(コンベンションセンター)を覗き込む、 高さ12mの青いクマ。 南西部・ラテン文化の影響が色濃い豊かな食文化 ○ ○ メキシコ文化が強く反映された、本格的なタコスなどのグル メを市内で楽しめる。 デンバー名物の青唐辛子「グリーンチリ」など、鮮やかな ローカルフードが魅力 。 Copyright © 2026 Morpho, Inc. All Rights Reserved. 25
CVPR2026主なコンテンツ Workshops(153) & Tutorials(19) Tutorialは教育的・体系的な内容Workshopは より実践的 Oral Session (全141件の講演 (4トラック ×6セッション枠) 注目度の高い論文が発表される Poster Session Key Notes 最も活発にやり取りが行われる 並行して企業ブースもあり 著名な方が講演 ● ● ● Programmable Biology: Generative AI for Molecular Design(分子の自動設計 ) Transforming Computing with Quantum-Centric Supercomputing (量子融合計算 ) Scaling Laws vs. Neural Laws: Toward More Natural Artificial Vision (脳に学ぶ視覚 ) 出典: https://x.com/cvpr Copyright © 2026 Morpho, Inc. All Rights Reserved. 26
CVPR 2026 の新たな取り組み プログラムにおける2つの変更点:新しい論文トラックと、コミュニティの計算資源利用に関する初の取り組み 新トラック Findings 背景 — CVPRはすべての優れた論文を採録しきれなかった— 他の学会でもすでに見られる傾向。 計算資源報告イニシアチブ Compute Reporting 目的: CVPRコミュニティ内の計算資源利用の実態を把握する。 18 選定方法 — エリアチェアが、CVPRで紹介するにふさわしい質の 高い論文を選定。 26 172 Compute Gold Star Efficient CVPR Transparency Champion 卓越した効率性を達成 優れた計算効率を実証 詳細で網羅的なログを提供 公開方法 — これらの論文は「Findings」として別途公開される。 制約 — Findings論文は他の査読付き会議・論文誌には投稿で きない。 Copyright © 2026 Morpho, Inc. All Rights Reserved. 27
CVPR 2026 論⽂ Copyright © 2026 Morpho, Inc. All Rights Reserved. 28
投稿‧採択論⽂数の推移 CVPR 2026 Highlights 投稿数 (Submissions) 16,092 ALL-TIME HIGH 前年⽐ +23.7% 採択数 (Accepted) 4,071 ALL-TIME HIGH 前年⽐ +41.5% 採択率 (Acceptance Rate) 25.3% Copyright © 2026 Morpho, Inc. All Rights Reserved. 29
発表‧収録トラック オーラル (Oral) 141 件 Oral 141 Highlight 575 Poster 3,355 Findings Track 941 24のセッションに分かれて⼝頭発表 ハイライト (Highlight) 575 件 ポスターのうち、上位論⽂と認定されたもの ポスター (Poster) 3,355 件 オーラル‧ハイライト以外の全て採択論⽂ Findings Track 941 件 本開催とは別枠‧査読者の興味を引いたRejected論⽂ Copyright © 2026 Morpho, Inc. All Rights Reserved. 30
Award 選定プロセス Oral 141 Highlight 575 Award Candidates 74論文 各Talk sessionで用意 ↓ 🏆Award 5論文 Poster 3,355 Findings Track 941 Copyright © 2026 Morpho, Inc. All Rights Reserved. 31
Award 種別 Best Paper 1 件 👑 Best Paper Honorable Mention(次点) 2 件 Best Student Paper 1 件 👑 Best Student Paper Honorable Mention(次点) 1 件 Copyright © 2026 Morpho, Inc. All Rights Reserved. 32
最優秀論⽂賞 次点 (Honorable Mention) Best Student Paper Honorable Mention Best Paper Honorable Mention Best Paper Honorable Mention ChordEdit SAM 3D NitroGen ChordEdit: One-Step Low-Energy Transport for Image Editing SAM 3D: 3Dfy Anything in Images NitroGen: A Foundation Model for Generalist Gaming Agents Liangsi Lu, et al. ⾼速なテキストベース画像編集⼿法 単⼀画像から3D形状‧テクスチャ‧レ イアウトを復元する3D基盤モデル https://chordedit.github.io/ https://ai.meta.com/research/sam3d/ Xingyu Chen, et al. Loïc Magne, et al. ゲームプレイ動画から学習した Vision-to-Action 基盤モデル https://nitrogen.minedojo.org/ Copyright © 2026 Morpho, Inc. All Rights Reserved. 33
最優秀学⽣論⽂賞 (Best Student Paper) TRELLIS.2 Native and Compact Structured Latents for 3D Generation Jianfeng Xiang, et al. https://microsoft.github.io/TRELLIS.2/ オープンソースの⾼品質 text-to-3D モデル。 各ボクセルに特徴量ベクトルが付随する ような3D表現 (Omni-Voxel) を提案。 更にスパース VAEを組み合わせることで コンパクトな潜在表現を獲得し、現実的な 計算量で⽣成アルゴリズム (フローマッチング) を実現。 Copyright © 2026 Morpho, Inc. All Rights Reserved. 34
最優秀論⽂賞 (Best Paper) D4RT “dart” (/dɑːt/, /dɑɹt/) Efficiently Reconstructing Dynamic Scenes One D4RT at a Time Chuhan Zhang, et al. https://d4rt-paper.github.io/ ダイナミック 4D 再構成 + トラッキング⼿ 法。単⼀の動画から、動的なシーン全体の 3D構造と カメラの軌跡、物体の動きを同 時に効率よく推定 するニューラルネット ワーク⼿法。従来のパイプ ラインと異な り、全てのタスクを統⼀された表現 へと統 合することで、圧倒的な計算速度の向上と ⾼い精度の両⽴を同時に達成した画期的な アプローチ Copyright © 2026 Morpho, Inc. All Rights Reserved. 35
次のパートからは最先端の研究 およびトレンドにフォーカスします! Copyright © 2026 Morpho, Inc. All Rights Reserved. 36
CVPR 2026 のトレンド モルフォ視点で注⽬の分野‧論⽂のご紹介 Copyright © 2026 Morpho, Inc. All Rights Reserved. 37
CVPR 2026 のトレンド CVPR 2026 採択論⽂数 4,071 本 調査の概要 全てを読むことは現実的に不可能 対象 CVPR 2026 採択論文の タイトル (全件) せめて、トレンドだけでも把握したい... ● 最先端の⼿法は? ● 流⾏の分野は? ● 多くの論⽂に共通するトピックは? 手法 テキストマイニング (自然言語処理) CVPR 2026 全論⽂のタイトルを テキストマイニング 比較対象 過去4年 (CVPR 2022-2025) と同様の調査を実施 Copyright © 2026 Morpho, Inc. All Rights Reserved. 38
ユニグラム分析 ワードクラウド Copyright © 2026 Morpho, Inc. All Rights Reserved. 39
ユニグラム分析 出現頻度 top 30 CVPR 2026 論⽂のタイトルに⽤いられた単語のランキング Copyright © 2026 Morpho, Inc. All Rights Reserved. 40
ユニグラム分析 出現頻度 top 30 今年も同じトレンドが継続 (⾚字は今年新しく top 30 ⼊りしたワード) Copyright © 2026 Morpho, Inc. All Rights Reserved. 41
ユニグラム分析 急上昇ワード: 概要 vlm: Vison-Language Model mllm: Multimodal Large Language Model LLM 関連ワードの流⼊が顕著 ‧Vision-language を代表にマルチモーダルが⼀般化 reasoning / vlm / mllm / token / autoregressive / multimodal 強化学習 (RL) の再来 ‧VLM や⽣成モデルの post-training として急成⻑ reinforcement / reward / optimization エージェント化 ‧認識‧⽣成の完成モデルを⾏動として使う⽅向 agent / planning Copyright © 2026 Morpho, Inc. All Rights Reserved. 42
ユニグラム分析 急上昇ワード: 特記事項 Mamba アーキテクチャブームの収束 ‧順位は #114 → #357 (Δpp: -0.7) と急落 ‧予想ほど Vision タスク向けの改良が進まなかったと考えられる “spatial”: 空間リーズニング‧空間知能の急拡⼤ ‧増分の 46% 分は “spatial reasoning” と “spatial intelligence” に由来 ‧VLM/MLLM の空間推論能⼒関連ワード “hierarchical”: VLM や multimodal の派⽣現象 ‧LLM/VLM ベースシステムの⻑⽂脈‧多ステップの問題を 解決するアルゴリズムとして階層化の利⽤が拡⼤ Copyright © 2026 Morpho, Inc. All Rights Reserved. 43
CVPR 2026 のトレンド モダリティ語の推移 多様化‧複合化が顕著 ● language 系語彙は2022年以降に急伸 2024年以降は約17%で⾼⽌まり ● multimodal 系は2024年6.6% → 2026年15.8% へ拡⼤ image 系語彙を上回る ● video / 3Dも2018年⽐では増加 視覚モダリティ側も拡⼤ ● image は相対的に減少 Copyright © 2026 Morpho, Inc. All Rights Reserved. 44
CVPR 2026 のトレンド タスク語の推移 「認識」から「⽣成‧理解」へ ● generation: 2.7% → 11.5% 2024年以降、最多のタスク語 ● detection / segmentation: ピーク後に低下 recognition / estimation も同様 ● reconstruction / understanding editing も上昇 ○ ⽣成‧構成‧理解へ裾野が拡⼤ Copyright © 2026 Morpho, Inc. All Rights Reserved. 45
CVPR 2026 のトレンド 1 マルチモーダル AI (VLM / MLLM) 2 動画⽣成‧理解‧⻑⽂脈化 3 ⽣成モデル基礎技術の成熟 4 3D / 4D 空間知能と Gaussian Splatting 5 Vision-to-Action (Embodied AI / ロボティクス / VLA / 世界モデル) 視覚タスクが⾔語‧指⽰‧推論の枠組みに吸収 静⽌画中⼼から、時間‧物語‧マルチビュー⻑時間理解へ 拡散モデルは基盤化し、速度‧制御‧少ステップ⽣成‧フローマッチングへ 3D 再構成から、汎化可能な空間‧世界表現へ拡張 ⾒る‧答えるモデルから、環境内で判断し⾏動するモデルへ Copyright © 2026 Morpho, Inc. All Rights Reserved. 46
CVPR 2026 のトレンド 1 マルチモーダル AI (VLM / MLLM) 2 動画⽣成‧理解‧⻑⽂脈化 3 ⽣成モデル基礎技術の成熟 4 3D / 4D 空間知能と Gaussian Splatting 5 Vision-to-Action (Embodied AI / ロボティクス / VLA / 世界モデル) 視覚タスクが⾔語‧指⽰‧推論の枠組みに吸収 静⽌画中⼼から、時間‧物語‧マルチビュー⻑時間理解へ 本⽇は 1,2,5 の分野を紹介 拡散モデルは基盤化し、速度‧制御‧少ステップ⽣成‧フローマッチングへ 3D 再構成から、汎化可能な空間‧世界表現へ拡張 ⾒る‧答えるモデルから、環境内で判断し⾏動するモデルへ Copyright © 2026 Morpho, Inc. All Rights Reserved. 47
CVPR 2026 のトレンド マルチモーダル AI Copyright © 2026 Morpho, Inc. All Rights Reserved. 48
マルチモーダルAI 出典: https://vnext.co.jp/v-blog/what-is-multimodal-ai.html Copyright © 2026 Morpho, Inc. All Rights Reserved. 49
代表的なマルチモーダルAI研究分野 (⼀例) CVPR 2026 では、特に VLM と MLLM の躍進が顕著 Vision Vision-Language (VLM / MLLM) 画像‧動画 + ⾔語 Vision-Language Action (VLA) 画像‧動画 + ⾔語 + ⾏動 Audio Sensor Omni Sensor Fusion Omni-Modal / Any-to-Any Audio-Visual 映像 + ⾳声 Speech / Audio-Language Camera + LiDAR + Radar + IMU etc. 任意モダリティ間の 統合理解‧⽣成 ⾳声‧⾳響 + ⾔語 このパートでは主に VLM / MLLM のみを扱います(VLA は独⽴項⽬として扱います) Copyright © 2026 Morpho, Inc. All Rights Reserved. 50
VLM / MLLM VLM / MLLM: 画像‧動画 + テキストを⼊⼒し、テキストを⽣成 ● ● 出⼒が画像+テキスト、あるいは画像のみの 場合、VLM に含めないことが多い MLLM は VLM より広い概念で、 ⾳声などの他モダリティも⼊⼒に含める CLIP (ICML 2021) による Vision-Language 統合理解が分野の出発点 ● CLIP ⾃⾝はテキストではなく埋め込み表現 を⽣成するので、現代では「VLM」に 分類されないことが多い 引用: https://openai.com/ja-JP/index/clip/ Copyright © 2026 Morpho, Inc. All Rights Reserved. 51
VLM / MLLM VLM の応⽤例: Visual Question Answering (VQA) ● ● ● 与えられた画像とテキストに 対応する、適切な返答を ⾏うタスク 現代の AI チャットボットに おける「当たり前の機能」 右図は LLaVA の実例 引用: https://llava-vl.github.io/ Copyright © 2026 Morpho, Inc. All Rights Reserved. 52
CVPR 2026 におけるマルチモーダルの特徴 「VLM」/「MLLM」概念の再編成 ● 従来は、LLM の拡張から 「テキストを出⼒するモデル」という 理解が⼀般的 ● CVPR 2026 では「視覚⾔語統合型 マルチモーダル基盤モデル」に移⾏ ○ 例: Rex-Omni (物体検出) “Rex-Omni is a 3B-parameter Multimodal Large Language Model (MLLM) that redefines object detection and a wide range of other visual perception tasks as a simple next-token prediction problem.” 引用: https://rex-omni.github.io/ Copyright © 2026 Morpho, Inc. All Rights Reserved. 53
CVPR 2026 におけるマルチモーダルの特徴 Omni-modal / Any-to-Any の標榜 ● 「何でも⼊⼒‧何でも出⼒」を ⽬指す論⽂の増加 ● 多くのモダリティがトークン化 (Tokenize) によって、LLM の 枠組みで扱えるようになった ことが主要因 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Li_UniM_A_Unified_Any-to-Any_Interl eaved_Multimodal_Benchmark_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 54
論⽂紹介: Molmo2 完全にオープンソースな動画 VLM ● ● ● ソースコードからモデルウェイト、 学習データの作成⽅法に⾄るまで 再現実装可能なレベルで公開 ○ ただし、⼀部データセットは既存 データセットに由来 8B モデルは多くのタスクにおいて オープンモデル中最良の評価 Video Pointing タスクでは Gemini 3 Pro を 上回る評価 ○ 内容に沿ったフレームと座標を返すタスク 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Clark_Molmo2 _Open_Weights_and_Data_for_Vision-Language_Models_with_Video_C VPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 55
論⽂紹介: OmniGen2 統合型 Vision-Language マルチモーダル⽣成モデル ● ● ⼀つの統合アーキテクチャで様々なタスクを実現 (画像理解/t2i/editing/i2i) 画像⽣成ヘッドとして、⾃⼰回帰ではなく拡散モデルを採⽤ ○ スケーリング特性が理由。初代 OmniGen は⾃⼰回帰を採⽤ 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Wu_OmniGen2_Towards_Instruction-Aligned_Multimodal_Generation_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 56
CVPR 2026 のトレンド Vision-to-Action Copyright © 2026 Morpho, Inc. All Rights Reserved. 57
Vision-to-Action CVPR 2026 のポスターセッション会場には Expo (企業展⽰) が併設 ⾃⽴型ロボットが今年の主役 (主観) ● 特にヒューマノイドロボットは印象的 「⾒て動く (Vision-to-Action)」能⼒ 企業ブース ロボット① ロボット② Copyright © 2026 Morpho, Inc. All Rights Reserved. 58
Vision-to-Action台頭の背景 ● LLM → VLM → VLA — モダリティが「⾏動」まで拡張 ● CVPR 2026 でも関連ワークショップ‧チュートリアル多数 ● キーワードは分散しているが、存在感は明確に増⼤ 例: The Seventh Annual Embodied Artificial Intelligence Workshop https://embodied-ai.org/cvpr2026/ Copyright © 2026 Morpho, Inc. All Rights Reserved. 59
Vision-to-Action 関連⽤語 実は「Vision-to-Action」は、本発表で便宜的につけた名称 主に以下のようなキーワードが対応 タスク単位 実現アプローチ Embodied AI Vision-Language-Action (VLA) ⾝体性を持つエージェントが、 環境を理解し相互差評する 研究領域 視覚‧⾔語‧⾏動を接続し、 指⽰からロボット動作を直接⽣成 Physical AI 物理世界での知覚‧予測‧ 制御を重視する 世界モデル (World Model) ⾏動後の未来を予測し、計画や制御の 内部シミュレーターとして利⽤ 引用: https://www.sciencedirect.com/science/article/pii/S20958 0992500815X Copyright © 2026 Morpho, Inc. All Rights Reserved. 60
VLA の⼀般的なアーキテクチャ Vision-/Language-Encoder と Action Decoder の 3 層構造 ● ● Vision Encoder と Language Encoder が 環境‧指⽰を特徴量へ変換 Action Decoder が両者を統合して ロボットの⾏動を出⼒ ○ 世界モデルは、Action の意思決定 判断材料の⼀つとして利⽤ 引用: https://arxiv.org/abs/2405.14093 Copyright © 2026 Morpho, Inc. All Rights Reserved. 61
論⽂紹介: Motus VLA / 世界モデル統合⼿法 ● ● 従来のロボティクス関連⼿法は、 各サブタスクごとに別々のモデルを 利⽤することが⼀般的 (VLA / World Model / Joint Prediction など) Motus は Mixture-of-Transformers (MoT) というアーキテクチャで統合 ○ 独⽴性を維持しつつ、 Joint Attention で情報を結合 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Bi_Motus_A_Unifi ed_Latent_Action_World_Model_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 62
論⽂紹介: DriveMoE End-to-End⾃動運転向けVLA⼿法 ● ● ● ● (Action の対象はロボティクスに限らない) ⾃動⾞の⾃動運転では⼀般に、マルチカメラ ⼊⼒から次の⾏動を決定 → 全カメラの⼀律処理は⾼コスト 提案⼿法では、Mixture-of-Experts (MoE) の アイデアを応⽤し、重い視覚処理を適⽤する カメラのルーティング‧選別する仕組みを実現 処理の軽量化と⾼性能化の両⽴ 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Yang_DriveMoE_ Mixture-of-Experts_for_Vision-Language-Action_Model_in_End-to-End_Auto nomous_Driving_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 63
「認識」から「⾏動」へ 過去の CVPR = 「認識 (Recognition)」が主役 (学会名の "R") 次の主役として「⾏動 (Action)」が加わりつつある 「⾒る学会」から「⾒て動く学会」への転換点 Copyright © 2026 Morpho, Inc. All Rights Reserved. 64
CVPR2026のトレンド 動画⽣成‧理解‧⻑⽂脈化 Copyright © 2026 Morpho, Inc. All Rights Reserved. 65
CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化 Vision TransformerにおけるSelf-Attentionは系列⻑に対して2乗の計算量でスケールす るため、⻑⽂脈の処理には重⼤なボトルネックが存在する。 ⻑⽂脈のタスク:3D姿勢追跡,⼤規模再構成 Copyright © 2026 Morpho, Inc. All Rights Reserved. 66
CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化 Test-time training (TTT) Learning to (Learn at Test Time): RNNs with Expressive Hidden States, ICML 2025 One-Minute Video Generation with Test-Time Training,CVPR 2025 従来のように拡⼤し続けるKey-Valueキャッシュに依存するのではなく、テ スト時トレーニング(TTT)は、⼊⼒系列の⽂脈情報を局所モデルの「⾼速 重み(Fast Weights)」として保存する。 ⾃⼰監視型オンライン学習 フォワードパス(順伝播)の中で勾配降下法を直接実⾏し、⼊⼒された視覚 トークンを局所重みに圧縮する。 線形計算量 O(N) 局所モデルの隠れパラメータは⼀定サイズであるため、⼊⼒コンテキスト⻑ に対して完全に線形スケーリングが成⽴する。 Copyright © 2026 Morpho, Inc. All Rights Reserved. 67
CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化 ViT3: UnlockingTest-Time Training in Vision (Best paper 候補) ● ● ● ● 体系的な実証研究 :視覚シーケンスにおける TTT設計を検証 6つの設計指針の抽出 :より効果的な視覚 TTTを実現する実用的な ガイドラインを提示 新アーキテクチャ「 ViT3」の提案 :線形計算量と並列計算を両立す る純粋なTTTモデル 優れたパフォーマンス :先進的線形モデルと同等以上、 Vision Transformerに迫る精度を達成 Semantic Segmentationの結果 Han, et al, Vit3: Unlocking Test-Time Training in Vision, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 68
CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化 tttLRM: Test-TIme Training for Long Context and Autoregressive 3D Reconstruction (Highlight論文) ● ● ● ● 「tttLRM」の提案 :TTT層の導入により、長文脈かつ自己回帰的な 3D再構成を線形 計算量で実現。 LaCTブロックによる重み更新 :パッチ分割された入力画像をトークン化し、 LaCTブ ロック内で対応する Fast Weightsを効率的に更新。 仮想トークンによるデコード :更新された高速重みを仮想トークンでクエリし、高品質 な新規視点合成向けに 3Dガウシアン等へとデコード。 優れた再構成性能と実用性 :ストリーミングデータからの段階的な再構成をサポート し、物体・シーンの双方で従来モデルを上回る精度を達成。 LaCT Block Copyright © 2026 Morpho, Inc. All Rights Reserved. Wang, et al, ttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction CVPR 2026 69
CVPR2026のトレンド:動画⽣成‧理解‧⻑⽂脈化 ZipMap: Linear-Time Stateful 3D Reconstruction via Test-time Training ● ● ● 「ZipMap」の提案 :Window Attentionとラージチャンク TTT層を組み合わせ、線形 時間かつ双方向の 3D再構成を実現するモデルを開発。 Single passでの一括予測 :カメラポーズ、深度マップ、ポイントマップを 1回の線形 処理で同時予測し、シーン情報を TTTの高速重みに圧縮保存。 圧倒的な高速化とリアルタイム応用 :700フレーム以上を 10秒未満(H100)で処理 しつつ、新規視点からのリアルタイムなクエリ(再構成)やストリーミング再生をサ ポート。 Jin, et al, ZipMap: Linear-Time Stateful 3D Reconstruction via Test-time Training, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 70
5分休憩 Copyright © 2026 Morpho, Inc. All Rights Reserved. 71
Technical Deep Dive ● Anti-forgetting sampling strategy ○ “Does YOLO Really Need to See Every Training Image in Every Epoch?” ● フローマッチングの動向 ○ ⽣成モデルの基礎技術として定着しつつあるフローマッチングを紹介 Copyright © 2026 Morpho, Inc. All Rights Reserved. 72
Technical Deep Dive: Anti-forgetting sampling strategy Does YOLO Really Need to See Every Training Image in Every Epoch? CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 73
YOLOというのは Redmon, et. al. You Only Look Once: Unified, Real-Time Object Detection, CVPR 2016 YOLO (You Only Look Once) は、卓越した⾼速推論性能によって⾃動運転、スマートシティ監視、製品 の外観検査、リテール店舗解析まで、あらゆる産業で不可⽋な物体検出AIのスタンダードとして君臨し ています。本発表では、未だ改善の余地が⼤きい「学習コストの⾮効率性」に対する新たな解決アプ ローチを提案します。 Copyright © 2026 Morpho, Inc. All Rights Reserved. 74
課題:推論は⾼速、しかし学習は? 推論の効率性: "You Only Look Once" の名の通り、⼀度の⾛査で検 出を完了。 学習の⾮効率性: 従来の学習パイプラインでは、全エ ポックで「全画像」を処理し続ける必要がある。 リソースの浪費: すでに学習済みの画像も、未学習の難しい画 像と同じ頻度で処理されるため、学習時間が膨⼤になる。 すべてのエポックで、すべての画像を使って学 習する必要があるのでしょうか? Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 75
先⾏研究の限界:なぜ精度低下を招くのか? Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 ⼿法分類 (代表例) アプローチ内容 Dataset Pruning (Deep Learning on a Data Diet) 初期の損失(Loss)や勾配統計量に基づき、冗 ⻑または価値の低い「不要画像」を決定して永 久に排除‧削減する。 限界と失敗の理由(論⽂からの指摘) 不可逆性と忘却: ⼀度削減されたサンプルは⼆度と再訪(revisit)で きない静的なプロセスのため、モデルは特定のパター ンを忘却し、残存データに過学習(Overfit)する。 現実との乖離とスケーラビリティ: Dataset Distillation (Fetch and Forge ) データセット全体の挙動を近似する、少数の 「⼈⼯合成画像」を最適化技術により⽣成し、 リアルデータと置き換える。 複雑な⼆段階最適化や⽣成モデルのコストが⾮常 に⾼い。さらに、合成画像は実世界のノイズやオク ルージョン(遮蔽)、コンテキスト(⽂脈)を捉えき れないため精度が低下する。 結論: 物体検出のような複雑なタスクでは、画像を完全に捨て去る「間引き」は精度低下を招く。「いつ、何を⾒るか」の適 その他のアプローチ:カリキュラム学習や⾃⼰ペース学習(Self-paced learning)は難解な画像を徐々に導⼊しますが、それらの画像の継続的な参 加(continuous participation)を維持できないため、同様に最適化を破綻させます。 応的な制御が必要。 ● ● Ding Qi, et. al. Fetch and forge: Efficient dataset condensation for object detection. Proceedings of the Advances in Neural Information Processing Systems, 37: 119283–119300, 2024 Mansheej Paul, et. al. Deep learning on a data diet: Finding important examples early in training. In Proceedings of the Advances in Neural Information Processing Systems, pages 20596– 20607, 2021. Copyright © 2026 Morpho, Inc. All Rights Reserved. 76
提案:学習充⾜度 (Learning Sufficiency) 論⽂では、各画像が「どれだけ⼗分に学習されたか」を定量化する指標を導⼊しました。 指標の意味: 単なる損失(Loss)ではなく、検出の精度と再現率の最⼩値を使⽤することで、モデル の確信度をより正確に反映。 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 77
難易度別の動的サンプリング 学習充⾜度に基づいて、画像を3つのレベルに分類し、間隔反復学習 (SRS) の概念を取り⼊れます。 Easy (簡単): Continuous review 10エポック以上未使⽤のものを優先サンプリングし、最⼩限の リソースで忘却を防⽌。 Moderate (中程度): Short term coverage 2エポック未使⽤の画像をカバレッジ。学習を安定させ境界を明 確化する。 Hard (困難): Full coverage 未習得の難解な画像は常に学習対象。遮蔽や⼩さな物体などへの 対応⼒を維持。 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 78
全体アーキテクチャ (AFSS) Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 79
実験結果 学習進展に伴い、Hard画像がModerate・Easyへと動的に推移する様子 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 80
実験結果 不要画像の段階的削減により、精度向上と1.54倍の高速化を両立 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 81
実験結果 他手法が精度を落とす中、AFSSのみが精度向上(47.2 AP)と最高速(1.54x)を達成 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 82
まとめ 「全⾛査」からの脱却: 推論が"Look Once"なら、学習も「必要な時に、必要なだけ⾒る」べき。 忘却防⽌の重要性: 学習済みの画像を完全に捨てるのではなく、SRS(間隔反復)で賢く復習する ことが精度維持の鍵。 AFSSの成果: 学習速度 1.43x 加速 と 精度向上 を両⽴した、次世代のYOLO学習パラダイム。 Xie, et al, Does YOLO Really Need to See Every Training Image in Every Epoch?, CVPR 2026 Copyright © 2026 Morpho, Inc. All Rights Reserved. 83
Technical Deep Dive フローマッチングの動向 Copyright © 2026 Morpho, Inc. All Rights Reserved. 84
フローマッチングとは ● ● ● 連続的な変換に基づく⽣成モデル 画像⽣成を中⼼に急速に利⽤が拡⼤ ○ 拡散モデルよりも⾼速との報告多数 ○ CVPR でも関連研究が増加 (例: Best Student Paper の TRELLIS.2) 有名な採⽤例: ○ Stable Diffusion 3 (画像⽣成) ○ π₀ / π₀.₅ (ロボティクス向け VLA) 出典: https://arxiv.org/abs/2412.06264 Copyright © 2026 Morpho, Inc. All Rights Reserved. 85
アルゴリズム Overview ● フローマッチングの⽣成過程は常微分⽅程式 (ODE) で記述 ○ ○ v は学習対象の速度場、 p_prior は事前分布 (e.g. ガウス分布) ⽣成データは、 ODE の解 X_1 として得られる ノイズ (t = 0) ● データ (t = 1) 以下の損失関数 (フローマッチング損失) を最⼩化することで、速度場 v を学習 ○ ○ ざっくりといえば、サンプル間の線形補間 (直線) を学習したいというモチベーション 最適な v で⽣成した場合、理論上は X_1 がデータ分布に従う Copyright © 2026 Morpho, Inc. All Rights Reserved. 86
ありがちな解説 ノイズ データ “フローマッチングは、ノイズをデータへ変換する⽣成モデルです。 拡散モデルを発展させた⼿法として提案され、 最適輸送に基づく直線的な⽣成経路を学習することで、 ⾼速かつ⾼品質な画像⽣成を実現します。” …実は、上記の説明は誤解だらけ Copyright © 2026 Morpho, Inc. All Rights Reserved. 87
ありがちな解説 ノイズ データ “フローマッチングは、ノイズをデータへ変換する⽣成モデルです。 拡散モデルを発展させた⼿法として提案され、 最適輸送に基づく直線的な⽣成経路を学習することで、 ⾼速かつ⾼品質な画像⽣成を実現します。” …実は、上記の説明は誤解だらけ Copyright © 2026 Morpho, Inc. All Rights Reserved. 88
誤解① 「ノイズとデータを結ぶ」? A: フローマッチングは、ノイズ分布からの変換に限定されません ● ● ● 画像⽣成 (e.g. text-to-image) では、事前分布としてガウス分布がよく⽤いられる 典型的な拡散モデルは、このガウス事前分布を前提として定式化される ⼀⽅、フローマッチング⾃体は、特定の事前分布を仮定しない ○ 下図は、two-moons 分布から eight-gaussians 分布への変換の実例 事前分布 (two-moons) 学習された軌道 データ分布 (eight-gaussians) Copyright © 2026 Morpho, Inc. All Rights Reserved. 89
誤解② 「拡散モデルの発展型」? A: 単純な上位互換ではありません ● ● ● フローマッチングの事前分布設計の⾃由度が⾼いことは事実 しかし、⼀般にフローマッチングから拡散モデルは直接導出できない ○ データとは独⽴なガウス分布を事前分布として選んだ特殊ケースに限り、 適切な変数変換のもとで対応することが知られている 現代的には、より上位な概念が存在し、それらの異なる派⽣⼿法として理解される ○ [研究者向け解説] 両者はマルコフ制約 path-space KLD 最⼩化問題として統⼀的に記述され、 本質的な差は参照 mixture of bridges (Q) の選択によって定まる 拡散モデル (SBGM) / Q: Markovian SDE 一般化された連続時間生成モデル (path-space KLD 最小化問題 ) フローマッチング / Q: データカップリングと Brownian bridge の mixture & ノイズゼロ極限 Copyright © 2026 Morpho, Inc. All Rights Reserved. 90
誤解③ 「フローマッチングは最適輸送」? A: 問題設定レベルで別物です ● ● ● 最適輸送†: 輸送コストを最⼩化する カップリングを求める問題 ○ 訓練データ間の対応付けを決定 フローマッチング: 与えられたカップリング に基づいた速度場を学習 両者は組み合わせて利⽤されることも多く、 混乱の原因になりがち ○ AI 研究者もよく混同しているので注意 3 最適輸送 100 A 150 (A, X) と (B, Y) の ペアが最適 5 Y B フローマッチング X TIPS カップリングと速度場の同時最適化を行う問題は、 最適輸送分野においてはBenamou-Brenier 定式化として知ら れます。また、 BB 定式化を拡散過程へと一般化したものは(動 的) Schrödinger Bridge 問題と呼ばれます。 X A と X を結ぶ 実際の経路を学習 A † Monge-Kantorovich の定式化に基づく Copyright © 2026 Morpho, Inc. All Rights Reserved. 91
誤解④ 「軌道が直線的」? A: 通常は曲がった軌道が⽣成されます ● ● ● ● 前提知識: なぜ直線が重要? → 直線ならば ODE を数値的に解きやすい 学習で直線的な軌道を利⽤するが、それは⽣成軌道の直線性を意味しない 軌道の形状はデータカップリングに依存 ラフにいえば、与えられたカップリングに交差が含まれない場合に限り直線となる ○ OT-CFM† や RectifiedFlow‡などの最適輸送関連⼿法は、部分的に実現可能 独立カップリング Gaussian-to-Gaussian の生成軌道 交差による軌道の平均化 † Tong, A., “Improving and generalizing flow-based generative models with minibatch optimal transport”, arXiv e-prints, Art. no. arXiv:2302.00482, 2023. doi:10.48550/arXiv.2302.00482. Liu, X., Gong, C., and Liu, Q., “Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow”, arXiv e-prints, Art. no. arXiv:2209.03003, 2022. doi:10.48550/arXiv.2209.03003. ‡ Copyright © 2026 Morpho, Inc. All Rights Reserved. 92
正しい説明 ノイズ データ “フローマッチングは、分布の連続変換を記述する⽣成モデルです。 拡散モデルよりシンプルなアルゴリズムとして提案されました。 最適輸送と組み合わせることで⽣成軌道が直線になり、 より⾼速かつ⾼品質な画像⽣成を実現できます。” Copyright © 2026 Morpho, Inc. All Rights Reserved. 93
Technical Deep Dive: フローマッチング 論⽂紹介 (CVPR 2026) Copyright © 2026 Morpho, Inc. All Rights Reserved. 94
論⽂紹介: Just Image Transformer (JiT) Tianhong Li, and Kaiming He “Back to Basics: Let Denoising Generative Models Denoise” ● ● ● 「⾃然画像の多様体仮説」は広く信じられる ○ 低次元多様体に分布するというもの ○ ⼀⽅、速度場にはそのような仮説 は知られていない [仮説] 速度場ではなく、⾃然画像を直接予測 すれば、学習の難易度が下がるのでは? ○ 拡散モデルでは「x-pred.」として知られる 実験的に良好な結果が得られる ○ swissroll 分布の再現において、x-pred 以外は ⾼次元化によって破綻 注: パラメータ変換は事前分布のガウス性に強く依存 ⼀般に⾮ガウスのケースでは、 x-/ε-pred ⾃体が ill-defined 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Li_Back_to_Basics_Let_Denoising _Generative_Models_Denoise_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 95
論⽂紹介: Improved Mean Flow (iMF) 1/3 Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models” ● MeanFlow† というフローマッチングの派⽣⼿法が最近話題 ○ たった 1 ステップでの⽣成が可能だと主張 ○ 「ある時刻の速度ベクトル v」の代わりに「ある時刻 から別の時刻へ移動する平均速度ベクトル u」を学習 ○ Mean Flow 恒等式 (右下) を活⽤することで、 蒸留を使わずに効率的な学習を実現 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf † Geng, Z., Deng, M., Bai, X., Zico Kolter, J., and He, K., “Mean Flows for One-step Generative Modeling”, arXiv e-prints, Art. no. arXiv:2505.13447, 2025. doi:10.48550/arXiv.2505.13447. Copyright © 2026 Morpho, Inc. All Rights Reserved. 96
論⽂紹介: Improved Mean Flow (iMF) 2/3 Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models” ● ● しかし、後続研究において Mean Flow の学習は不安定 と報告が多数挙がる iMF は、学習ターゲットが推論モデル (u) に依存する ことが原因だと分析 → 損失関数評価を u から v に戻すことで改善 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 97
論⽂紹介: Improved Mean Flow (iMF) 3/3 Z. Geng et al. “Improved Mean Flows: On the Challenges of Fastforward Generative Models” 引用: https://openaccess.thecvf.com/content/CVPR2026/papers/Geng_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models_CVPR_2026_paper.pdf Copyright © 2026 Morpho, Inc. All Rights Reserved. 98
フローマッチングの動向: まとめ ● フローマッチング: 拡散モデルに続く、⽣成モデルの⼀種 ○ ● ● シンプルさと⾼品質性が特徴 アルゴリズムに対する誤解が⽐較的多い ○ フローマッチングそのものは最適輸送ではない ○ ⼀般的な設定では直線軌道になることは稀 CVPR 2026 の関連論⽂を紹介 ○ Just Image Transformer (JiT): 再パラメータ化による品質向上 ○ Improved Mean Flow (iMF): 1-ステップアルゴリズムの改善 Copyright © 2026 Morpho, Inc. All Rights Reserved. 99
全体のまとめ 1. 2. 3. CVPR ⼊⾨ ○ AIブームの最先端をゆく、CV分野最⾼峰の国際学会 ○ 年々増加する論⽂数、トレンド合わせた分野拡⼤ CVPR 2026 のトレンド ○ 全論⽂タイトルからトレンドワード抽出 ○ CVPR 2026 におけるトピックの動向を紹介 ■ マルチモーダル AI ■ Vision-to-Action ■ 動画⽣成 Technical Deep Dive ○ Anti-forgetting sampling strategy ○ フローマッチングの動向 Copyright © 2026 Morpho, Inc. All Rights Reserved. 100