---
title: 【Paper&amp;Hacks vol.101】VLA最新論文について紹介
tags: 
author: [松尾研LLMコミュニティ](https://image.docswell.com/user/matsuo-lab_llm)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/KE4WY4XPJ1.jpg?width=480
description: 【Paper&amp;Hacks vol.101】VLA最新論文について紹介 by 松尾研LLMコミュニティ
published: October 05, 26
canonical: https://image.docswell.com/s/matsuo-lab_llm/K6ND8W-Paper&amp;HacksVol.101
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/KE4WY4XPJ1.jpg)



# Page. 2

![Page Image](https://bcdn.docswell.com/page/L71Y64NXJG.jpg)

VLA最新論文について紹介
異業種データサイエンス研究会メンバー
西前 和隆
2026/10/6


# Page. 3

![Page Image](https://bcdn.docswell.com/page/G7WGWX4KE2.jpg)

本日のアジェンダ
01
VLAの基礎
02
VLAの問題点
03
論文1： CLAP(Closed-Loop Alignment with Pressure for Precise Suction Manipulation)
04
論文2：SEES(CoDistill-GRPO: A Co-Distillation Recipe for Eﬃcient Group Relative Policy 04
Optimization )
定義·系譜·アーキテクチャ·行動表現·学習パイプライン·評価
長期タスク·データ·接触知覚·閉ループ性·精度·汎化·安全·評価
真空圧で吸着状態を観測し、精密な積み付けを実現するVLA
蒸留失敗からボトルネックを特定し、シミュレーションRLで自己進化
05
まとめ
論文ごとの貢献・問題点への回答・統合メッセージ


# Page. 4

![Page Image](https://bcdn.docswell.com/page/4JZL562NE3.jpg)

01.VLAの基礎
視覚と言語の理解をロボットの行動生成に直結させる、
Vision-Language-Action モデルの全体像を押さえる


# Page. 5

![Page Image](https://bcdn.docswell.com/page/YE6W92V9EV.jpg)

01.VLAの基礎 (VLAとは：観測と言語指示から行動を直接出力するポリシー)
画像・言語・ロボット状態 → kステップ分の行動
a_t:t+k ~
2024
π_θ( · | o_t , l , q_t )
o_t：画像観測／ ：
l 言語指示／ q_t：固有受容（関節角・グリッパ状態）／出力：kステップ分の行動
事前学習VLMを転用
Web規模の画像・テキストで
得た意味理解をロボット制御
に持ち込む
End-to-End
知覚・計画・制御を一つのネ
ットワークで学習する
汎用性を志向
複数タスク・複数ロボット
（embodiment）を1つのモデル
で扱う
従来のモジュール型（認識 → 計画 → 制御）との違い：VLMの事前学習知識をそのまま行動生成に使う


# Page. 6

![Page Image](https://bcdn.docswell.com/page/GE5MN2DDE4.jpg)

01.VLAの基礎 (主要モデルの系譜（2022–2026）)
RT-2で「VLA」が提唱され、π0以降は連続行動の生成モデルが主流に
2022.12
2023.07
2024.05
2024.06
RT-1
RT-2
Octo
OpenVLA
大規模実機デモで学
習したTransformerポ
リシー
VLMを行動トークン
で共同微調整。
「VLA」を提唱
OXEで学習した拡散ヘ
ッドの汎用ポリシー
7B・オープン重み。
離散行動トークン
2024.10
2025.03
2025.04
2026.05
π0
GR00T N1
π0.5
RLDX-1
VLM＋ﬂow matching
の action expert
ヒューマノイド向け。
VLM＋拡散
Transformerの二重系
高レベル推論と低レ
ベル行動の統合
器用な手の操作を重
視（SEESで使用）


# Page. 7

![Page Image](https://bcdn.docswell.com/page/972951MMJR.jpg)

01.VLAの基礎 (標準的な構成：VLMバックボーン＋行動ヘッド)
画像パッチ・言語トークン・固有受容を統合し、行動チャンクを出力
視覚エンコーダ
SigLIP / DINOv2
入力の融
合
言語指示
トークナイズ
VLMバックボーン
数B規模のLLM
画像パッチと言語トークンを同一系列に並べ、
固有受容状態は別トークンや行動ヘッドへ注
入する
行動ヘッド
トークン / 拡散 /
ﬂow
出力の形
式
行動チャンク
a_t … a_t+k
行動の表現方法（離散か連続か）が、推論速
度・精度・学習安定性を大きく左右する
後半との関係：CLAPは「固有受容の入力」を、SEESは「行動ヘッド周りのLoRA」を改変する


# Page. 8

![Page Image](https://bcdn.docswell.com/page/DJY4KZXP7M.jpg)

01.VLAの基礎 (行動をどう表すか：3つの方式)
行動表現の違いは推論速度・精度、さらにはRLの実装にも影響する
方式
代表例
仕組み
長所／短所
離散トークン
RT-2, OpenVLA
各次元を256ビンに量子化し語
彙として出力
VLMをそのまま使える／逐次生
成が遅く精度が粗い
圧縮トークン
FAST
行動系列をDCT変換＋BPEで圧縮
してトークン化
高頻度制御に強い／復号の誤差
に注意
連続生成
π0, Octo, GR00T
拡散・ﬂow matchingの行動エキス
パートで連続値を生成
滑らかで多峰性を表現／反復サ
ンプリングの計算
SEESはﬂow系ポリシーのPPOで、最終行動ではなくデノイジング遷移の尤度を用いる


# Page. 9

![Page Image](https://bcdn.docswell.com/page/V7NYR31ME8.jpg)

01.VLAの基礎 (行動チャンク：まとめて予測し、開ループで実行する)
CLAPへの伏線：実行窓の間は「目をつぶっている」
観測 o_t
推論を1回実行
k個の行動を予測
a_t … a_t+k
利
点
推論回数が減り高頻度制御が可能。時間的に一
貫した滑らかな動作になり、模倣学習の複合誤
差も抑えられる（ACT, π0 など）
kステップ実行
この間は観測を見な
い
次の推論
o_t+k から
代償
実行窓の間は観測を使わない。想定外の事象
（把持失敗・接触変化）に即座に反応できない


# Page. 10

![Page Image](https://bcdn.docswell.com/page/YJ9PM95W73.jpg)

01.VLAの基礎 (学習は多段：VLM事前学習から強化学習まで)
模倣学習だけではデモの質と量が上限 → RLでデモを超える改善を狙う
① VLM事前学習
Web画像・テキスト
②ロボット事前学習
多様なデモの大規模
混合
③ タスクSFT
対象ロボット・タス
ク
④ RL微調整
シミュレーション等
でオンラインRL
• ①②で汎用性を、③で対象環境への適合を得るのが基本形。パラメータ効率のためLoRAも
よく使われる
• ④は2025年以降に急増：SimpleVLA-RL、
RLinf などの枠組みが登場（SEESはRLinf上に実装）
• SEESは④を「どのタスクを・どの報酬で・いつ訓練するか」まで自動化したものと位置づけ
られる


# Page. 11

![Page Image](https://bcdn.docswell.com/page/GJ8DL9YRJD.jpg)

01.VLAの基礎 (データ：テレオペレーションによるデモが中心)
Web言語データと比べて桁違いに小さく、集めやすいタスクに偏る
100万+
Open X-Embodiment：22種のロボットから
の軌跡を集約した共有データセット
収集コスト
1デモごとに人手のテレオペが必要。多段
の長いタスクほど高価になる
7.6万
DROID：多様な実環境で収集されたフラン
カアームの軌跡
分布の偏り
安価に集めやすい短い単段タスクに偏りや
すい（SEESが指摘する問題）


# Page. 12

![Page Image](https://bcdn.docswell.com/page/LJLMLW42ER.jpg)

01.VLAの基礎 (評価：シミュレーションのベンチマークと実機試験)
主な指標は成功率（%）。精密操作では配置誤差（mm）も用いる
ベンチマーク
内容
本日の論文
LIBERO
Object / Spatial / Goal / Long の4スイート × 各10タス
ク
SEES
RoboCasa365
キッチン環境。atomic 65タスク＋複合300タスク
SEES
SIMPLER など
実機ポリシーをシミュレーションで再現評価
—
実機試験
タスクごとに試行を重ねて成功率・誤差を測る
CLAP（Unitree
Z1）
SEESはシミュレーションのみ、CLAPは実機のみで評価 — 結果を読む際の前提として重要


# Page. 13

![Page Image](https://bcdn.docswell.com/page/47MYM9K97W.jpg)

01.VLAの基礎 (階層型VLA：計画するVLMと、動かすポリシーを分ける)
「遅い推論系（System 2）＋速い制御系（System 1）
」の二重構造
長期の指示
「まな板を洗って」
VLMプランナ
System 2：サブタス
クに分解
行動ポリシー
System 1：高速に実
行
ロボット
• GR00T N1、
Figure の Helix、π0.5 などが二重構造を採用
• 長期タスクを atomic なサブタスクの列として扱うことで、失敗の位置を特定しやすくな
る
• SEESはこの分解を前提に、どのサブタスクが失敗の原因かを数える仕組みを作る


# Page. 14

![Page Image](https://bcdn.docswell.com/page/P7R9VGX9E9.jpg)

02.VLAの問題点
短期·単段のタスクではよく動く一方、実用の現場で壁に
なる課題を整理する


# Page. 15

![Page Image](https://bcdn.docswell.com/page/PJXQZX637X.jpg)

02.VLAの問題点 (主な問題点の地図)
SEESは「学習の側」、
CLAPは「実行の側」の問題を攻める
① 長期タスク
段数が増えると
成功率が急落
⑤ 精度
mm単位の配置で
誤差が累積
② データ
高コストで単段
タスクに偏る
⑥ 汎化
新しい物体・環境
で崩れる
• 知覚の欠落接
触・力・内部状
態が見えない
⑦ 計算と安全
推論遅延、失敗の
検知と回復
④ 開ループ実行
チャンク実行中
に反応できない
⑧ 評価
sim-real差、試行数
の少なさ
オレンジ＝SEESが扱う問題 ／ 青＝CLAPが扱う問題 ／ グレー＝本日の2論文では主題外


# Page. 16

![Page Image](https://bcdn.docswell.com/page/3JK98W1NJD.jpg)

02.VLAの問題点 ( ① 長期タスク：各段の失敗率が掛け算で効く)
段数に対して成功率は指数的に低下する
• 例：成功率90%の段を5つつなぐと全体は 0.9^5 ≈
59%、10段なら ≈ 35%
• 前段の小さなずれが後段の初期状態を分布外
に押し出す（複合誤差）
• どの段が原因で失敗したのか、外から見ても
分かりにくい
関連する論文：SEES
1つの弱いatomicスキルが多数
の複合タスクを壊す、という観
察から出発する


# Page. 17

![Page Image](https://bcdn.docswell.com/page/LE3W21QZE5.jpg)

02.VLAの問題点 ( ② データ：集めやすいタスクに偏り、運用後に足しにくい)
人手による診断とデモ追加のループは配備後に回らない
• デモは人手のテレオペが前提で、多段タスク
ほど収集が高価
• その結果、学習データは単段の短いマニピュ
レーションに偏る
• 弱点を直すには専門家がボトルネックを診断
し、追加デモを集める必要がある
• 製品として配備した後では、この人手のループ
は現実的でない
関連する論文：SEES
追加の専門家デモなしで、失敗
から自動的に改善する仕組み
を提案


# Page. 18

![Page Image](https://bcdn.docswell.com/page/8EDKZX947G.jpg)

02.VLAの問題点 ( ③ 知覚の欠落：カメラだけでは見えない状態がある)
指令値は入っていても、実際に起きたことは観測されていない
• 接触状態・把持力・吸着の成否は画像に映り
にくい
• 決定的な瞬間に、グリッパ自体が対象物を遮
蔽する
• 多くのVLAは固有受容として「指令値」を入れ
ており、実際に起きたことを観測していない
関連する論文：CLAP
真空ラインの圧力を測り、
吸着状態を観測可能にする


# Page. 19

![Page Image](https://bcdn.docswell.com/page/V7PKDPZVJ8.jpg)

02.VLAの問題点 ( ④ 開ループ実行：チャンク実行中は失敗に気づけない)
チャンク長の固定的なトレードオフ
• kステップの実行窓の間、ポリシーは新しい観
測を使わない
• 把持が外れた・ずれたまま、残りの行動を最
後まで実行してしまう
• 窓を短くすれば反応性は上がるが、推論コス
トと動作の一貫性が犠牲になる
関連する論文：CLAP
圧力信号をトリガに実行窓
を打ち切り、新しい観測か
ら再推論する


# Page. 20

![Page Image](https://bcdn.docswell.com/page/2JVV12WRJQ.jpg)

02.VLAの問題点 ( ⑤ 精度：誤差が層をまたいで受け継がれる)
吸着ではメカニカルな位置合わせ（セルフアライン）が効かない
• 積み付け・パレタイズでは、下の層の誤差が
そのまま上の層の土台になる
• 平らな吸着パッドには、ずれた姿勢を正しい
位置へ導く形状的な手がかりがない
• 成功率だけでなく、配置誤差（mm）での評価
が必要になる
関連する論文：CLAP
4ブロック積みの成功試行で
平均配置誤差 15.92 mm を報
告


# Page. 21

![Page Image](https://bcdn.docswell.com/page/5EGL2RD6JL.jpg)

02.VLAの問題点 ( ⑥ 汎化：学習分布の外で性能が崩れる)
本日の主題ではないが、SEESの結果を読む背景として
新しい物体・配置
見たことのない形状・色・
配置で成功率が低下する
新しい環境
照明・背景・カメラ位置の
変化に弱い
新しいembodiment
ロボットの形状や行動空間
が変わると転移が難しい
SEESは、進化に使っていない Composite-Unseen タスクでの改善も報告


# Page. 22

![Page Image](https://bcdn.docswell.com/page/4JQYPV127P.jpg)

02.VLAの問題点 ( ⑦ 推論コストと、失敗の検知・回復)
下段は発表者の解
釈
推論コスト・リアルタイム性
数B規模のモデルを制御周期内で動かす必
要がある。量子化・小型化・チャンク化・
非同期推論などの工夫が続く
安全性と失敗回復
失敗を自分で検知できないと危険な状態の
まま動作が続く。検知後の回復行動も学習
データにほとんど含まれない
CLAPの「中断された把持の後の構成」をカバーするデモ、SEESの終了ヘッドと失敗帰属は、
いずれも失敗検知・回復の一形態とみなせる


# Page. 23

![Page Image](https://bcdn.docswell.com/page/K74WYMRPE1.jpg)

02.VLAの問題点 ( ⑧ 評価：シミュレーションと実機の差、試行数の少なさ)
数字を見る前に「どの環境で何回試したか」を確認する
• シミュレーションの成功が実機に移るとは限らない（sim-to-real gap）
• 実機評価は試行が数十回程度になりがちで、数ポイントの差は統計的に揺れる
• ベンチマーク間で設定がそろっておらず、手法の横比較が難しい
CLAP（論文1）
実機のみ（Unitree Z1）で評価
SEES（論文2）
シミュレーションのみ。実機は未検証と著
者も明記


# Page. 24

![Page Image](https://bcdn.docswell.com/page/LJ1Y68QXEG.jpg)

03.論文1
CLAP：Closed-Loop Alignment with Pressure
真空圧で吸着状態を観測し、精密な積み付けを実現するVLA
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 25

![Page Image](https://bcdn.docswell.com/page/GJWGWZMK72.jpg)

03.論文1：CLAP(論文1：基本情報）
出典：論文本文（arXiv v1 PDF）。以降の数値は Table I・II および本文による
項目
内容
タイトル
CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
著者
Yixian Zou, Chongyang Xu, Yuling Xin, Ziliang Feng, Fanman Meng, Shuaicheng
Liu（電子科技大学・四川大学）
投稿
arXiv:2609.32767（cs.RO）、2026年9月26日、8ページ・図6点
ベース
π0.5 を全パラメータ微調整。実機 Unitree Z1 のみで評価（計1,560試行）
公開予定
コードと学習済み重みを公開予定と記載
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 26

![Page Image](https://bcdn.docswell.com/page/4EZL51QN73.jpg)

03.論文1：CLAP(課題設定：積み付け・パレタイズは誤差を許さない)
ある層に残った誤差は、そのまま次の層に受け継がれる
1層目
わずかな位置ずれ
誤差の継承
ある層に残った配置誤差は、
そのまま次の層に受け継が
れる
2層目
ずれた土台の上に置く
補正の手がかりがない
平らなパッドには、ずれた
姿勢を正しい位置へ導く
形状的な特徴がない
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
3層目以降
誤差が蓄積・継承
なぜ吸着か
密な配置では挟む隙間がな
い。Z1標準グリッパの開口
80mmのブ
は約50mmで、
ロックをつかめない


# Page. 27

![Page Image](https://bcdn.docswell.com/page/Y76W9L697V.jpg)

03.論文1：CLAP(吸着はVLAに取り込まれているが、空白がある)
「既存研究は吸着で何を拾えるかを示した。本研究は正確に置けるかを問う」
既存研究
VacuumVLA：吸着を二値フ
ラグとして扱う。GVLA：
交換可能なグリッパ種別の
1つとして扱う
触覚VLAとの違い
TacVLA・OmniVTLA などは
指や手首で接触の力学を測
る。吸着の失敗は「シール
がない」ことで、真空圧
が直接示す
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
報告されていないこと
計測した真空信号に条件づ
けたポリシー、またその信
号で実行中の行動を中止す
るポリシー


# Page. 28

![Page Image](https://bcdn.docswell.com/page/G75MN16D74.jpg)

03.論文1：CLAP(なぜ視覚では足りないか：カップと対象面が互いを隠す)
視覚で判断できない情報を、別のセンサで補う
OCCLUSION
吸着の瞬間
吸着が成立したか否かは、
カメラからはほぼ判別でき
ない
帰
結
ベースラインの状態欄には吸引の「指令」
吸着カップが、保持すべき面そのものを覆
い隠す
が入るので、掴み損ねても「吸着中」と読
める
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 29

![Page Image](https://bcdn.docswell.com/page/9J2951NMER.jpg)

03.論文1：CLAP(中心アイデア：吸着状態を「観測できる」ようにする)
1つの圧力信号を、入力・融合・実行制御の3か所で使う
真空ラインのY字継手の行き止まり側に、数ドルのMEMS圧力センサを付けて静圧を測る
① 入力を変える
読み取った吸着状態を、固
有受容の「吸着コマンド」
と置き換える
② 特徴を混ぜる
圧力をクエリにして、視覚
トークンへのクロスアテン
ションで融合する
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
③ 実行を止める
吸引中に「保持なし」が続
いたら実行窓を打ち切り、
再推論させる


# Page. 30

![Page Image](https://bcdn.docswell.com/page/DEY4KZPPJM.jpg)

03.論文1：CLAP( CLAPの全体構成：バックボーンは π0.5)
圧力は入力・融合・実行制御の3か所で使う
言語指示
カメラ ×2
第三者視点・手首（D435）
状態 s_t
（7次元）
6関節＋吸着状態
圧力 v_t
MEMS真空センサ
マルチモーダル融合
圧力をクエリに視覚トークンへ8ヘッドの
クロスアテンション、ゲート付き残差で加算
π0.5
行動チャンク
50ステップを予測し
先頭25（0.83秒）を実行
VLM：PaliGemma 2B
行動エキスパート：Gemma 300M
（ﬂow
matching）
閉ループ化：吸引中に「保持なし」が4ステップ続く → 残りを破棄 → 新しい観測から再推論
学習は公開済み π0.5 チェックポイントから全パラメータを微調整（出典：Fig. 2、Sec. III-B・IV-A）
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 31

![Page Image](https://bcdn.docswell.com/page/VJNYR35M78.jpg)

03.論文1：CLAP(仕組み①：指令値ではなく、実測値をポリシーに入れる)
視覚は「何をしようとしているか」を、圧力は「うまくいったか」を知る
s_t = (q_t, u_t),
u_t = 指令 → 1 − h_t
7次元：q_t は6関節角／ベースラインは u_t に指令値、CLAPは 1 − h_t（h_t：シール成立なら1。保持＝0の規約に合わせる）
従来：吸着コマンド
CLAP：実測した吸着状態
収集時に置き換える
掴み損ねても状態は「吸引
中」のまま。持っていない
ブロックを持っていると告
げられる
ラインが実際にどうなったか
を読む。指令と実態のずれを
ポリシーが観測できる
学習時と配備時で意味が同じ
になり、状態の次元も増えな
い
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 32

![Page Image](https://bcdn.docswell.com/page/YE9PM9YWJ3.jpg)

03.論文1：CLAP(仕組み②：圧力のデコードと、クロスアテンションによる
融合）
単純に連結すると数百の視覚トークンの中の1入力に埋もれる（連結は −10.00pt）
デコード（Arduino・閾値2つ）
状態
センサ電圧
sealed（保持）
v &lt; 0.01 V
leaking（漏れ）
0.01 ≤ v &lt; 0.22 V
open（開放）
v ≥ 0.22 V
ポリシーには二値 h_t＝[sealed] を渡す。閾値
はタスク間で再調整していない（ポンプやカッ
プを変えると変わる）
融合（クロスアテンション）
p_t = W_p u_t + b_p
ĝ_t = MHA(Q=p_t, K=V_t, V=V_t)
Ṽ_t = V_t + α ĝ_t , α₀ = 0
8ヘッド。圧力がどの画像パッチを要約するか
を選び、全視覚トークンに加える。α=0 から始め
るので、学習初期は元の π0.5 と同じ計算
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 33

![Page Image](https://bcdn.docswell.com/page/GE8DL96RED.jpg)

03.論文1：CLAP(仕組み③：吸着の失敗で、開ループの実行窓を打ち切る)
中止が決めるのはタイミングだけ。回復動作は新しく推論したチャンクが決める
50ステップを予測
先頭25を実行（0.83秒）
吸引中に保持なし
4ステップ連続（0.13秒）
その場で中止
残りの行動は破棄
再推論
新しい観測から
1つの仕組みで2つの失敗
N=4は物理から決定
回復は学習で
掴み損ねたまま運ぶ失敗と、
搬送中にシールが外れる失
敗の両方を拾う
成立するシールは1〜2ステ
ップで成立。それを待ち切り、
チャンク全体は待たない長さ
中止後の動きはスクリプトで
はなく、新しく推論したチャ
ンクが生成する
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 34

![Page Image](https://bcdn.docswell.com/page/LELMLW927R.jpg)

03.論文1：CLAP(データ①：完成状態から分解し、時間を逆にたどる)
最も正確な姿勢が、精度が必要なデモの最後に来る
完成形を手で組む
最終姿勢を直接置く
実機で分解を記録
テレオペで取り外す
関節系列を反転
オフライン・シミュ不要
組み立てのデモ
正確な姿勢が最後に
2日 → 半日
14.6秒 → 0.5秒
P2のデモ収集時間（順方向 → 逆方向、同じエピ
ソード数）
置く直前に位置合わせで迷う時間の中央値（1
個目。2個目は順方向26.4秒）
変換は q̃ _t = q_(T−t)。次の関節目標を絶対値で読むので符号の手修正は不要。吸着チャネルは把持と解放
が互いの逆なのでそのまま使う
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 35

![Page Image](https://bcdn.docswell.com/page/4JMYM9Z9JW.jpg)

03.論文1：CLAP(データ②：狙いを絞ったフェーズデモは学習フレームの
8.3%）
192本の短い区間（全エピソードの約1/4の長さ）
8.3%
192本の区間デモが学習フレーム全体
に占める割合
構成：タスクごとに64区間
ピック16＋配置48。半分はカップを上面の中心に、半分は
縁まで外して付け、運搬中の傾きの補正を学ばせる
中止後の状態をカバー
ピックは「カップが空でブロックが机上」から始まる。
掴み損ねた後と同じ状況なので、回復が学習済みになる
フル軌道は常に逆順。机から拾う区間は順方向、積む区間はすべて逆順で記録（区間ごとに
方向を選ぶ）
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 36

![Page Image](https://bcdn.docswell.com/page/PJR9VG6979.jpg)

03.論文1：CLAP(実験設定：実機 Unitree Z1・3タスク・各設定20試行)
すべてのベースラインは同じデータ・同じ評価基準
項目
内容
ハード
Unitree Z1＋吸着ハンド、RealSense D435×2
（第三者視点・手首）
タスク
P1：1個をパッドへ／ P2：2段積み／ P4：2段×2列の2×2（ブロック80mm角）
条件
単色・多色 ×単一タスク・マルチタスク（1チェックポイント）。位置と向きは机上
全域でランダム
成功基準
1層目がはみ出さず5秒立ち、重なるべき角の最大距離が P2 20mm・P4 40mm以内
比較対象
ACT、Diﬀusion Policy、DP3、X-VLA、π0、π0.5
試行数
各設定20試行、表I・IIで計1,560試行
データ・学習
567軌道（逆順375＋区間192）、196分、146,774フレーム。π0.5から全パラメータ、3
万ステップ
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 37

![Page Image](https://bcdn.docswell.com/page/PEXQZXM3JX.jpg)

03.論文1：CLAP(結果：マルチタスクで平均成功率 96.67%（単色・多色とも）
成功率（%）
、
P1〜P4は単色。出典：Table I
手法（マルチタスク）
P1
P2
P4
平均（単色）
平均（多色）
X-VLA
80
85
75
80.00
86.67
π0
50
45
20
38.33
58.33
π0.5
75
75
60
70.00
80.00
CLAP
100
100
90
96.67
96.67
+16.67pt / +10.00pt
最強ベースライン X-VLA との差（単色 / 多色）
差は「到達」ではなく「仕上げ」
タスク特化型（ACT・DP・DP3）はP2・P4で0%。単
一タスクでもCLAPが最高（90.00% / 81.67%）
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 38

![Page Image](https://bcdn.docswell.com/page/3EK98WGNED.jpg)

03.論文1：CLAP(精度：4ブロック積み（P4）で平均誤差 15.92 mm)
マルチタスク・単色、成功試行の平均（出典：Table I）
配置誤差（mm、小さいほど良い）
20
測り方
18.74
17.78
15.92
15
10.72
10.47
10
8.42
5
0
X-VLA
重なるべき角の組の最大距離をノギスで計
測。完成した積みが角を隠すため画像では
測れない
π0.5
P2
CLAP
ばらつきも小さい
単一タスクP4の標準偏差：CLAP 3.35mm、
π0.5 10.12mm。ばらつきは次の段を載せた
ときの崩れに直結
P4
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 39

![Page Image](https://bcdn.docswell.com/page/L73W21NZ75.jpg)

03.論文1：CLAP(アブレーション：4つの要素を外すと 5.00〜13.33pt 低下)
マルチタスク・単色。出典：Table II（「圧力フィードバックなし」は中止機能も欠く）
設定
P1
P2
P4
平均
Δ
誤差P4
CLAP（フル）
100
100
90
96.67
0.00
15.92
実行中の中止なし
100
90
85
91.67
−5.00
18.48
融合を連結に変更
90
90
80
86.67
−10.00
17.78
圧力フィードバックなし
95
85
75
85.00
−11.67
18.04
フェーズデモなし
90
85
75
83.33
−13.33
20.35
全部なし（π0.5）
75
75
60
70.00
−26.67
18.74
低下は加算的でない（合計40.00 vs 全部なし26.67）。Fisher正確検定で有意：フェーズデモなし p=0.03、
π0.5 p&lt;0.001（連結は p=0.09）
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 40

![Page Image](https://bcdn.docswell.com/page/87DKZXW4JG.jpg)

03.論文1：CLAP( CLAPの貢献を3行で)
結果：実機で平均成功率 96.67%、4ブロック積みで誤差 15.92 mm
1 観測：数ドルの圧力センサで、視覚では遮蔽される吸着状態を観測可能にした
２ 制御：実測値を固有受容に入れ、クロスアテンションで視覚と融合し、失敗時
は実行窓を打ち切って再推論
３ データ：分解の逆再生と8.3%のフェーズデモで、精密配置と立て直しのデモを効
率よく作った
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 41

![Page Image](https://bcdn.docswell.com/page/VJPKDP9VE8.jpg)

03.論文1：CLAP(論文1：強みと、著者が認める限界)
「ループが見るのは接触であって、進捗ではない」
強み（発表者の見解）
安価なセンサ1つで入力・融合・実行制御の3か
所を改善する簡潔な設計。1,560試行と検定まで
付けた実機評価
著者が認める限界
P4で遮蔽が強いと完了と誤認して早く止まる。
補正動作が置いたブロックを崩すことがある。
閾値は回路に依存。逆再生そのものの効果は未
分離
研究的な問い
力覚・触覚など他の内部状態でも「指令値を実測値に置き換え、イベントで実行窓を切る」は一般化で
きるか
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 42

![Page Image](https://bcdn.docswell.com/page/2EVV12MREQ.jpg)

04.論文2
SEES：A Self-Evolving Embodied System via
失敗からボトルネックを見つけ、追加デモなしで自己進化
するVLA
[2] SEES：A Self-Evolving Embodied System via


# Page. 43

![Page Image](https://bcdn.docswell.com/page/57GL2RG6EL.jpg)

04.論文2：SEES (論文2：基本情報)
出典：論文本文（arXiv v1 PDF）。以降の数値は Table 1〜7 および付録による
項目
内容
タイトル
SEES: A Self-Evolving Embodied System via Failure-Guided VLA Policy
Adaptation
著者
Ziwen Li, Hanlue Zhang, Zhenyang Ren, Tianyu Huang（筆頭4名は同等貢献）
ほか計12名
所属
MBZUAI、シドニー大、オックスフォード大、AI2 Robotics、ウォータール
ー大、メルボルン大
投稿
arXiv:2609.32698
（cs.RO）、2026年9月26日、本文10ページ＋付録
評価
RoboCasa365・LIBERO（いずれもシミュレーション）
、バックボーン
GR00T N1.5 / RLDX-1
[2] SEES：A Self-Evolving Embodied System via


# Page. 44

![Page Image](https://bcdn.docswell.com/page/4EQYPVX2JP.jpg)

04.論文2：SEES (問題設定：短期タスクは得意、長期タスクは苦手)
1つの弱いスキルを直せば、多くのタスクが同時に良くなる
観察
原因の一つ
VLAは多様な短期タスクで汎化
するが、多段の長期タスクで
は信頼性が低い
多段のデモは高コストで、既
存データは短期の操作に偏っ
ている
鍵となる洞察
少数の共有されたatomicスキル
の弱さが、多くの長期タスク
の失敗を引き起こす
問い：ロボットは、追加の専門家デモなしで、自らボトルネックを特定し改善できるか？
[2] SEES：A Self-Evolving Embodied System via


# Page. 45

![Page Image](https://bcdn.docswell.com/page/KJ4WYM6P71.jpg)

04.論文2：SEES (人が診断しデモを足す方式から、自動で回る方式へ)
訓練対象を失敗統計から選び、関連スキルで1つのアダプタを共有する
従来（人手による改善）
SEES
ボトルネックの特
定
改善のデータ
専門家が失敗を見て診断
atomic段ごとの失敗を自動集計
追加の専門家デモを収集
シミュレーションで状態を復元
し
オンラインRL
報酬・成功判定
—
LLMが成功判定関数を生成
配備後の運用
家庭に配備した商用ロボットで
は非現実的
実行と進化のループを繰り返す
RLinf-VLA・SimpleVLA-RL は「与えられたタスクと報酬」でRL。CORAL などはタスクごとに別
アダプタ。SEESは訓練対象を失敗統計から選び、アダプタを共有する
[2] SEES：A Self-Evolving Embodied System via


# Page. 46

![Page Image](https://bcdn.docswell.com/page/LE1Y68VX7G.jpg)

04.論文2：SEES ( SEESの全体像：実行と進化の2つのループ)
改善したアダプタだけを登録し、次の実行ラウンドへ戻る（RoboCasa365 では3ラウンド）
EXECUTION（実行）
長期指示を分解
family方策で実行
VLMプランナ
atomicタスクごと
ボトルネック特定
終了ヘッドと失敗統計
EVOLUTION（進化）
状態を復元
過去に遭遇した状態
成功判定を生成
[2] SEES：A Self-Evolving Embodied System via
LLM
オンラインRL
family adapterを更新
検証・登録
改善時のみ採用


# Page. 47

![Page Image](https://bcdn.docswell.com/page/GEWGWZLKJ2.jpg)

04.論文2：SEES (構成要素①：タスク分解とfamilyへのルーティング)
各タスクは自分の指示を持ちつつ、アダプタはfamilyで共有する
長期指示＋初期画像
左・右・手首カメラ
凍結VLMプランナ
Gemma 4 31B IT
63/64
プランナの計画が正解と完全一致
（98.44%、32タスク ×2初期状態）
[2] SEES：A Self-Evolving Embodied System via
言語エージェント
11のfamilyに振り分け
family方策
最新の登録アダプタで実行
11のskill family
開ける・閉める・家電操作・水栓・つかむ・容器に置く・
面に置く・差し込む・並べる・注ぐ／すすぐ・ナビゲーシ
ョン。アダプタがないfamilyはベースVLAで実行


# Page. 48

![Page Image](https://bcdn.docswell.com/page/47ZL51MNJ3.jpg)

04.論文2：SEES (構成要素②：familyごとのLoRAアダプタ（行動ヘッドに付
ける）
)
RoboCasa365：r=64・α=128 ／ LIBERO：r=8・α=8
W_f = W_0 + (α / r) · B_f · A_f
W_0：凍結した重み／ A_f, B_f：family f のランク r の学習可能な因子／ α：スケール
忘却を防ぐ
視覚・言語のバックボーンと
他familyのアダプタは凍結し、
更新は当該アダプタのみ
正の転移
同じfamilyのタスクが1つのア
ダプタを共有し、RLしていな
いタスクにも効く
[2] SEES：A Self-Evolving Embodied System via
一緒に保存
LoRAに加え、family固有の価値
ヘッド・終了ヘッドもチェッ
クポイントに含める


# Page. 49

![Page Image](https://bcdn.docswell.com/page/YJ6W9LN9JV.jpg)

04.論文2：SEES (構成要素③：終了ヘッドでatomicタスクの完了を予測)
著者注：この監査は複合タスク成功率の向上までは示さない
仕組み
役割
行動トークン特徴に小さなヘッド（LayerNorm＋
512次元GELU）を付けヘッドだけ学習。確率0.95
以上が3ステップ続いたら完了とし、チャンクの
残りを捨てて次へ
完了したサブタスクを止める／失敗をどの段か
に帰属させる／次のatomicタスクへ引き継ぐ
判定方法（100ロールアウト・243試
行）
Macro-F1
誤成
功
時刻誤差
失敗帰属の正解
率
終了ヘッド（SEES）
94.0
3.3
10.8
92.0
VLM（Qwen3-VL-32B）
59.9
17.7
112.6
45.0
出典：Table 5（%、時刻誤差は制御ステップ）
[2] SEES：A Self-Evolving Embodied System via


# Page. 50

![Page Image](https://bcdn.docswell.com/page/GJ5MN15DJ4.jpg)

04.論文2：SEES (ボトルネックの特定：最初に止まった段に失敗を数える)
1複合タスクにつき毎ラウンド1つ選び、予算を一番の原因に集中する
b_c = argmax_(i ∈ A_c)
F_(c,i)
F_(c,i)：複合タスク c の失敗のうち段 i に帰属したもの。継続を妨げた最初の段に割り当て、下流の段は数えない
例：Store_Leftovers_In_Bowl の失敗の帰属（Fig. 3）
place_the_drumstick_in_bowl
46.8%
navigate_to_fridge_with_bowl
pick_up_bowl
この1回の進化で
42.6%
10.6%
[2] SEES：A Self-Evolving Embodied System via
（+16pt）
対象段 56% → 72%
兄弟タスク 60.4% → 61.2%
複合タスク全体 6% → 10%


# Page. 51

![Page Image](https://bcdn.docswell.com/page/LE3W215QE5.jpg)

04.論文2：SEES ( RLタスクの構築：状態を復元し、LLMに成功判定を書かせる）
報酬は初めて成功した時点だけ1。報酬整形や学習した報酬モデルは使わない
状態の復元
ボトルネック直前のシミュレータ状態と、家電
の状態やタイマーも復元。前段の再生は不要。
成功・失敗どちらの試行の状態も使う
LLMによる成功判定
GPT-5.6-Sol が指示・物体の識別子・状態取得API
の文書から Python 関数 C_i(s) を生成。3ステップ
連続で真なら成功
公式判定との一致（Atomic-Seen 900ロールア
ウト）
フレー
ム
バラン
ス
再現
率
エピソード
LLM生成の成功判定
97.8
98.2
96.4
95.9
18タスク中13でエピソード単位の判定が完全一致（Table 6、
%）
[2] SEES：A Self-Evolving Embodied System via


# Page. 52

![Page Image](https://bcdn.docswell.com/page/8EDKZXDW7G.jpg)

04.論文2：SEES (オンラインRL：PPOでアダプタを更新し、改善時のみ登録)
RoboCasa365 では全ラウンドで改善するチェックポイントが見つかった
PPO（RLinf上）
family単位のサンプリング
チェックポイント選択
ﬂow系はデノイジング遷移の尤
度を使う。32並列環境・2GPU、
familyごと40ステップ、クリップ
0.2、
γ=0.99
今回と過去のボトルネックを
プールに入れる。重みは有効
な初期状態の数で決め、選ば
れてからのラウンドごとに半
減。毎回新しく収集
10・20・30・40ステップ目と
更新前を、各ボトルネック5状
態 ×5回で検証。改善が最大で
正のものだけ登録
Composite-Unseen は適応にもチェックポイント選択にも使わない（純粋な評価用）
[2] SEES：A Self-Evolving Embodied System via


# Page. 53

![Page Image](https://bcdn.docswell.com/page/V7PKDPXXJ8.jpg)

04.論文2：SEES (実験設定：2つのバックボーン × 2つのベンチマーク)
LIBEROは分解・終了ヘッドを使わず、適応の仕組みだけを予算を絞って検証
RoboCasa365
LIBERO
評価タスク
Atomic 18 ／ Composite-Seen 16 ／ Composite- Object・Spatial・Goal・Long 各10タスク
（1スイート＝1 family）
Unseen 16
バックボーン
GR00T N1.5、RLDX-1（Human300でSFT：65
atomic＋235複合、各100デモ）
GR00T N1.5
（RLinf公開のスイート別SFT
チェックポイント）
進化の予算
複合タスクごと50ロールアウト、familyごと
40 PPOステップ、3ラウンド
3ラウンド合計 80〜96 PPOステップ、1ラ
ウンド最大3タスク追加
評価
RoboCasa365 原論文と同じ設定
未使用の15初期状態 ×5シード＝タス
クあたり75試行
[2] SEES：A Self-Evolving Embodied System via


# Page. 54

![Page Image](https://bcdn.docswell.com/page/2JVV12L3JQ.jpg)

04.論文2：SEES (結果①：RoboCasa365 —複合タスクはラウンドごとに改善)
成功率（%）。出典：Table 1
Composite-Seen
25
23
21
19
17
15
13
11
9
7
20.4
19.9
20.4
21.8
17.6
10.2
9.5
5
ベース
実行のみ
10.4
1R
GR00T N1.5
11.3
2R
RLDX-1
13.1
3R
設定
Atomic
Seen
Unseen
GR00T ベース
47.2
10.2
3.5
GR00T 3R後
55.7
13.1
6.1
RLDX-1 ベース
66.4
20.4
6.0
RLDX-1 3R後
70.3
21.8
7.1
「実行のみ」で一時低下する理由
分解したサブタスクの多くが事前学習データに
単独では存在しない
ベース比：GR00T +8.5 / +2.9 / +2.6 pt、RLDX-1 +3.9 / +1.4 / +1.1 pt。参考：π0.5 は 39.6 / 7.1 / 1.2
（RoboCasa365原論文の値）
[2] SEES：A Self-Evolving Embodied System via


# Page. 55

![Page Image](https://bcdn.docswell.com/page/5EGL2RXYJL.jpg)

04.論文2：SEES (結果②：LIBERO — RLしていない兄弟タスクも向上)
成功率（%）。出典：Table 2。兄弟タスク＝PPOに一度も参加していないタスク
スイート
全体（前 → 後）
ボトルネック（前 → 後）
兄弟タスク（前 → 後）
Object
66.13 → 86.00
59.24 → 82.86
82.22 → 93.33
Spatial
41.33 → 50.53
40.44 → 49.78
49.33 → 57.33
Goal
43.73 → 59.47
39.11 → 56.15
85.33 → 89.33
Long
61.20 → 65.60
58.22 → 62.96
88.00 → 89.33
4スイート平均
53.10 → 65.40
—
—
全体の改善：Object +19.87 / Spatial +9.20 / Goal +15.74 / Long +4.40 pt、平均 +12.3 pt。Objectでは10タスクす
べてが向上し、未選択の3タスクも +5.33〜+20.00pt
（Table 7）
[2] SEES：A Self-Evolving Embodied System via


# Page. 56

![Page Image](https://bcdn.docswell.com/page/4JQYPV867P.jpg)

04.論文2：SEES (アブレーション①：familyで共有するか、atomicごとに分ける
か)
関連する pick-and-place 5タスク（ボトルネック3・兄弟2）、アダプタあたり40ステップ
atomic専用
成功率（%）
ボトルネック +8.0pt だが、兄弟タス
クは平均 −3.0pt（転移なし）
90
85
80.0
80
74.0
75
76.4
75.0
72.0
70.7
70
65
71.2
67.6
62.7
family共有
60
ボトルネック +11.3pt、兄弟 +5.0pt、
全体 +8.8pt
55
50
ボトルネック
RL前
兄弟タスクatomic
専用LoRA
全体
family共有LoRA
出典：Table 3。差分はRL前からの値で、表から計算
[2] SEES：A Self-Evolving Embodied System via


# Page. 57

![Page Image](https://bcdn.docswell.com/page/K74WYM2ME1.jpg)

04.論文2：SEES (アブレーション②：何を訓練するかの選び方で結果は大
きく変わる)
ScrubCuttingBoard、未使用の50シーン、2ラウンド・各40 PPOステップの同一予算（出典：Table 4）
80
70
64%
60
50
40
28%
30
20
34%
18%
10
0
選び方
1R目
2R目
成功率
ベース方策
—
—
18%（9/50）
ランダム
Release
Navigate
28%（14/50）
成功率最高
の段
Pick up
Release
34%（17/50）
ボトルネッ
ク
Scrub
Navigate
64%（32/50）
SEESのボトルネックは更新後に Scrub から Navigate へ移った。1つの複合タスク・50試行での比較のため、
一般化には注意
[2] SEES：A Self-Evolving Embodied System via


# Page. 58

![Page Image](https://bcdn.docswell.com/page/LJ1Y68MYEG.jpg)

04.論文2：SEES (限界と今後：実世界への展開が最大の課題)
左は本文に書かれている制約、右は著者が示す今後の方向
本文に書かれている制約
• 進化には状態を再現できる対話的シミ
ュレータが必要
• 全評価がシミュレーション。実機で一
連のループを回す評価は今後
• 分解を入れた直後は Composite-Seen が
一時的に低下
• 終了ヘッドの監査は、複合タスク成功
率の向上までは示さない
[2] SEES：A Self-Evolving Embodied System via
著者が示す今後の方向
• 実画像から環境を再構成する手法
（URDFormer、ACDC、
SplatSim など）
でシミュレータを作る
• ボトルネックに関係する物体と相互作
用だけ再構成すれば足りる
• バックボーンは凍結なので、候補アダ
プタを実機で事前確認してから再利用
できる


# Page. 59

![Page Image](https://bcdn.docswell.com/page/GJWGWZ3172.jpg)

04.論文2：SEES (論文2：強みと注意点（発表者の見解）
)
仕組みの完成度は高いが、実用レベルの絶対性能には距離がある
強み
どこを・どの報酬で・いつ訓練するかまで
自動化し、
2つのバックボーンで一貫して
改善。終了ヘッド・成功判定・選択方法・
アダプタ共有をそれぞれ対照実験で検証
注意点
複合タスクの絶対成功率は依然低い
RLDX-1 21.8%）
。Unseen
（GR00T 13.1%、
の改善は1〜3pt程度。LLMの成功判定は18
タスク中5タスクでエピソード判定が公式
と一部ずれる
研究的な問い
実機の失敗ログから、どこまで忠実なRL環境を自動で作れるか。成功判定の誤りがRLにど
う影響するか
[2] SEES：A Self-Evolving Embodied System via


# Page. 60

![Page Image](https://bcdn.docswell.com/page/4EZL51VX73.jpg)

05.まとめ
2論文の位置づけやまとめ


# Page. 61

![Page Image](https://bcdn.docswell.com/page/Y76W9L5P7V.jpg)

05.まとめ (論文1まとめ：CLAP の貢献)
Closed-Loop Alignment with Pressure for Precise Suction Manipulation
1
吸着状態を観測できるようにした1
数ドルのMEMS圧力センサを真空ラインに付け、カメラでは遮蔽される成否を読む
2
指令値を実測値に置き換え、視覚と融合2
固有受容の吸着欄に実測値、圧力をクエリにしたクロスアテンション
3
失敗で実行窓を打ち切る閉ループ 3
「保持なし」4ステップで中止し、新しい観測から再推論
4
逆再生デモと8.3%の区間デモ 4
精度の要る場面を正確に、中止後の状態もカバー
5
実機で平均96.67%、
4ブロック積みで15.92mm
4つのアブレーションはいずれも 5.00〜13.33pt 低下
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation


# Page. 62

![Page Image](https://bcdn.docswell.com/page/G75MN1YP74.jpg)

05.まとめ (論文2まとめ：SEES の貢献)
A Self-Evolving Embodied System via Failure-Guided VLA Policy Adaptation
1
失敗の統計でボトルネックを自動で特定
終了ヘッドで段を区切り、最初に止まった段に失敗を帰属（帰属正解率92.0%）
2
RLタスクを自動で構築2
直前の状態を復元し、LLMが成功判定を生成（公式判定と95.9%一致）
3
familyで共有するLoRAで転移
PPOに参加していない兄弟タスクも全LIBEROスイートで向上
4
2つのバックボーンで改善
GR00T N1.5・RLDX-1 とも3ラウンドで向上、Composite-Unseen も改善
5
訓練対象の選び方が効く
ボトルネック選択で64%、ランダム28%・得意な段34%
[2] SEES：A Self-Evolving Embodied System via


# Page. 63

![Page Image](https://bcdn.docswell.com/page/9J2951GZER.jpg)

05.まとめ ( 2本の論文はVLAの問題点にどう答えるか)
Part 2 で挙げた問題点との対応
問題点
CLAP（論文1）
SEES（論文2）
①長期タスク
—
失敗の多いatomicスキルを特定して集中的に改
善
②データ
逆再生と少量（8.3%）のフェーズデモで収集を
効率化
追加の専門家デモなしにシミュレーションRLで
改善
③知覚の欠落
真空圧で吸着状態を観測可能にする
—
④開ループ実行
圧力イベントで実行窓を打ち切り再推論
終了ヘッドでサブタスクの切り替えを判断
⑤精度
4ブロック積みで平均誤差15.92 mm
—
⑥汎化
—
進化に使っていない Composite-Unseen も改善
⑧評価
実機のみ（Unitree Z1）
シミュレーションのみ、実機は今後
⑦計算と安全はどちらも主題外。CLAPは制御ループの中で、SEESは学習ループの中で、失敗を検知して次に
生かす
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
[2] SEES：A Self-Evolving Embodied System via


# Page. 64

![Page Image](https://bcdn.docswell.com/page/DEY4KZVNJM.jpg)

05.まとめ (統合メッセージ：2論文から見える VLA の次の課題)
［VLA の次の課題は「失敗を見て、直す」こと。制御ループでも学習ループでも］
論文1から
観測を1つ足すだけで閉ループになる。カメラに見えない接触の成否を、安価なセン
サで直接読み、その場で動きを止めて考え直す。
論文2から
失敗の統計が、限られた訓練予算の使い道を教えてくれる。弱いスキルを選んで鍛
え、関連スキルにも効かせる。
統合して
0.13秒の制御ループと、ラウンド単位の学習ループ。両方で失敗を観測し戻す設計
が、実用のVLAに必要になる（発表者の見解）。
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
[2] SEES：A Self-Evolving Embodied System via


# Page. 65

![Page Image](https://bcdn.docswell.com/page/VJNYR3MV78.jpg)

ご清聴ありがとうございました


# Page. 66

![Page Image](https://bcdn.docswell.com/page/YE9PM9NVJ3.jpg)

Reference
[1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation
[2] SEES：A Self-Evolving Embodied System via
1
03
04


