Skip to content

필사 모드: Gemini Robotics 2とロボット基盤モデル — 全身制御が実際に変えるもの

日本語
0%
정확도 0%
💡 왼쪽 원문을 읽으면서 오른쪽에 따라 써보세요. Tab 키로 힌트를 받을 수 있습니다.

はじめに — 7月30日、電球を緩めるのに92パーセント、締めるのに36パーセント

2026年7月30日、Google DeepMindがGemini Robotics 2を公開しました。前世代が主に上半身とテーブル上の作業にとどまっていたのに対し、今回は歩き、かがみ、手を伸ばし、物を扱う動作まで — ヒューマノイド全体を一つのポリシーが制御するというのが核心の主張です。

発表資料で最も注目に値するのはデモ映像ではなく表です。Apptronik Apollo 2にSharpaWave多指ハンドを付けた構成で、電球を緩める成功率は92%なのに締める成功率は36%です。同じ手、同じ電球、同じソケットで、方向だけが逆です。ゴミ袋を縛るのは44%、ジップ付き袋の密封は40%、ちりとりの使用は32%。

この非対称性がこの分野の現状を要約しています。緩める動作は大抵一方向に力を入れれば済み、誤差が蓄積しません。締める動作はねじ山を合わせ、抵抗を感知し、空回りすれば戻してまた合わせる必要があります。接触が絡んだ瞬間、難度が段階的に上がります。

この記事は発表された数字をそのまま読みつつ、何が測定値で何が映像で、どこまでが検証済みかを分けて見ます。

ビジョン・ランゲージ・アクションモデルとは何か

従来のロボットソフトウェアスタックは層に分かれていました。認識(カメラ画像から物体と姿勢を推定)、計画(目標姿勢までの経路生成)、制御(経路を関節トルクに変換)。各層は別々に開発され別々にチューニングされ、層同士のインターフェースは人間が設計した表現 — 物体の6自由度姿勢、経由点のリスト、関節軌道 — でした。

VLAはこの層を一つのネットワークに畳み込みます。入力はカメラ画像群と自然言語指示と固有受容感覚(関節角度、力センサー)、出力は次の時点の行動チャンクです。中間の明示的な表現が消えます。「じょうろ」という概念がどこかに6自由度姿勢として存在する代わりに、重みの中に分散しています。

この構造の利点はインターフェースの損失がないことです。認識が物体を円柱として近似しながら捨てた情報を制御が後で必要とすることがなくなります。そして言語が入力なので、新しいタスクをコードではなく文で指定できます。

欠点も同じ場所から出てきます。失敗したとき、どの層が間違えたか分かりません。物体を見損なったのか、掴む姿勢を間違えたのか、力を間違えたのかが、一つの数字(成功・失敗)としてしか観測されません。この観測可能性の問題は後で改めて扱います。

今回の発表はモデルを三つに分けました。

  • Gemini Robotics 2 — VLA本体。ビジョンと言語をモーター制御に変換し、ヒューマノイドの全身と両腕ロボットを制御します。
  • Gemini Robotics ER 2 — 身体化推論モデル。上位計画を担う「脳」の役割で、複数段階のタスクを計画し、人間と対話し、複数ロボットの協調を調整します。MarkTechPostの技術まとめによればGemini 3.5 Flashベースで、128kコンテキストに最大64Kトークンを出力します。
  • Gemini Robotics On-Device 2 — ロボットのハードウェア上でローカルに動く軽量VLA。Gemini Robotics 1.5とGemma系列の上に構築されています。

この分割は実務上意味があります。計画はクラウドで秒単位で動いてもよいですが、制御はロボット上でミリ秒単位で動かねばなりません。ネットワークが切れたとき計画は止まってもよいですが、制御は止まってはいけません。

全身制御が実際に難しい理由

「もう脚も制御する」という一文は過小評価されがちです。上半身操作から全身制御へ移るとき、問題の性質が変わります。

ベースがもう固定されません。 テーブル上の両腕ロボットではグリッパーの位置誤差は腕の関節誤差の合計です。ヒューマノイドではこれに足と床の接触、胴体の姿勢、重心移動が加わります。じょうろを掴もうと腕を伸ばす動作自体が重心を動かし、その反作用を脚が吸収しなければなりません。つまり腕への命令が脚の制御問題になります。

自由度が増えるとデータ要求量が非線形に増えます。 両腕14自由度からヒューマノイド30〜40自由度へ行くと、探索空間が爆発します。DeepMindが公開したOn-Device 2のモデルカードもこの点を限界として明示しています — このモデルは「分布外タスクへの汎化と高自由度ロボットの制御に限界がある」と書かれており、評価は主に立位の両腕操作タスクで行われ、移動プラットフォームや全身制御のリスクは現行の評価範囲外だと明かしています(モデルカード)。

失敗のコストが違います。 テーブル上で失敗すれば物が落ちます。人間サイズのロボットが歩行中に失敗すれば転倒します。安全余裕を大きく取れば成功率が下がり、減らせば危険になります。発表された成功率を見るとき、このトレードオフがどこに設定されていたかは公開されていません。

発表された数字をそのまま読む

DeepMindの発表とMarkTechPostのまとめで確認できる数値を訳すとこうなります。

評価軸ロボットと手タスク報告された成功率
全身操作Apollo 2 + Inspireハンド棚から拾う76.3%
全身操作Apollo 2 + Inspireハンドテーブルから拾う68.4%
全身操作Apollo 2 + Inspireハンド床から拾う45.7%
多指の器用さApollo 2 + SharpaWaveハンド電球を緩める92%
多指の器用さApollo 2 + SharpaWaveハンドゴミ袋を縛る44%
多指の器用さApollo 2 + SharpaWaveハンドジップ袋を密封40%
多指の器用さApollo 2 + SharpaWaveハンド電球を締める36%
多指の器用さApollo 2 + SharpaWaveハンドちりとりを使う32%
グリッパーFranka Duo + Robotiq精密挿入89.6%
グリッパーFranka Duo + Robotiqツールキッティング78.9%
グリッパーFranka Duo + Robotiq一般的なピックアンドプレース74.2%

読み方をいくつか付けます。

第一に、床から拾うのが45.7%であることが全身制御の実際の状態です。 棚(76.3%)とテーブル(68.4%)は胴体を大きく曲げなくてよいですが、床は姿勢転換とバランス維持が同時に求められます。三つの数字の順序がこの仮説と正確に一致します。

第二に、グリッパーの精密挿入が89.6%なのに多指ハンドの電球締めが36%であることが器用さの現実です。平行グリッパーは自由度が低く制御が容易で、挿入は治具の役割をする穴が誤差を吸収してくれます。多指ハンドは接触点が多く、各指の力配分が結果を左右します。発表資料も多指操作が依然として難しいと明示しています。

第三に、試行回数が公開されていません。 92%が25回中23回なのか200回中184回なのかによって信頼区間はまったく変わります。成功判定の基準も公開されていません — 電球が点灯すれば成功なのか、ねじ山に噛み合うだけで成功なのか。私がアクセスできた資料の範囲では両方とも見つけられませんでした。

ER 2側の数字も一緒に公開されました。五段階の進捗分類精度57.4%、特定の瞬間を見つける精度91.3%に平均絶対誤差0.96秒、ツールオーケストレーションは三つの制御モード(実機VLA、シミュレーションVLA、人間の遠隔操作)全てでER 1.6を上回りました。進捗分類が57.4%だということは、「今タスクがどこまで進んでいるか」を判断する能力がまだ半分程度だということで、これは自律復旧に直結する能力です。

身体間の汎化 — 本当に難しい部分

ロボット基盤モデルが言語モデルと決定的に違う点がここです。テキストはトークン一つの意味がどこでも同じですが、ロボットの行動空間は身体ごとに違います。関節数、リンクの長さ、トルク限界、カメラ位置、グリッパーの種類が全部違うため、一つのロボットで学習した「行動」を別のロボットへそのまま移せません。

On-Device 2が主張しているのがまさにこの部分です — 新しい両腕の身体に数時間、大抵200例未満で適応するというものです。事後学習段階でのみ導入した新規プラットフォームでの数値が一緒に公開されました。

  • SO101: 適応前6.7%から適応後53.3%。前世代(On-Device 1)は0.0%から6.7%。
  • Dexmate: 適応前24.4%から適応後75.6%。前世代は13.3%から33.3%。

この数字をどう見るか。絶対的な性能(53.3%、75.6%)はプロダクションで使えるレベルではありません。しかし比較対象は前世代であり、同じ条件で6.7%が53.3%に上がったのはサンプル効率の改善として読むのが妥当です。つまりこれは「優れている」という主張ではなく、「少ないデータで速く上がる」という主張です。

注意すべき点が一つあります。両プラットフォームとも両腕ロボットです。モデルカードが明示する通りこのモデルは高自由度ロボット制御に限界があり、立位の両腕操作を中心に評価されました。したがってこの適応速度がヒューマノイド全身にも及ぶという根拠は公開資料にありません。

複数ロボットの協調も同じ観点で見る必要があります。Apollo 2とFranka F3 Duoという異なる種類のロボットが、共有された意味理解を通じてサブタスクをやり取りする実演がありました。概念的に重要な結果です — 協調のインターフェースがハードウェアプロトコルではなく言語なら、ロボットを混ぜて使うコストが大きく下がります。ただしこれは実演であり、成功率の数値は別途付いていません。

ロボティクスにおける評価とは何か

言語モデル側から来た人がロボティクスの結果を見るとき最も戸惑うのが評価です。三つを押さえておくと読みやすくなります。

成功率は定義が論文ごとに違います。 何回試行したか、初期物体配置を毎回変えたか、失敗後の再試行を許したか、途中で人間が介入したか、成功判定を人間がしたか自動でしたかが全部違います。同じタスク名の下にまったく違う実験が入っている可能性があります。

未学習タスクの定義も違います。 学習データになかった物体か、なかった配置か、なかった指示文か、なかった動作かによって難度が違います。一般的に場面汎化(新しい物体・背景)、指示汎化(新しい文)、行動汎化(新しい動作)の順に難しくなりますが、論文がどの軸を見たか明かさなければ比較は不可能です。On-Deviceモデルカードはこの三軸を評価したと明かしていますが、軸別の数値は公開していません。

シミュレーション・実物格差が残っています。 シミュレーターは剛体接触を近似し、摩擦とすべりと変形は依然としてよく合いません。だから接触の多いタスク — 衣類の扱い、ケーブルの整理、粘性液体の注ぎ — でシミュレーション性能と実物性能の差が最も大きくなります。今回の発表資料でsim-to-realについての明示的な記述は、私が確認した範囲では見つかりませんでした。ただしOn-Device評価が「シミュレーションと実ロボットのベンチマーク両方」で行われたとだけ書かれています。

発表された成功率一つを信頼区間とともに読むには、最低限これくらいが一緒に公開される必要があります。今この分野でこれを全部公開する発表はまれです。

task            "電球を締める"
embodiment      Apollo 2 + SharpaWaveハンド + ソケット治具バージョン
n_trials        試行回数。これがなければ92%と36%の差も解釈できない。
success_def     成功判定の基準。「ねじ山が噛み合う」なのか「点灯する」なのか。
judged_by       人間か自動判定か。人間なら何人で合意はどうしたか。
init_conditions 毎回の試行で初期配置をランダム化したか。
retries         失敗後の再試行を許したか。許したなら成功率の定義が変わる。
human_in_loop   人間の介入(リセット除く)があったか。
seen_in_train   このタスクと物体が学習データにあったか。
safety_margin   速度と力の制限をどこに置いたか。余裕を減らせば成功率は上がる。

そして根本的に、ロボティクスには共用ベンチマークがありません。言語モデルの複数の標準評価のように誰もが同じ条件で回す基準線が存在せず、論文ごとにタスクセットもカメラ配置もロボットも少しずつ違います。この断片化がチェリーピッキングを生む構造的条件です。

何がチェリーピッキングで何が測定値か

正直に区別してみます。

測定値として見られるもの: 上の表の成功率群、On-Device 2の適応前後の数値、ER 2の進捗分類・瞬間発見の数値。これらは数字として提示され、タスクが明示されています。ただし試行回数と判定基準がないため信頼区間は計算できません。

演出として見るべきもの: ゴミ片付け、じょうろ運び、ブームボックスへのテープ挿入、電球交換、ゴミ袋を縛る映像。Googleはこれを「完全自律」動作の「リアルタイム映像」だと明かしています。Engadgetは報道で、これらのロボットが映像内のすべてのタスクについて人間の遠隔操作、映像例、シミュレーションで具体的に訓練を受けたことを指摘し、汎用機器ではないと明言しています。同記事は筆者が「こうしたものにかなり懐疑的」だと明かし、AIが間違える可能性があり、人間サイズの重いロボットではそれが致命的になり得ると指摘しています。

第三者検証を経たもの: ありません。私が確認した範囲では、Gemini Robotics 2のどの数値も独立した機関が再現または検証していません。ハードウェア(Apollo 2、Franka Duo)もモデルも外部から自由にアクセスできないため、構造的に再現が難しいです。ER 2はGoogle AI StudioとGemini Enterprise Agent Platformの非公開プレビューとして提供され、VLAとオンデバイスモデルは初期アクセスパートナーにのみ開かれています。

安全面には検証可能な部分が一つあります。ASIMOV-Agenticという安全ベンチマークがHugging FaceにCC-BY-4.0で公開され、別途安全技術報告書があります。DeepMindはER 2が安全制約の遵守と人間近接のベンチマークで自社史上最も安全なロボティクスモデルだと明かしています。ベンチマークが公開されたということは、少なくとも外部で同じ尺度で別のモデルを測り直せるということで、これは意味のある違いです。

正直に言うと、発表資料が36%や32%のような低い数字をそのまま表に入れたこと自体が、この分野ではまれな態度です。成功率を選んで見せるのがあまりにも簡単な領域ですから。だからといって検証されたわけではありませんが、読む人が何ができていないかを知れるようにはしてあります。

おわりに — 残る問題はデータではなく失敗の観測可能性

この発表が実際に変えるのは三つだと思います。移動と操作が一つのポリシーの中に入り、新しい身体への適応コストが数時間単位まで下がり、異なる種類のロボットが言語をインターフェースにして協調できることが実演されました。三つとも方向は正しいです。

変わらなかったのはこうです。

  • 接触が絡んだ瞬間、成功率が崩れます。 電球を緩めることと締めることの間の56パーセントポイントの差がその要約です。これはデータを増やせば解ける問題なのか、それとも触覚センシングとインピーダンス制御側の問題なのかはまだ決まっていません。
  • 失敗をデバッグする方法がありません。 VLAは認識・計画・制御を一つに畳み込み、その代償として失敗の原因を層に分解できなくなりました。ER 2の進捗分類精度が57.4%だということは、ロボットが自ら「今うまくいっていない」を判断する能力がまだ半分程度だということで、自律復旧はその上に載らなければなりません。
  • 評価が断片化しています。 共用ベンチマークがない限り、発表された成功率はベンダー間の比較には使えません。試行回数と判定基準を一緒に公開する慣行が定着するまでは、表の数字は同じチームの前バージョンと比較するときにのみ意味を持ちます。

ロボット基盤モデルは今、言語モデルが2020年頃にいた場所に近いように見えます。能力の曲線は明らかに上を向いていますが、その曲線を誰もが同じ物差しで測る方法はまだありません。

현재 단락 (1/71)

2026年7月30日、Google DeepMindが[Gemini Robotics 2](https://deepmind.google/blog/gemini-robotics-2-brings...

작성 글자: 0원문 글자: 7,364작성 단락: 0/71