- Published on
2026년 7월 30일 Google DeepMind가 Gemini Robotics 2를 공개하면서 휴머노이드의 발끝부터 손끝까지를 하나의 비전-언어-행동 모델로 제어한다고 발표했습니다. 함께 공개된 숫자는 흥미롭게도 자랑이 아니라 현재 상태의 정직한 기록에 가깝습니다 — 전구를 푸는 데 92퍼센트, 끼우는 데 36퍼센트, 바닥에서 물건을 집는 데 45.7퍼센트. 이 글은 VLA가 실제로 무엇인지, 전신 제어가 왜 상체 조작보다 어려운지, 임바디먼트 간 일반화가 왜 진짜 병목인지, 그리고 로보틱스에서 성공률이라는 숫자를 어떻게 읽어야 하는지를 정리합니다. 어떤 결과가 데모 영상이고 어떤 것이 측정치이며, 어느 것도 아직 제3자 검증을 거치지 않았다는 점을 분명히 표시합니다.