Gemini Robotics 2: Google DeepMind le enseña a los robots a pensar y moverse como humanos
Qué es Gemini Robotics 2
Gemini Robotics 2 es el sistema de inteligencia artificial más avanzado de Google DeepMind para control robótico. No es un modelo de lenguaje que responde preguntas —es un modelo de visión, lenguaje y acción (VLA) que permite a robots humanoides completos caminar, agacharse, estirarse, manipular objetos y colaborar entre sí para resolver tareas del mundo real.
La propuesta es ambiciosa: un cerebro universal que puede instalarse en cualquier tipo de hardware robótico, desde brazos industriales hasta humanoides completos, con la fluidez y seguridad necesarias para convivir con personas.
Los tres modelos
Gemini Robotics 2 no es un solo modelo, sino un sistema articulado en torno a tres modelos especializados que trabajan en conjunto:
1. Gemini Robotics 2 (VLA)
El modelo de visión, lenguaje y acción. Convierte instrucciones visuales y de lenguaje en control motor. Es el modelo más avanzado de su tipo, capaz de controlar humanoides completos, de pies a fingertips.
| Característica | Detalle |
|---|---|
| Tipo | VLA (Vision-Language-Action) |
| Control | Humanoides completos, bi-arm robots |
| Dexteridad | Manos de 22 grados de libertad + grippers estándar |
| Balance | Control dinámico del centro de gravedad |
| Disponibilidad | Early-access partners |
El modelo puede controlar la mano de cinco dedos SharpaWave del robot Apollo 2 para completar acciones delicadas como atar nudos o sellar bolsas ziplock. También opera grippers paralelos estándar de dos dedos en plataformas Franka Duo para tareas de packing complejo.
2. Gemini Robotics ER 2 (Embodied Reasoning)
El cerebro de alto nivel. Es un modelo de visión-lenguaje (VLM) que actúa como agente: observa el entorno, planifica secuencias de múltiples pasos, se comunica con humanos y coordina con el VLA para ejecutar las acciones.
| Característica | Detalle |
|---|---|
| Tipo | VLM (Vision-Language Model) embodied reasoning |
| Función | Planificación multi-paso, comunicación humana |
| Tools externas | Google Search, Google Calendar, function calling |
| Precisión progreso | 57.4% en estimación, 91.3% en identificación de eventos clave |
| Margen error eventos | <1 segundo |
| Disponibilidad | Google AI Studio (public preview) + Gemini API + Gemini Enterprise Agent Platform (private preview) |
ER 2 permite a los robots ejecutar tareas complejas de varios minutos con cientos de decisiones, auto-corregirse si un paso falla, y generalizar a situaciones y objetivos nuevos. Ahora entiende cuándo las tareas comienzan y terminan, y puede pinpointear el momento exacto en que ocurren eventos clave.
3. Gemini Robotics On-Device 2
El modelo más eficiente, optimizado para correr localmente en el hardware del robot, sin conexión a internet.
| Característica | Detalle |
|---|---|
| Tipo | VLA optimizado para edge |
| Adaptación | Nuevos robots en horas, con <200 ejemplos |
| Multi-embodiment | Nativamente compatible con diferentes formas, sensores y grados de libertad |
| Plataformas demostradas | Dexmate, SO101, Trossen |
| Disponibilidad | Trusted testers / early-access partners |
Esto es crítico para entornos donde la latencia o la privacidad son importantes: fábricas, hogares, dispositivos conectados. El robot puede pensar y actuar al mismo tiempo, eliminando las pausas que hasta ahora eran habituales en sistemas similares.
Whole-body intelligence: de pies a fingertips
El salto más grande respecto a la generación anterior es el control de cuerpo completo. Mientras los modelos previos controlaban solo el torso superior para tareas de mesa, Gemini Robotics 2 expande la IA física a movimientos de todo el cuerpo.
Ejemplo demostrado con el robot Apollo 2 de Apptronik:
- Instrucción: "Pon la regadera en el contenedor verde del estante inferior"
- Apollo procesa la instrucción
- Camina hacia la mesa
- Toma la regadera
- Dar unos pasos hacia los estantes
- La coloca precisamente en su destino
Esto requiere coordinación de cuerpo completo: balance dinámico del centro de gravedad, locomoción, manipulación y razonamiento espacial simultáneos.
Colaboración multi-robot
Gemini Robotics ER 2 introduce multi-robot collaboration: diferentes tipos de robots pueden comunicarse y trabajar juntos para resolver workflows que un solo robot no podría.
- Los robots se reconocen entre sí y identifican sus capacidades físicas únicas
- Delegan tareas autónomamente según las fortalezas de cada uno
- Coordinan acciones en espacios compartidos
- Ejemplo: un humanoide y un bi-arm robot limpian una habitación desordenada juntos, dividiendo el trabajo
Seguridad: ASIMOV-Agentic
DeepMind introdujo ASIMOV-Agentic, un nuevo benchmark para orquestación de seguridad agéntica y resolución de incertidumbre. Mide:
- Capacidad del reasoning agent para rechazar tool calls inseguros del VLA
- Capacidad de predecir si una tarea es posible
- Capacidad de solicitar intervención humana proactivamente cuando hay incertidumbre
Gemini Robotics ER 2 es el modelo robótico más seguro hasta la fecha de DeepMind en:
- Seguimiento de restricciones de seguridad
- Benchmarks de proximidad humana
- Detección de humanos cercanos → trigger de safety tool calls → parada segura
En las demostraciones, el sistema detuvo automáticamente el movimiento de un humanoide al detectar a un humano en su área de trabajo, y reanudó la actividad cuando la zona quedó despejada.
Adaptación a hardware nuevo
La adaptación rápida es una de las features más impresionantes. Gemini Robotics On-Device 2 puede adaptarse a un robot completamente nuevo en solo unas horas, con:
- Menos de 200 ejemplos de entrenamiento
- Funciona con embodiments de formas, sensores y grados de libertad drásticamente diferentes
- Plataformas demostradas: Dexmate, SO101, Trossen
Esto hereda las técnicas de "motion transfer" de Gemini Robotics 1.5, pero ahora es significativamente más rápido y generalizable.
Disponibilidad y acceso
| Modelo | Estado | Dónde acceder |
|---|---|---|
| Gemini Robotics ER 2 | Public preview | Google AI Studio, Gemini API |
| Gemini Robotics ER 2 | Private preview | Gemini Enterprise Agent Platform |
| Gemini Robotics 2 (VLA) | Early-access | Socios con acceso anticipado |
| Gemini Robotics On-Device 2 | Trusted testers | Programa de testers de confianza |
ER 2 soporta tool use: Search, function calling, code execution, structured output, URL context. También tiene Live API (text out only).
Tareas demostradas
- Atar nudos con manos de 22 grados de libertad
- Sellar bolsas ziplock
- Desenroscar bombillas
- Packing ajustado de objetos
- Limpiar habitaciones desordenadas (humanoides caminando, agachándose, tomando objetos)
- Colaboración multi-robot para completar tareas compartidas
- Parada de seguridad automática al detectar humanos cercanos
Tasas de acierto superiores al 90% en tareas de precisión.
El camino hacia AGI físico
DeepMind posiciona Gemini Robotics 2 como un hito importante en el camino hacia AGI en el mundo físico. La visión es moverse de la automatización de tareas únicas hacia inteligencia de propósito general que pueda:
- Trabajar junto a humanos en fábricas, logística y hogares
- Adaptarse a cualquier hardware robótico
- Razonar sobre el entorno físico y planificar múltiples pasos
- Colaborar con otros robots y con humanos de forma segura
Como señala DeepMind: "Resolver AGI en el mundo físico requiere ir más allá de la automatización de tareas únicas hacia inteligencia de propósito general."
Comparación con la generación anterior
| Feature | Gemini Robotics 1.5 | Gemini Robotics 2 |
|---|---|---|
| Control del cuerpo | Torso superior (tabletop) | Cuerpo completo (feet to fingertips) |
| Locomoción | ❌ | ✅ Caminar, agacharse, estirarse |
| Dexteridad | Grippers básicos | Manos 22-DoF + grippers, atar nudos |
| Multi-robot | ❌ | ✅ Colaboración autónoma |
| Razonamiento | ER 1.6 | ER 2 (multi-paso, cientos de decisiones) |
| Adaptación on-device | Motion transfer inicial | <200 ejemplos, horas |
| Seguridad | Básica | ASIMOV-Agentic, parada automática |
| Tools externas | Limitadas | Google Search, Calendar, function calling |
Implicaciones para la industria
Gemini Robotics 2 tiene el potencial de acelerar la adopción de robots en sectores clave:
- Logística: robots que caminan por almacenes, toman objetos de estantes, los empaquetan
- Manufactura: colaboración humano-robot en líneas de ensamblaje con seguridad garantizada
- Hogar: robots que limpian, organizan, realizan tareas domésticas con destreza humana
- Healthcare: asistencia en tareas físicas con detección de proximidad humana
La combinación de razonamiento continuo, comprensión del entorno, planificación multi-paso, colaboración entre robots e integración con tools externas sitúa a Gemini Robotics 2 como uno de los desarrollos más avanzados de DeepMind hasta la fecha.
Conclusión
Gemini Robotics 2 representa un salto cualitativo en robótica de IA. El control de cuerpo completo, la dexteridad a nivel humano, la colaboración multi-robot y la adaptación rápida a hardware nuevo resuelven problemas que limitaban la utilidad real de los robots anteriores. Y lo hace con un framework de seguridad —ASIMOV-Agentic— que reconoce que la seguridad en robótica no es solo física, sino también agéntica: el reasoning agent debe poder rechazar instrucciones inseguras del VLA.
Para Google, esto es parte de una estrategia más amplia: ser la plataforma de IA física que potencia cualquier robot, de cualquier fabricante. No están construyendo robots —están construyendo el cerebro que los controla. Si logran establecer ese estándar, Gemini Robotics podría ser para la robótica lo que Android fue para los móviles.