Llega Gemini Robotics 2 que permite que los robots controlen todo su cuerpo con IA
Esto se realiza al mismo tiempo que se toma la decisión de lo que el robot tiene que hacer, lo que supone un gran avance tecnológico.
Google DeepMind ha presentado Gemini Robotics 2, una nueva versión de su plataforma de inteligencia artificial destinada a los robots y que supone un paso importante salto evolutivo. La gran novedad es que este desarrollo ya no se limita a controlar brazos y manos robóticas, sino que introduce un sistema de control inteligente de todo el cuerpo que permite ejecutar tareas físicas mucho más complejas de forma autónoma.
Una evolución robótica muy importante
Para demostrar sus capacidades, la compañía ha compartido un vídeo en el que varios robots realizan acciones cotidianas que requieren coordinación, precisión y comprensión del entorno. Entre las tareas en cuestión aparecen desde enroscar una bombilla hasta cerrar una bolsa de basura. También se pueden ver robots humanoides capaces de recoger residuos o manipular una regadera.
La evolución respecto a la generación anterior es muy clara. El sistema Gemini Robotics original era capaz de gestionar acciones delicadas mediante brazos robóticos y manos especializadas (como realizar figuras de origami). Sin embargo, Gemini Robotics 2 amplía esas opciones gracias a un trabajo centrado en el movimiento coordinado de todo el cuerpo del robot. Algo que, hasta la fecha, la firma norteamericana no había conseguido con efectividad.
Según Google DeepMind, las imágenes compartidas corresponden a grabaciones en tiempo real de robots completamente autónomos. La compañía recalca este aspecto, porque en el sector de la robótica existe un intenso debate sobre el grado de autonomía real de algunas demostraciones públicas. En este sentido, la presentación de funciones de los robots Optimus de Tesla donde se acabó conociendo el uso de teleoperadores para controlar determinados movimientos.
Claves de Gemini Robotics 2
Estas residen en la combinación de varios modelos de inteligencia artificial que trabajan en paralelo. Esto permite que el robot disponga de una comprensión multimodal de lo que sucede a su alrededor y pueda adaptar sus movimientos a cada situación. Los utilizados por Google son los siguientes:
- Un modelo de visión y lenguaje encargado de interpretar el entorno.
- Dos modelos de visión, lenguaje y acción destinados al control de los movimientos corporales y de las manos.
Gracias a esta arquitectura, los robots pueden analizar información visual, comprender instrucciones y ejecutar acciones de forma coordinada y en el momento. Es importante indicar que estos robots por ahora no son máquinas de propósito general capaces de realizar cualquier actividad imaginable. Google DeepMind explica que el modelo fue entrenado específicamente para ejecutar todas las tareas mostradas en el vídeo. Para lograrlo se utilizaron distintos métodos de aprendizaje, incluyendo teleoperación humana, ejemplos en vídeo y entornos de simulación.
Lo que se espera en el futuro
El objetivo a largo plazo va mucho más allá de las demostraciones actuales. La compañía considera que este avance representa otro hito dentro de su camino hacia lo que denomina AGI física, un concepto que busca desarrollar robots capaces de realizar cualquier tarea que pueda ejecutar una persona. Aun así, los responsables del proyecto reconocen que todavía existen numerosos desafíos antes de alcanzar una meta de ese nivel.
Uno de los aspectos más delicados es la seguridad. Los errores de una inteligencia artificial pueden resultar incómodos cuando se producen durante una búsqueda de información, pero las consecuencias son potencialmente mucho más graves cuando la IA controla un robot de tamaño similar al de un ser humano y con capacidad para manipular objetos físicos. Para reducir ese riesgo, Google afirma que está aplicando un enfoque de seguridad basado en varias capas. Cada uno de los modelos de Gemini incorpora mecanismos de protección destinados a evitar comportamientos indeseados.
Pese al interés que despierta Gemini Robotics 2, la tecnología claramente está en una fase temprana de desarrollo. Google no tiene previsto lanzar robots para consumidores a corto plazo, ni mucho menos. El trabajo actual está centrado en seguir perfeccionando las capacidades físicas y cognitivas de estos sistemas antes de contemplar una adopción más amplia.
Lo que sí queda claro es que Gemini está ampliando rápidamente sus horizontes. Tras consolidarse como una de las familias de modelos de inteligencia artificial más relevantes de Google, ahora también se convierte en el cerebro que aspira a coordinar el movimiento completo de robots capaces de interactuar con el mundo físico de una forma cada vez más avanzada.