DeepMind amplía su propuesta en robótica
Google DeepMind ha presentado Gemini Robotics 2, planteándolo como un paso más allá de los sistemas robóticos limitados a brazos o a la manipulación sobre mesa y hacia una autonomía más amplia de todo el cuerpo. Según The Robot Report, el modelo actualizado de visión, lenguaje y acción añade control inteligente de todo el cuerpo, mayor destreza y soporte para que varios robots trabajen juntos.
El anuncio importa porque apunta a una brecha persistente en robótica. Muchos sistemas pueden realizar tareas de manipulación cuidadosamente orquestadas en entornos restringidos, pero son muchos menos los que pueden combinar percepción, comprensión del lenguaje y movimiento coordinado a lo largo de todo un cuerpo humanoide. La afirmación de DeepMind es que Gemini Robotics 2 se acerca más a ese umbral al permitir que los robots razonen sobre movimientos como caminar, agacharse, estirarse y manipular objetos como parte de una sola tarea.
Eso no significa que ya hayan llegado los humanoides de propósito general. El informe señala con cautela que la velocidad de movimiento aún necesita mejorar. Pero presenta este lanzamiento como un paso importante para convertir la IA multimodal de una capa de demostración sobre mesa en un controlador para trabajos físicos más realistas.
De demostraciones de la parte superior del cuerpo a la acción de todo el cuerpo
Los modelos anteriores de DeepMind se centraban en el control de la parte superior del cuerpo para tareas sobre mesa. Gemini Robotics 2, en cambio, se describe como capaz de gestionar todo el cuerpo del robot. The Robot Report dice que el sistema puede traducir la intención del usuario en un movimiento coordinado de todo el cuerpo, permitiendo que un humanoide navegue por el espacio y complete tareas que implican tanto locomoción como manipulación.
Un ejemplo del informe utiliza al robot humanoide Apollo 2 de Apptronik. Cuando se le indica que coloque una regadera en un contenedor verde de una estantería baja, se dice que el robot interpreta la petición, camina hasta una mesa, recoge el objeto, cruza la habitación y lo coloca en la ubicación objetivo. Esa secuencia es notable no porque algún paso aislado sea inédito, sino porque combina una instrucción en lenguaje natural, manipulación de objetos, caminata y colocación precisa en un solo comportamiento continuo.
Si esas capacidades resultan robustas fuera de demostraciones controladas, supondrían una expansión práctica de lo que pueden intentar las plataformas humanoides. Los almacenes, laboratorios y entornos de servicios suelen requerir precisamente esa mezcla de movilidad y manipulación, y no solo movimientos aislados de un brazo en una estación fija.
La destreza y la colaboración son las otras grandes novedades
DeepMind también está enfatizando un control motor más fino. The Robot Report dice que Gemini Robotics 2 puede controlar la mano SharpaWave de cinco dedos y 22 grados de libertad del Apollo 2. Eso sugiere que la empresa no solo está trabajando en el movimiento grueso, sino también en los comportamientos más delicados de dedos y manos necesarios para un agarre y una colocación útiles.
La destreza sigue siendo una de las partes más difíciles de la robótica del mundo real. Un robot que puede cruzar una sala sigue teniendo un valor limitado si no puede agarrar con fiabilidad objetos mixtos, orientarlos correctamente e interactuar con entornos desordenados. Al destacar el control avanzado de la mano, DeepMind señala que quiere que su pila de robótica cubra más del problema de la manipulación, no solo la navegación y la interpretación del lenguaje.
La compañía también introduce la colaboración entre varios robots. El informe dice que Gemini Robotics ER 2, un modelo de razonamiento encarnado construido como un agente de modelo de visión y lenguaje, está diseñado para ayudar a los robots a comunicarse con personas, entender el mundo físico y planificar tareas de varios pasos que duran varios minutos. DeepMind presenta esa capa de razonamiento como la base para equipos de robots que trabajan juntos en un trabajo en lugar de actuar como máquinas aisladas.
Ese punto es estratégicamente importante. En la automatización industrial, el valor de un sistema robótico suele depender de la orquestación entre varias máquinas y flujos de trabajo. Si los modelos de IA pueden coordinar traspasos o dividir el trabajo entre robots, la economía de despliegue podría inclinarse hacia una automatización más flexible.
La ejecución en el dispositivo podría ampliar el despliegue
Otro elemento destacable es la ejecución local. The Robot Report dice que Gemini Robotics 2 puede ejecutarse en el dispositivo y adaptarse a cuerpos robóticos completamente nuevos en cuestión de horas. DeepMind ha presentado por separado Gemini Robotics On-Device 2, que según la compañía está optimizado para ejecutarse localmente en hardware robótico y puede adaptarse a nuevas encarnaciones con unas pocas horas de datos.
Esa afirmación aborda dos restricciones reales del despliegue en robótica. Primero, la dependencia de la nube puede añadir latencia, problemas de fiabilidad y complejidad operativa. Segundo, los desarrolladores de robótica no quieren reentrenar un sistema desde cero para cada plataforma nueva. Un modelo que pueda redirigirse rápidamente a diferentes encarnaciones sería más atractivo para los fabricantes de hardware y los clientes empresariales que intentan acortar los ciclos de integración.
Sin embargo, la disponibilidad sigue siendo limitada. The Robot Report dice que Gemini Robotics ER 2 está disponible en Google AI Studio y en vista previa privada en la Gemini Enterprise Agent Platform, mientras que los modelos VLA y on-device se están ofreciendo a socios de acceso anticipado. Eso significa que el anuncio sigue más cerca de un despliegue controlado que de un lanzamiento amplio de producto.
Lo que el lanzamiento señala para la IA física
El mensaje más amplio es que las grandes empresas de IA están entrando con más fuerza en los sistemas físicos, no solo en los asistentes digitales. El enfoque de DeepMind sugiere que ve la robótica como el siguiente terreno en el que los modelos multimodales deben demostrar que pueden conectar comprensión y acción. El lenguaje, la visión y la planificación son útiles, pero en robótica solo importan si producen movimiento fiable en espacios reales y desordenados.
Gemini Robotics 2 no resuelve si los humanoides serán el factor de forma ganador, ni demuestra que el control al estilo de modelos fundacionales haya resuelto el problema de fiabilidad. Pero sí indica hacia dónde se dirige el campo: hacia modelos que puedan generalizar entre distintos cuerpos robóticos, ejecutarse localmente, usar tanto locomoción como destreza y coordinarse con otros robots en tareas de varios pasos.
Por qué importa
- El lanzamiento amplía el control de IA desde la manipulación sobre mesa al movimiento de todo el cuerpo.
- DeepMind combina locomoción con control diestro de las manos, un requisito clave para el trabajo práctico.
- La operación en el dispositivo y una adaptación más rápida podrían reducir barreras de integración para nuevo hardware.
- La colaboración entre varios robots apunta a sistemas de automatización más amplios, no a máquinas de propósito único.
La prueba inmediata será si los socios de acceso anticipado pueden reproducir estas capacidades fuera de escenarios de exhibición. Si pueden, Gemini Robotics 2 podría convertirse en un hito importante en la transición desde demostraciones de IA multimodal hacia una automatización física más capaz.
Este artículo se basa en la cobertura de The Robot Report. Leer el artículo original.
Originally published on therobotreport.com

