Google amplía su pila de robótica con un modelo de control más amplio

Google DeepMind ha presentado Gemini Robotics 2, un nuevo modelo de visión, lenguaje y acción que, según la compañía, puede servir como una capa de control común para tipos de robots muy distintos. Según el anuncio descrito en el material de origen, el modelo está pensado para funcionar en sistemas que van desde brazos de sobremesa hasta robots humanoides de cuerpo completo, ampliando el esfuerzo de Google por convertir grandes modelos multimodales en software capaz de operar en el mundo físico.

El lanzamiento importa porque los desarrolladores de robótica se han enfrentado durante mucho tiempo a un problema de fragmentación. Los modelos que funcionan bien en un tipo de máquina o tarea a menudo necesitan una adaptación considerable antes de poder manejar una arquitectura corporal distinta, una configuración de sensores diferente o un entorno nuevo. DeepMind presenta Gemini Robotics 2 como un paso hacia una base más general: una familia de modelos capaz de interpretar imágenes, procesar lenguaje y traducir esas entradas en acciones en una gama más amplia de hardware.

Ese posicionamiento es importante incluso más allá de la afirmación técnica. En términos prácticos, una “capa de inteligencia” para robots sugiere un mercado en el que el software central de percepción, razonamiento y control puede reutilizarse en muchas plataformas, mientras que los fabricantes de hardware se diferencian por la mecánica, la fiabilidad, el coste y la implantación. Si ese enfoque se sostiene en pruebas del mundo real, podría reducir la barrera para construir robots adaptativos para logística, manipulación industrial, investigación y aplicaciones de servicios.

Lo que DeepMind dice que puede hacer el nuevo modelo

El texto de origen describe Gemini Robotics 2 como el modelo de visión, lenguaje y acción más avanzado de DeepMind hasta la fecha. Los sistemas de visión, lenguaje y acción combinan comprensión visual, interpretación del lenguaje natural y control motor, lo que permite a un robot conectar lo que ve con lo que se le pide hacer y luego ejecutar una respuesta física.

DeepMind afirma que el nuevo modelo puede gestionar movimientos de cuerpo completo, realizar tareas de motricidad fina y coordinar múltiples robots. Son tres exigencias muy distintas. El movimiento de todo el cuerpo requiere una planificación espacial más amplia y control relacionado con el equilibrio. El trabajo de motricidad fina depende de una manipulación más precisa. La coordinación entre varios robots introduce complejidad de tiempos y de tareas compartidas. Integrar esas capacidades en una sola plataforma es central para el argumento de la compañía de que Gemini Robotics 2 no es solo una mejora incremental, sino una arquitectura de control más amplia.

La fuente también dice que los desarrolladores pueden solicitar acceso anticipado mediante una lista de espera. Eso señala un patrón de despliegue familiar en sistemas avanzados de IA: primero anuncio público, después acceso controlado y, más adelante, una implementación más amplia si el rendimiento y la seguridad resultan aceptables. Para los desarrolladores, la implicación a corto plazo tiene menos que ver con una puesta en producción inmediata y más con la evaluación, la creación de prototipos y la comprensión de dónde encaja el modelo en las pilas de robótica existentes.

Un segundo modelo se centra en el razonamiento encarnado

Junto con Gemini Robotics 2, Google DeepMind también presentó Gemini Robotics ER 2. La sigla “ER” hace referencia al razonamiento encarnado, que el texto de origen describe como la capacidad de entender el mundo físico y decidir qué acciones tomar con base en esa comprensión. En otras palabras, el modelo apunta menos a la ejecución de bajo nivel y más a la interpretación de alto nivel y al apoyo en la toma de decisiones para sistemas robóticos.

DeepMind afirma que ER 2 sustituye a Gemini Robotics ER 1.6, que se había lanzado en abril. Esa rápida sucesión sugiere que la empresa está iterando con rapidez en un campo donde la utilidad del modelo depende de una combinación de capacidad general de IA y ajuste específico para robótica. El dato de distribución más destacable es que ER 2 está disponible en Google AI Studio, lo que ofrece a los desarrolladores una vía más directa para probar el lado de razonamiento de la pila que el modelo de control más amplio Robotics 2, que se está liberando mediante acceso anticipado.

La separación entre un modelo de control general y un modelo de razonamiento también refleja una tendencia de diseño más amplia en la IA para robótica. Cada vez más empresas separan el problema de “¿qué debería hacer el robot?” del de “¿cómo debería hacerlo físicamente?”. Un sistema de razonamiento puede ayudar a descomponer tareas, interpretar escenas y planificar secuencias, mientras que un modelo de control puede traducir esos planes en movimiento. La estructura del producto de DeepMind parece alinearse con esa división.

Por qué importa el lanzamiento

El anuncio añade competencia creciente para definir la base de software de la próxima generación de robots. La industria avanza más allá de la automatización rígidamente programada hacia sistemas capaces de adaptarse a entornos menos predecibles. Almacenes, fábricas, laboratorios y, finalmente, entornos abiertos al público recompensan a los robots que pueden manejar la variación sin necesitar programación manual exhaustiva para cada caso límite.

La forma en que DeepMind presenta el tema sugiere que ve a los modelos fundacionales multimodales como la vía hacia esa adaptabilidad. Si un robot puede interpretar instrucciones en lenguaje, analizar una escena visual y generalizar acciones entre tareas, los desarrolladores podrían construir productos más flexibles con menos código personalizado. Eso no elimina el trabajo de ingeniería duro en seguridad, latencia, calibración, integración de hardware y evaluación. Pero sí puede desplazar dónde se encuentran los problemas más difíciles dentro de la pila.

También hay aquí un punto estratégico para Google. La robótica ha tenido picos y caídas periódicas porque el lado del software luchaba por generalizar. Al vincular la robótica de forma más directa con el ecosistema de modelos de IA insignia de la compañía, Google DeepMind está argumentando, en la práctica, que el progreso en IA multimodal general ahora puede convertirse en progreso en sistemas encarnados. Esa es una historia comercial más sólida que la robótica como una línea de investigación mayormente separada.

Qué observar a continuación

  • Si los desarrolladores con acceso anticipado informan de un rendimiento sólido entre plataformas en lugar de demostraciones estrechas ligadas a robots específicos.
  • Cuánto trabajo de integración sigue siendo necesario para adaptar Gemini Robotics 2 a distintos cuerpos y restricciones de seguridad.
  • Si ER 2 en Google AI Studio se convierte en una herramienta práctica de planificación para desarrolladores de robótica fuera del ecosistema inmediato de DeepMind.
  • Cómo responden los rivales a medida que se acelera la carrera por construir plataformas generales de software para robots.

Por ahora, el lanzamiento se lee mejor como una señal importante de producto y plataforma que como prueba de que los robots con capacidades amplias estén listos para escalar en todas partes. Pero sí muestra hacia dónde cree uno de los mayores laboratorios de IA que se dirige el mercado: hacia capas reutilizables de inteligencia multimodal que puedan situarse por encima de muchos tipos de máquinas y hacerlas más adaptables en el mundo real.

Este artículo se basa en la cobertura de The Decoder. Leer el artículo original.

Originally published on the-decoder.com