Las máquinas ya no tendrán que aprender todo desde cero.
(Otra opción: Las máquinas ya no tendrán que empezar de cero para aprender.)

La idea de un «cerebro» universal para robots dejó de ser solo un objetivo de investigación. Google DeepMind intenta crear una inteligencia que conserva habilidades al pasar entre diferentes cuerpos, brazos y transmisiones. En Gemini Robotics 2 la compañía ya utiliza la misma plantilla de control del modelo en varios robots, y la versión local se adapta a un nuevo cuerpo en pocas horas.
Google DeepMind presentó Gemini Robotics 2 a finales de julio. El sistema controla todo el cuerpo del humanoide Apptronik Apollo 2, incluidas las piernas, el torso, los brazos y los dedos, y la misma plantilla del modelo funciona en dos configuraciones de Apollo y en la plataforma de dos brazos Franka Duo. En un caso incluso cambian las manos: SharpaWave reemplaza a Inspire. La apuesta principal se centra en transferir habilidades entre distintas mecánicas.
Tras el «cerebro» no hay una sola red neuronal que se pueda trasladar literalmente sin ajustes. Gemini Robotics 2 transforma la imagen y el comando de texto en movimientos, Gemini Robotics ER 2 planifica trabajos de múltiples pasos y supervisa su progreso, y Gemini Robotics On-Device 2 ejecuta el control de forma local. A este último modelo DeepMind lo entrena para adaptarse rápidamente a un nuevo cuerpo.
Para la nueva plataforma de dos brazos, Gemini Robotics On-Device 2 normalmente requiere menos de 200 ejemplos y unas pocas horas de entrenamiento adicional. DeepMind verificó esa transferencia en Dexmate, SO101 y Trossen, que difieren en forma, sensores y número de grados de libertad. Este enfoque reduce el volumen de datos que antes había que recopilar por separado para cada configuración.
La transferencia entre cuerpos no equivale a la destreza humana. En las pruebas, Apollo 2 con una mano de múltiples dedos desenroscó una bombilla en el 92% de los intentos, pero la atornilló solo en el 36%, y la tarea con una pala tuvo éxito en el 32% de los casos. Con la pinza habitual de dos dedos, Franka Duo lo hizo mejor: la inserción precisa de piezas alcanzó el 89,6% y el montaje de herramientas el 78,9%. Incluso habilidades adyacentes difieren significativamente.
Una brecha similar se observa también en los movimientos de todo el cuerpo. Apollo 2 recogió con éxito un objeto de un estante en el 76,3% de los ensayos, de una mesa en el 68,4% y del suelo solo en el 45,7%. DeepMind reconoce abiertamente que la velocidad de los movimientos y la manipulación con múltiples dedos siguen siendo un punto débil. Por eso los resultados actuales describen demostraciones de laboratorio, no un asistente universal listo.
Scientific American analizó otra limitación del enfoque. Los modelos modernos reciben un enorme volumen de datos visuales, pero carecen casi por completo de un conjunto comparable de datos sobre el tacto, la fuerza y la posición de las articulaciones. Un robot puede ver uvas o una copa y escoger un movimiento, pero siente peor que un humano el momento en que un objeto empieza a resbalar, doblarse o romperse.
La parte de alto nivel de DeepMind se construye alrededor del «razonamiento incorporado», cuando la IA evalúa la situación, divide la tarea en etapas y cambia el plan tras un error. En abril Google ya amplió esas capacidades en Gemini Robotics-ER 1.6, añadiendo mejor comprensión espacial, trabajo con varias cámaras y verificación del resultado. La nueva versión desarrolla el mismo principio para escenarios más largos.
Gemini Robotics ER 2 ahora gestiona secuencias de varios minutos y cientos de decisiones, rastrea el inicio y la finalización de las etapas y puede coordinar varios robots diferentes. Para trabajar cerca de personas, DeepMind añadió comprobaciones de seguridad, incluida la detención si una persona se aproxima demasiado y la renuncia a acciones peligrosas. Por ahora esas funciones se prueban en condiciones controladas.
A 16 de septiembre la disponibilidad sigue siendo limitada. Gemini Robotics ER 2 se puede probar a través de Google AI Studio, y el acceso vía Gemini Enterprise Agent Platform está en un modo preliminar cerrado. El modelo VLA principal y On-Device 2 se entregan a socios de acceso anticipado. El objetivo de DeepMind es más amplio que un humanoide concreto: separar la inteligencia del robot del cuerpo y hacer las habilidades transferibles entre máquinas.