Google presentó Gemini Robotics 2, su nuevo modelo de visión, lenguaje y acción diseñado para impulsar una nueva generación de robots humanoides con mayor capacidad de razonamiento, movilidad y precisión. La compañía asegura que esta tecnología permitirá desarrollar máquinas más adaptables, capaces de comprender su entorno y ejecutar tareas complejas con mayor autonomía.
La principal novedad de Gemini Robotics 2 es que amplía el control inteligente a todo el cuerpo del robot. A diferencia de las versiones anteriores, que solo gestionaban los movimientos de la parte superior del cuerpo para realizar tareas sobre una mesa, el nuevo sistema permite caminar, agacharse, estirarse y manipular objetos con mayor destreza.
«Por primera vez, el modelo puede controlar robots humanoides completos, traduciendo la intención en un control inteligente de todo el cuerpo», destacó Google al presentar la nueva plataforma tecnológica, con la que busca que los robots razonen sobre cada movimiento antes de ejecutarlo.
Otra de las innovaciones incorporadas es la capacidad de colaboración entre múltiples robots. Gracias a esta función, varios dispositivos podrán coordinarse para dividir tareas y completarlas en menos tiempo, además de adaptarse a diferentes tipos de cuerpos robóticos en cuestión de horas mediante una ejecución local en cada dispositivo.
Para lograr estas capacidades, Gemini Robotics 2 combina tres modelos de inteligencia artificial. El primero es un modelo de visión, lenguaje y acción (VLA), encargado de transformar información visual y lingüística en movimientos físicos precisos, permitiendo controlar desde los dedos de las manos hasta los pies del robot.
El segundo componente es Gemini Robotics ER 2, un modelo de razonamiento visual y lingüístico que funciona como el «cerebro» del robot. Este sistema permite comprender instrucciones humanas, analizar el entorno, planificar tareas de varios pasos, coordinar la ejecución de acciones y verificar cuándo una actividad ha sido completada.
Finalmente, Google incorpora Gemini Robotics On-Device 2, una versión optimizada del modelo VLA diseñada para ejecutarse directamente en los dispositivos robóticos, reduciendo la dependencia de servicios externos y mejorando la capacidad de respuesta en tiempo real.
Entre las aplicaciones mostradas por la compañía se encuentran tareas como ordenar una habitación, trasladar objetos a ubicaciones específicas o realizar acciones de alta precisión, como atar nudos utilizando manos robóticas SharpaWave de cinco dedos y 22 grados de libertad, así como operar pinzas de dos dedos para manipulaciones delicadas. Google también informó que Gemini Robotics ER 2 ya está disponible en Google AI Studio y en versión preliminar privada para Gemini Enterprise Agent Platform, mientras que los modelos VLA y On-Device permanecerán, por ahora, en acceso anticipado para socios estratégicos.
