Línea directa de servicio
Google DeepMind lanza dos nuevos modelos de inteligencia artificial diseñados para ayudar a los robots a "realizar una gama más amplia de tareas del mundo real que nunca". El primer modelo, llamado Robótica Géminis, es un modelo de visión-lenguaje-acción capaz de comprender nuevas situaciones incluso sin entrenamiento previo.
![]()
Gemini Robotics se basa en Gemini 2.0, la última versión del modelo insignia de inteligencia artificial de Google. Durante una conferencia de prensa, Carolina Parada, directora sénior y jefa de Robótica de Google DeepMind, afirmó que Gemini Robotics "aprovecha la comprensión de Gemini del mundo multimodal y la traslada al mundo real al incorporar acciones físicas como una nueva modalidad".
El nuevo modelo ha realizado avances en tres áreas clave que Google DeepMind considera cruciales para crear robots útiles: generalización, interactividad y destrezaAdemás de su capacidad para generalizar nuevos escenarios, Gemini Robotics puede interactuar mejor con las personas y el entorno. También puede realizar tareas físicas más precisas, como doblar un papel o destapar una botella.
El nuevo modelo Gemini Robotics de Google DeepMind hace que los robots sean más diestros.
Parada afirmó: «Anteriormente, progresamos en cada una de estas áreas individualmente, pero ahora estamos mejorando significativamente el rendimiento en las tres con un solo modelo. Esto nos permite crear robots más capaces, sensibles y robustos ante los cambios ambientales».
Google DeepMind también presentó Gemini Robotics-ER (Embodied Reasoning), que la compañía describe como un modelo avanzado de visión y lenguaje capaz de "comprender nuestro mundo complejo y en constante cambio".
Como explicó Parada, al preparar una lonchera con varios artículos en la mesa, es necesario saber dónde está cada cosa, cómo abrirla, cómo coger los artículos y dónde colocarlos. Este es precisamente el tipo de razonamiento que Gemini Robotics-ER está diseñado para gestionar. Su objetivo es que los expertos en robótica se conecten con los controladores de bajo nivel existentes (sistemas que controlan los movimientos de los robots), lo que les permitirá habilitar nuevas funciones impulsadas por Gemini Robotics-ER.
Gemini Robotics también puede ayudar a los robots a realizar una variedad de tareas.
En cuanto a la seguridad, Vikas Sindhwani, investigador de Google DeepMind, declaró a la prensa que la compañía está desarrollando un enfoque por capas y añadió que el modelo Gemini Robotics-ER está entrenado para evaluar si es seguro ejecutar acciones potenciales en escenarios específicos. La compañía también ha publicado nuevos puntos de referencia y marcos para ayudar a la industria de la IA a seguir avanzando en la investigación sobre seguridad. El año pasado, Google DeepMind presentó la «Constitución del Robot», un conjunto de reglas para robots inspirado en Isaac Asimov.
Google DeepMind colabora con Apptronik para desarrollar la próxima generación de robots humanoides. Además, Google DeepMind otorga a los evaluadores de confianza acceso a su modelo Gemini Robotics-ER, que incluye Agile Robots, Agility Robotics, Boston Dynamics y Enchanted Tools. Parada afirmó: «Estamos muy centrados en desarrollar inteligencia capaz de comprender el mundo físico y actuar en él. Nos entusiasma aprovechar esto en múltiples encarnaciones y aplicaciones».




粤公网安备44030002007346号