Service Hotline
O Google DeepMind está lançando dois novos modelos de inteligência artificial projetados para ajudar robôs a "executar uma gama mais ampla de tarefas do mundo real do que nunca". O primeiro modelo, denominado Gemini Robótica, é um modelo de visão-linguagem-ação capaz de compreender novas situações mesmo sem treinamento prévio.
![]()
A Gemini Robotics é construída em Gemini 2.0, a versão mais recente do modelo de inteligência artificial carro-chefe do Google. Durante uma coletiva de imprensa, Carolina Parada, Diretora Sênior e Chefe de Robótica do Google DeepMind, declarou que a Gemini Robotics "alavanca a compreensão da Gemini sobre o mundo multimodal e a transfere para o mundo real adicionando ações físicas como uma nova modalidade."
O novo modelo fez avanços em três áreas principais que o Google DeepMind considera cruciais para a criação de robôs úteis: generalização, interatividade e destreza. Além de sua capacidade de generalizar novos cenários, a Gemini Robotics pode interagir melhor com as pessoas e o ambiente. Ela também pode executar tarefas físicas mais precisas, como dobrar um pedaço de papel ou remover uma tampa de garrafa.
O novo modelo Gemini Robotics do Google DeepMind torna os robôs mais hábeis.
Parada disse: "No passado, fizemos progresso em cada uma dessas áreas individualmente, mas agora estamos melhorando significativamente o desempenho em todas as três áreas com um único modelo. Isso nos permite criar robôs que são mais capazes, responsivos e robustos a mudanças ambientais."
O Google DeepMind também introduziu Gemini Robotics-ER (Embodied Reasoning), que a empresa descreve como um modelo avançado de visão e linguagem capaz de "entender nosso mundo complexo e em constante mudança.
Como Parada explicou, quando você está preparando uma lancheira com vários itens na mesa à sua frente, você precisa saber onde tudo está, como abrir a lancheira, como pegar os itens e onde colocá-los. Esse é exatamente o tipo de raciocínio que o Gemini Robotics-ER foi projetado para lidar. Ele visa permitir que especialistas em robótica se conectem com controladores de baixo nível existentes (sistemas que controlam os movimentos dos robôs), permitindo que eles habilitem novos recursos alimentados pelo Gemini Robotics-ER.
A Gemini Robotics também pode auxiliar robôs na execução de uma série de tarefas.
Em relação à segurança, Vikas Sindhwani, pesquisador do Google DeepMind, disse aos repórteres que a empresa está desenvolvendo uma "abordagem em camadas" e acrescentou que o modelo Gemini Robotics-ER é "treinado para avaliar se executar ações potenciais em cenários específicos é seguro". A empresa também lançou novos benchmarks e frameworks para ajudar a indústria de IA a avançar ainda mais na pesquisa de segurança. No ano passado, o Google DeepMind introduziu a "Robot Constitution", um conjunto de regras para robôs inspirado por Isaac Asimov.
O Google DeepMind está colaborando com a Apptronik para "construir a próxima geração de robôs humanoides". Além disso, o Google DeepMind está concedendo a "testadores confiáveis" acesso ao seu modelo Gemini Robotics-ER, incluindo Agile Robots, Agility Robotics, Boston Dynamics e Enchanted Tools. Parada disse: "Estamos altamente focados em construir inteligência que possa entender o mundo físico e agir dentro dele. Estamos muito animados para alavancar isso em várias formas de realização e aplicações".




粤公网安备44030002007346号