Đường dây nóng Dịch vụ
Google DeepMind đang tung ra hai mô hình trí tuệ nhân tạo mới được thiết kế để giúp robot "thực hiện nhiều nhiệm vụ thực tế hơn bao giờ hết". Mô hình đầu tiên, có tên là Công ty Robot Gemini, là một mô hình thị giác-ngôn ngữ-hành động có khả năng hiểu được những tình huống mới ngay cả khi không được đào tạo trước.
![]()
Gemini Robotics được xây dựng trên Gemini 2.0, phiên bản mới nhất của mô hình trí tuệ nhân tạo hàng đầu của Google. Trong một cuộc họp báo, Carolina Parada, Giám đốc cấp cao và Trưởng bộ phận Robot tại Google DeepMind, đã tuyên bố rằng Gemini Robotics "tận dụng sự hiểu biết của Gemini về thế giới đa phương thức và chuyển nó vào thế giới thực bằng cách thêm các hành động vật lý như một phương thức mới".
Mô hình mới đã có những tiến bộ trong ba lĩnh vực chính mà Google DeepMind coi là quan trọng để tạo ra những robot hữu ích: tổng quát hóa, tương tác và khéo léo. Ngoài khả năng khái quát hóa các kịch bản mới, Gemini Robotics có thể tương tác tốt hơn với con người và môi trường. Nó cũng có thể thực hiện các nhiệm vụ vật lý chính xác hơn, chẳng hạn như gấp một tờ giấy hoặc tháo nắp chai.
Mô hình Gemini Robotics mới của Google DeepMind giúp robot trở nên khéo léo hơn.
Parada cho biết, "Trước đây, chúng tôi đã đạt được tiến bộ trong từng lĩnh vực riêng lẻ, nhưng hiện tại chúng tôi đang cải thiện đáng kể hiệu suất trên cả ba lĩnh vực chỉ với một mô hình duy nhất. Điều này cho phép chúng tôi tạo ra những robot có khả năng, phản ứng nhanh hơn và mạnh mẽ hơn trước những thay đổi của môi trường."
Google DeepMind cũng đã giới thiệu Gemini Robotics-ER (Lý luận thể hiện), được công ty mô tả là mô hình ngôn ngữ thị giác tiên tiến có khả năng "hiểu thế giới phức tạp và luôn thay đổi của chúng ta.
Như Parada đã giải thích, khi bạn đang đóng gói một hộp cơm trưa với nhiều món đồ khác nhau trên bàn trước mặt, bạn cần biết mọi thứ ở đâu, cách mở hộp cơm trưa, cách nhặt đồ và đặt chúng ở đâu. Đây chính xác là loại lý luận mà Gemini Robotics-ER được thiết kế để xử lý. Nó nhằm mục đích cho phép các chuyên gia về robot kết nối với các bộ điều khiển cấp thấp hiện có (các hệ thống điều khiển chuyển động của robot), cho phép họ kích hoạt các tính năng mới được cung cấp bởi Gemini Robotics-ER.
Gemini Robotics cũng có thể hỗ trợ robot thực hiện nhiều nhiệm vụ khác nhau.
Về vấn đề an toàn, Vikas Sindhwani, một nhà nghiên cứu tại Google DeepMind, đã nói với các phóng viên rằng công ty đang phát triển một "phương pháp tiếp cận theo từng lớp" và nói thêm rằng mô hình Gemini Robotics-ER được "đào tạo để đánh giá liệu việc thực hiện các hành động tiềm năng trong các tình huống cụ thể có an toàn hay không". Công ty cũng đã công bố các chuẩn mực và khuôn khổ mới để giúp ngành công nghiệp AI thúc đẩy hơn nữa nghiên cứu về an toàn. Năm ngoái, Google DeepMind đã giới thiệu "Robot Constitution", một bộ quy tắc dành cho robot lấy cảm hứng từ Isaac Asimov.
Google DeepMind đang hợp tác với Apptronik để "xây dựng thế hệ robot hình người tiếp theo". Ngoài ra, Google DeepMind đang cấp cho "những người kiểm tra đáng tin cậy" quyền truy cập vào mô hình Gemini Robotics-ER của mình, bao gồm Agile Robots, Agility Robotics, Boston Dynamics và Enchanted Tools. Parada cho biết, "Chúng tôi tập trung cao độ vào việc xây dựng trí thông minh có thể hiểu được thế giới vật lý và hành động trong đó. Chúng tôi rất vui mừng khi tận dụng điều này trên nhiều hiện thân và ứng dụng".




粤公网安备44030002007346号