Google DeepMind представила Gemini Robotics 2 — новое поколение моделей для роботов, где ставка сделана не на очередной чат-интерфейс, а на физическое действие в реальном мире. Это один из самых заметных AI-релизов конца июля: компания показала, как её системы переходят от понимания текста и изображений к управлению движением, хватом, координацией и многошаговым выполнением задач.
Что произошло
30 июля Google DeepMind анонсировала Gemini Robotics 2 — обновлённый стек моделей для робототехники. В релиз входят сразу три компонента с разной ролью.
- Gemini Robotics 2 — vision-language-action модель, которая переводит зрение и языковую инструкцию в моторное действие.
- Gemini Robotics ER 2 — embodied reasoning модель, отвечающая за планирование, понимание среды, общение с человеком и многошаговые сценарии.
- Gemini Robotics On-Device 2 — версия, оптимизированная для локальной работы прямо на роботах, без обязательной зависимости от облака.
Главное отличие этого релиза от прошлых демонстраций — акцент на whole-body intelligence, то есть управление не только руками над столом, а всем телом робота. DeepMind показывает сценарии, где гуманоид может подойти к объекту, нагнуться, дотянуться, взять предмет и перенести его в нужное место. Это уже ближе к реальной бытовой и промышленной робототехнике, чем классические лабораторные демо с заранее подготовленной сценой.
Ещё один важный апдейт — рост ловкости. Компания отдельно подчёркивает работу с более тонкой моторикой: завязывание узлов, закрытие zip-пакета, плотная упаковка предметов и другие действия, где раньше роботы часто ломались на мелочах.
Третий сильный момент — кооперация нескольких роботов. Gemini Robotics ER 2 умеет координировать более длинные многошаговые задачи и распределять работу между разными машинами. Для рынка это важнее, чем звучит: ценность роботов резко растёт, когда они могут не просто выполнить одну команду, а встроиться в рабочий процесс.
DeepMind также заявила, что локальная версия модели может адаптироваться к новым типам роботов всего за несколько часов и с относительно небольшим количеством примеров. Если это масштабируется на практике, барьер внедрения physical AI для новых платформ станет заметно ниже.
Почему это важно
До сих пор большая часть шума вокруг ИИ крутилась вокруг текста, кода, поиска, изображений и агентных интерфейсов на экране. Gemini Robotics 2 показывает следующий логичный шаг: ИИ начинает уверенно заходить в физический мир.
Это важно сразу по нескольким причинам.
Во-первых, рынок получает сигнал, что гонка идёт уже не только за самой умной моделью в чате, но и за тем, кто быстрее превратит интеллект в действие. Если модель умеет понимать среду, планировать шаги и безопасно управлять роботами, это открывает дорогу в логистику, склады, производство, сервис и домашнюю автоматизацию.
Во-вторых, DeepMind делает ставку не на один эффектный ролик, а на архитектуру из нескольких уровней: отдельная reasoning-модель, отдельная action-модель, отдельный on-device контур. Это ближе к тому, как реально строятся надёжные AI-системы: не один магический блок, а связка модулей с разными задачами и ограничениями.
В-третьих, релиз важен для всей темы AI-агентов. Последний год индустрия много говорила про агентов в браузере, IDE и офисных инструментах. Здесь мы видим агентность в более жёсткой среде, где ошибка — это не испорченный документ, а неудачное физическое действие. Поэтому прогресс в робототехнике обычно лучше проверяет реальную зрелость модели, чем красивые чат-демо.
Наконец, DeepMind отдельно подчёркивает безопасность: модель лучше отслеживает близость человека, умеет инициировать safety-инструменты и останавливать действие при риске. Для robotics-направления это не маркетинговая деталь, а обязательное условие выхода из лаборатории в реальную эксплуатацию.
Что дальше
В ближайшее время стоит смотреть не только на новые демо, но и на признаки реального внедрения.
Если Gemini Robotics 2 начнёт стабильно работать у early-access партнёров и появятся кейсы вне контролируемых презентаций, это будет одним из самых сильных подтверждений, что physical AI действительно переходит из стадии обещаний в стадию продукта.
Также важно, как быстро экосистема подхватит этот релиз. DeepMind уже открыла доступ к Gemini Robotics ER 2 через Google AI Studio, а VLA- и on-device-модели отдала партнёрам раннего доступа. Это значит, что следующие месяцы могут принести волну новых робототехнических приложений поверх одной и той же AI-платформы.
Для рынка в целом вывод простой: после бурного роста AI-агентов на экране начинается борьба за агентов с телом. И если июль был месяцем апдейтов моделей, то Gemini Robotics 2 выглядит как один из самых интересных сигналов о том, куда индустрия двинется дальше.
Официальный источник: Google DeepMind — Gemini Robotics 2
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно