Google DeepMind представила Gemini Robotics ER 2 — новую embodied reasoning-модель для роботов. Если коротко, это не моторика как таковая, а "верхний мозг" для физического ИИ: модель понимает, что происходит вокруг, общается с человеком, планирует многошаговые действия и передаёт исполнение нижнему уровню — VLA-моделям и роботическим API.
Важно и то, что релиз не остался лабораторной демонстрацией. Google открыла доступ к модели через Gemini API и Google AI Studio, а для корпоративного контура дала private preview в Gemini Enterprise Agent Platform.
Что произошло
Главное обновление в Gemini Robotics ER 2 — резкий шаг вперёд в понимании видео, отслеживании прогресса задачи и orchestration-сценариях. По сути, модель умеет не просто увидеть сцену, а следить за выполнением работы во времени: понимать, на каком этапе находится задача, заметить сбой и скорректировать дальнейшие действия.
DeepMind описывает ER 2 как high-level brain для роботов. Модель может:
- принимать мультимодальный поток из видео, аудио и текста;
- планировать многошаговые задачи;
- вызывать инструменты вроде Google Search или пользовательских функций;
- координировать работу с VLA-моделями и навигационными API;
- продолжать "думать" о следующем шаге, пока робот уже выполняет текущее действие.
Это особенно важно для физического мира, где нельзя работать по схеме "стоп — подумал — сделал" с длинными паузами. DeepMind встроила модель в Gemini Live API, чтобы orchestration происходил с низкой задержкой и без рваного поведения.
Отдельно компания показала несколько сильных практических улучшений. В задачах progress classification модель оценивает, насколько продвинулась работа, а в moment-finding умеет определять точный момент, когда действие нужно остановить или переключить сценарий. Это критично для бытовых и промышленных задач вроде наливания кофе, затягивания лампочки или завязывания мусорного пакета.
Ещё один важный шаг — multi-robot collaboration. DeepMind прямо показывает сценарий, где разные машины могут координироваться через общую семантическую модель задачи и передавать работу друг другу. Это уже ближе не к одному "умному роботу", а к AI-оркестратору для группы роботов.
Почему это важно
На мой взгляд, в этой новости самое интересное не слово robotics само по себе, а переход от отдельных роботических демо к более универсальному агентному слою для physical AI. До сих пор слабым местом многих роботов была не только моторика, но и понимание процесса во времени: что уже сделано, что пошло не так, когда считать задачу завершённой и когда безопасно переходить дальше.
Gemini Robotics ER 2 бьёт именно в эту проблему. Если модель действительно хорошо отслеживает прогресс, замечает ошибки по видеопотоку и умеет переигрывать план без полного перезапуска, это делает роботов заметно полезнее в реальных средах, а не только в аккуратных лабораторных постановках.
Важен и другой момент: Google не оставила релиз на уровне research-страницы, а вывела его в API. Это сигнал, что robotics и physical AI начинают превращаться в платформенный слой для разработчиков. Когда embodied reasoning-модель можно подключать через стандартный инструментарий, рынок получает шанс быстрее перейти от единичных экспериментов к прикладным решениям — от складов и сервисных роботов до корпоративных сценариев с несколькими машинами.
Наконец, сама ставка на совместную работу нескольких роботов выглядит стратегически сильной. Один робот почти всегда упирается в ограничения формы, среды и инструмента. Оркестрация нескольких разных машин через общую модель понимания задачи — гораздо более реалистичный путь к полезной автоматизации физического мира.
Что дальше
Дальше рынок будет смотреть не только на красивые демо, а на три практических вещи.
Во-первых, насколько стабильно такие embodied reasoning-модели работают вне тщательно подготовленной сцены: в шумной, загромождённой и меняющейся среде.
Во-вторых, насколько быстро разработчики начнут строить поверх ER 2 реальные продукты через Gemini API и Live API. Если появятся прикладные кейсы с понятной экономикой, Google получит серьёзное преимущество в физическом AI.
В-третьих, насколько хорошо сработает safety-слой. DeepMind отдельно акцентирует улучшения по Safety Instruction Following и Human Proximity, то есть по соблюдению физических ограничений и реакции на присутствие человека рядом. Для physical AI это не дополнительная опция, а базовое условие внедрения.
Итог простой: Gemini Robotics ER 2 — это не просто ещё одна "модель для роботов". Это шаг к тому, чтобы роботы начали действовать как настоящие AI-агенты в физическом мире: понимать процесс, координировать инструменты, работать в группе и исправляться по ходу задачи. Для 2026 года это один из самых содержательных сигналов о том, куда реально движется рынок ИИ за пределами чатов и генерации контента.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно