Когда компания пытается автоматизировать склад или производственную логистику, главный барьер часто не в самих роботах, а в том, как ими управлять в реальном времени. Один робот хорошо перевозит коробки, другой берёт предметы манипулятором, третий умеет двигаться по сложной траектории, но между ними всё ещё остаются ручные переключения, жёсткие сценарии и отдельный оператор, который следит, дошёл ли процесс до нужной точки.
30 июля Google представила Gemini Robotics ER 2 — новую модель, которая выступает как верхний слой управления для физических роботов. Важен здесь не сам бренд, а практический сдвиг: модель умеет видеть видеопоток, планировать несколько шагов подряд, вызывать инструменты и API, отслеживать прогресс задачи и координировать сразу несколько машин в общем сценарии. Для бизнеса это уже не история про демонстрационный «умный робот», а про свежий шаблон того, как AI-сотрудник выходит из окна чата в физические процессы.
Что именно запустила Google
Google описывает Gemini Robotics ER 2 как «высокоуровневый мозг» для роботов. Модель принимает на вход видео, текст, аудио и сигналы от подключённых инструментов, понимает физическую ситуацию, планирует последовательность действий и передаёт исполнение нижнему слою — например, модели действий с визуально-языковым управлением (VLA) или навигационному API конкретной машины.
Ключевой момент в том, что речь идёт не о длинном заранее прошитом сценарии. Gemini Robotics ER 2 умеет по ходу работы решать, что делать дальше, вызывать внешние функции и корректировать план, если среда изменилась. В статье Google отдельно подчёркивает два новых блока возможностей: отслеживание прогресса по непрерывному видеопотоку и координацию нескольких роботов в одном общем процессе.
Ещё один важный сигнал для рынка — доступность. Google уже открыла модель через Gemini API и Google AI Studio, а для корпоративных команд даёт закрытый предварительный доступ в Gemini Enterprise Agent Platform. То есть это уже не лабораторная заметка без пути в реальный пилот, а продуктовый слой, который можно начинать примерять к своим физическим сценариям и внутренним инструментам.
Почему это важно для склада и операционных площадок
Сам источник не ограничивается складом, но именно там практическая ценность считывается особенно быстро. На складе или в производственной логистике задача редко состоит из одного движения. Нужно подъехать к зоне хранения, проверить контекст, взять нужный объект, объехать препятствие, передать груз дальше, убедиться, что этап завершён, и только потом запускать следующий шаг.
До сих пор многие такие процессы держались либо на жёстких правилах, либо на операторе, который вручную следит, не уехал ли робот не туда и не завис ли процесс посередине. Google показывает более зрелый слой: модель может сама вести многошаговую оркестрацию, а не только реагировать на одну команду. В демонстрации с Boston Dynamics Spot она управляет навигацией и манипулятором через API, чтобы робот по голосовой команде нашёл и принёс предмет.
Для бизнеса это важно по трём причинам.
- Меньше ручных переключений между системами и машинами. Один слой может координировать несколько разных интерфейсов вместо набора отдельных точечных скриптов.
- Больше устойчивости к сбоям в середине задачи. Если робот видит, что шаг не завершён, ему не нужно полностью перезапускать сценарий или ждать человека на каждый микро-сбой.
- Проще переносить сценарий между площадками. Когда верхний слой думает о цели и последовательности, а не о каждом моторе напрямую, компания получает более гибкую основу для автоматизации бизнес-процессов в физическом контуре.
Как видео и контроль прогресса меняют сценарий
Самая сильная часть обновления — не просто «робот лучше видит», а то, что он лучше понимает, на каком этапе находится задача. Google пишет, что Gemini Robotics ER 2 использует непрерывный видеопоток, чтобы отслеживать прогресс, замечать отклонения и понимать, когда можно переходить к следующему шагу.
В практическом смысле это меняет качество автоматизации. Вместо тупого цикла «сделай действие → переходи дальше» появляется контур проверки: получилось ли закрутить лампочку до конца, завязан ли пакет, не пролился ли кофе, не промахнулся ли захват. Для складских и производственных задач это особенно важно там, где ошибка видна не по одному датчику, а по общей физической картине.
В статье Google приводит и количественные ориентиры. На задаче классификации прогресса модель достигает 57,4% точности, разбивая выполнение по видеокадрам на уровни прогресса. На задаче поиска точного момента завершения критического действия Google заявляет 91,3% точности и среднее отклонение 0,96 секунды. Для бизнеса это означает не академическую метрику ради отчёта, а шанс перейти от «робот выполнил команду» к «система проверила, что результат реально достигнут».
Что даёт координация нескольких роботов
Вторая важная новость — координация нескольких роботов. Google прямо пишет, что одна машина не подходит под все задачи: где-то лучше работает колёсная платформа, где-то гуманоид, где-то компактный манипулятор. Gemini Robotics ER 2 позволяет разным машинам работать через общий смысловой слой и передавать процесс друг другу.
Для склада это открывает более интересный сценарий, чем замена человека одним «универсальным» роботом. Например, одна машина может довезти контейнер до нужной зоны, другая — выполнить точный захват, а третья — проверить завершение этапа или передать объект дальше по цепочке. Чем сложнее площадка, тем важнее именно координация ролей, а не сила одного устройства.
Это хорошо сочетается и с корпоративной архитектурой. Физический AI-агент не обязан переписывать весь нижний уровень управления. Его задача — собрать видеоконтекст, цели и инструменты в единый ход работы, где каждая машина остаётся на своей сильной роли, а логика передачи этапа и проверки результата поднимается выше.
Где человеку нельзя выходить из контура
Даже сильный прогресс не делает физическую автоматизацию автономной «по умолчанию». Наоборот, чем больше действий модель координирует, тем важнее заранее зафиксировать границы, где финальное решение остаётся у человека.
- Безопасность людей и оборудования. Если робот работает рядом с сотрудниками, погрузочной техникой или дорогим оборудованием, критические ограничения должны задаваться не текстовой надеждой, а отдельными правилами и блокировками.
- Подтверждение завершения ключевых операций. Не каждую ошибку можно закрыть внутренней уверенностью модели. Для дорогих или опасных шагов нужна явная бизнес-валидация.
- Выбор допустимых инструментов и API. Верхний слой координации полезен ровно до той точки, где компания понимает, какие вызовы модели разрешены, а какие нет.
- Экономика сценария. Если роботизированный контур снижает нагрузку только в демо, но не сокращает время цикла и стоимость ошибки на реальной площадке, пилот не стоит масштабировать.
Именно поэтому такие системы лучше воспринимать не как «робот всё сделает сам», а как новый слой координации между физическими машинами, видео, API и человеком-оператором. Когда этот слой спроектирован аккуратно, он убирает часть ручной рутины и повышает устойчивость процесса. Когда нет — просто переносит хаос с людей на дорогую технику.
Частые вопросы
Это история только про гуманоидов и лабораторные демо?
Нет. В статье Google есть и общий продуктовый слой, и практические примеры с разными типами роботов. Для бизнеса важнее не форма машины, а способность координировать реальные шаги, инструменты и проверки результата.
Почему этот запуск интересен именно складу?
Потому что на складе много многошаговых операций, где одной команды недостаточно. Нужно понимать контекст, следить за прогрессом, исправлять сбой на ходу и передавать этап между несколькими машинами или системами.
Заменит ли такой слой WMS, PLC или нижний контур управления?
Скорее нет. Google показывает верхний слой логики и координации, который вызывает уже существующие модели действий, навигационные API и другие инструменты. Нижний контур остаётся, но получает более умную координацию.
С чего компании начинать пилот?
С одного сценария, где легко измерить эффект: внутрискладская доставка, передача объекта между машинами, проверка завершения этапа или операция, где сегодня много ручных подтверждений. Сначала нужен измеримый выигрыш по времени цикла и ошибкам, а уже потом масштабирование.
Обсудить статью со своим ИИ-ассистентом
Скопируйте эту статью в Markdown: заголовок, ссылка и вся структура текста уже будут готовы для Cursor, Claude, ChatGPT или любого другого агента.
Готово для вставки в ИИ-ассистент.