На середине длинной задачи агент часто теряет нить: не ясно, шаг уже закрыт или нет, а после сбоя он либо откатывается к началу, либо идёт дальше вслепую. Знакомо и роботу с уборкой комнаты, и сценарию, который крутится часами без присмотра.
Google для своих роботов вынес планирование в отдельного агента. Он смотрит, что происходит, дробит работу на минуты вперёд, следит за ходом и зовёт «руки» только как инструмент. Одна модель больше не обязана сразу и думать, и двигать — длинная задача без отдельного «мозга» сыплется, и это уже не гипотеза, а анонс.
Одна модель не тянет и думать, и двигать руками

В конце июля DeepMind выложил Gemini Robotics 2 — слой интеллекта для роботов, которые не стоят на месте и не делают один жест по команде. Задача звучит бытово: положи лейку в зелёный контейнер на нижней полке. Робот идёт к столу, берёт предмет, доходит до полки, ставит. Минутная цепочка шагов, а не один рывок.
Раньше соблазн был простой: скормить одной модели и зрение, и язык, и мотор. На коротком жесте это ещё работает. На цепочке «сначала сюда, потом туда, потом проверь» модель сбивается: не знает, закрыт ли шаг, после ошибки начинает сначала или прёт дальше как будто ничего не случилось. Google это не скрыл — разделил роли.
Планировщик смотрит комнату и вызывает мотор только как инструмент

Сверху сидит Gemini Robotics ER 2 — агент рассуждения. Он принимает инструкцию человека, смотрит комнату или видео, дробит работу на шаги на несколько минут вперёд, координирует исполнителей и следит за прогрессом. Если шаг сорвался, пытается поправиться сам, а не ждать, пока оператор перезапустит всё с нуля.
Мотор — отдельная история. Gemini Robotics 2 как модель «зрение плюс язык → команды телу» двигает гуманоида или пару рук. Для агента рассуждения это не напарник по мышлению, а инструмент: вызвал, дождался результата, решил, что дальше. Рядом ещё On-Device 2 — компактный мотор на самом железе, который под новое тело обычно учат за несколько часов и меньше двухсот примеров. Три слоя, одна идея: кто планирует, кто едет, кто живёт локально без облака на каждый тик.
В показах разные тела делят одну работу через общее понимание сцены. Apptronik Apollo рядом с Franka, Spot от Boston Dynamics слушает естественный язык, а ER оркестрирует навигацию и манипулятор через их интерфейсы. Скорость движения ещё не человеческая — DeepMind сам это пишет. Зато схема ролей уже ясна.
Поймать миг события легче, чем понять, что работа закрыта

У ER 2 есть две скучные, но честные цифры. Найти кадр ключевого события — «хватит наливать» — получается примерно в девяти случаях из десяти, с ошибкой около секунды. А вот сказать по кадру, насколько длинная задача уже готова (корзины 0–20%, 80–100% и так далее), — чуть больше половины попыток, около 57%.
То есть «поймать миг» модель умеет лучше, чем стабильно знать, закончена ли работа. Это не повод восторгаться бенчмарком Google на своих тестах. Это повод смотреть на свою автоматизацию: если у вас нет явного сигнала «шаг закрыт», агент гадает. Угадывание на длинной цепочке — и есть потеря нити.
RobotsBeat прямо пишет: шестьдесят процентов на прогрессе далеко от высокорисковых задач без дополнительных защит. Карточка модели тоже не церемонится: robotics-модели не для медицины, транспорта и всего, где сбой бьёт по людям. Превью — не «купил робота в магазине и воткнул мозг».
Публично отдали мозг, а руки пока только партнёрам
На начало августа публичный предварительный доступ крутится вокруг ER 2: Google AI Studio и Gemini API, модель gemini-robotics-er-2-preview, плюс потоковый вариант под Live API. База — Gemini 3.5 Flash, длинный контекст, на вход текст, картинка, видео и звук. Физический мотор и On-Device — ранний доступ для партнёров и доверенных тестеров, не общий прилавок.
Безопасность вынесли отдельным бенчмарком ASIMOV-Agentic: отказ от опасных вызовов мотора, оценка выполнимости, вопрос человеку, когда неясно. ER 2 останавливается, если человек близко, и продолжает, когда зона свободна. Это не магия ответственности — это явные стопы и эскалация, без которых длинный агент опасен даже в софте.
Примеры лежат в официальном репозитории google-gemini/robotics-samples. Документация и карточка модели датированы 30 июля 2026. Если лезете в API — читайте карточку модели, а не только заголовок пресс-релиза.
Длинный сценарий без отдельного мозга сыплется так же
Робот здесь — яркая картинка, не ваш следующий гаджет на кухне. Боль та же, что у агента в Cursor или у сценария в Make: многошаговая работа без присмотра, сбой посередине, и система не знает, что уже сделано. Google официально признал раздельное планирование с видеотрекингом прогресса. Не «одна умная модель на всё», а «мозг планирует — руки едут».
Практика без роботов простая. Вынесите планирование и контроль хода в отдельный слой: кто решает следующий шаг, кто исполняет, кто фиксирует «закрыто / сорвалось / зови человека». Не оставляйте прогресс на догадку по последнему сообщению в чате. После ошибки не гоните цепочку с начала, если можно откатить один шаг. И не путайте этот анонс с планировщиком внутри среды разработки или с чужими «тренерами памяти» — похожий узор, другое тело и другой продукт.
Если собираете таких агентов под маркетинг и автоматизацию, а не под гуманоида, смотрите разборы в канале «Ковчег» — там про связки нейросетей, Make и Cursor AI без розовой каши. Стек и практика — на обучении Cursor + Make + AI, хаб kv-ai.ru.