Представляем Gemini Robotics ER 2: Новый «разум» для роботов с пониманием видео и мультиагентным взаимодействием
overloaded AI 的 AI API 使用建议
overloaded AI 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。
Шаг вперед в мире физического ИИ
Робототехника выходит на новый уровень развития. Для того чтобы роботы могли эффективно помогать людям в повседневной жизни, им недостаточно просто распознавать объекты вокруг. Им необходимо мыслить со скоростью реального мира, точно рассчитывать время и координировать сложные цепочки действий.
Компания Google представила Gemini Robotics ER 2 — новейшую модель класса «Embodied Reasoning» (воплощенное мышление), которая берет на себя роль высокоуровневого мозга для физических агентов.

Что умеет Gemini Robotics ER 2?
В отличие от традиционных систем управления, Gemini Robotics ER 2 способна общаться с человеком на естественном языке, анализировать окружающую обстановку и планировать многоэтапные задачи. Спланировав последовательность действий, модель передает управление низкоуровневым моделям класса VLA (Vision-Language-Action), которые отвечают за непосредственное движение моторов.
Ключевые возможности:
- Оркестрация инструментов: Модель может обращаться к внешним API, поиску Google Search и пользовательским функциям для решения задач.
- Анализ видеопотока в реальном времени: Роботы могут следить за ходом выполнения задачи по видео, вовремя корректировать свои действия и понимать, когда этап завершен.
- Интеграция с Gemini Live API: Благодаря двустороннему стримингу минимизируются паузы на «размышления», делая действия робота плавными и естественными.

Gemini Robotics ER 2 значительно превосходит предыдущую версию ER 1.6 в различных режимах управления (VLA, симуляция и телеуправление).
Временной интеллект: Понимание момента завершения задачи
Одной из сложнейших проблем в робототехнике всегда было понимание того, когда задача действительно выполнена (например, завязана ли коробка или плотно ли закручена лампочка). ER 2 предлагает качественный скачок в двух базовых дисциплинах:
1. Классификация прогресса (Progress Classification)
Модель делит выполнение любой задачи на пять этапов (от 0% до 100%). Это позволяет роботу в реальном времени оценивать ситуацию: если что-то пошло не так, он может повторить неудавшийся шаг, а не начинать весь процесс заново.

ER 2 достигает точности в 57.4% при классификации прогресса выполнения задач, обходя конкурентов.
2. Точечное определение ключевых моментов (Moment-Finding)
Эта функция позволяет роботу определить точный кадр, на котором происходит критическое событие (например, момент, когда чашка наполнилась кофе и нужно прекратить наливать).

В задачах поиска ключевых моментов ER 2 достигает 91.3% точности при задержке менее секунды, что критически важно для безопасности реального времени.
Совместная работа нескольких роботов
Не существует универсального робота для любых задач: колесный робот быстр на ровном полу, а гуманоидный лучше справляется с неровной поверхностью. Gemini Robotics ER 2 позволяет роботам разного типа общаться друг с другом через общую семантическую среду. Это дает им возможность разделять задачи и координировать совместные действия в одном пространстве (например, совместная работа Apptronik Apollo 2 и Franka F3 Duo).

Сравнение показателей ER 2 по ключевым метрикам пространственного мышления и чтения приборов.
Безопасность и пространственный анализ
Безопасность — главный приоритет при работе роботов рядом с людьми. ER 2 демонстрирует значительные улучшения в тестах на следование правилам безопасности (Safety Instruction Following) и оценку приближения человека (Human Proximity).
Например, робот под управлением ER 2 мгновенно останавливает работу, если рядом оказывается человек, и возобновляет ее только после того, как зона снова станет свободной. Для оценки этих качеств разработчики также представили новый открытый бенчмарк безопасности.

Как начать работу с Gemini Robotics ER 2?
Новая модель уже доступна для разработчиков и компаний через:
- Gemini API
- Google AI Studio
- Gemini Enterprise Agent Platform (в режиме закрытого превью)
Разработчики могут настраивать интерфейсы низкоуровневого контроля как инструменты, передавая мультимедийные потоки (видео, аудио, текст) напрямую в ER 2 для создания продвинутых физических ИИ-агентов. Примеры кода и конфигурации уже опубликованы на GitHub.