DeepMind выпустил Gemini Robotics 2: аппаратная независимость и мультиагентность для роботов

Google DeepMind переводит робототехнику на рельсы универсальных VLA-моделей (vision-language-action). В релизе Gemini Robotics 2 фокус сместился с хардкодинга конкретных задач на полную аппаратную независимость. Архитектура адаптируется к любому двурукому механизму за несколько часов. Алгоритмы берут на себя управление всей системой: от поддержания равновесия до сложной моторики пальцев вроде вкручивания лампочек.
Линейку разделили на три уровня под разные вычислительные сценарии. Базовая Gemini Robotics 2 конвертирует зрение и текст напрямую в команды для моторов. Версия ER 2 берет на себя пространственное мышление и долгосрочное планирование. За локальную работу на самом железе отвечает легковесная On-Device 2. Подобный стек позволяет механизмам взаимодействовать с незнакомыми объектами на лету, не требуя предварительного сбора датасетов под каждый новый предмет.
Главная архитектурная деталь скрыта в мультиагентном взаимодействии. Модели теперь умеют распределять задачи между разными типами роботов для закрытия единого сложного пайплайна. Интеграцию уже тестируют на железе Boston Dynamics и Apptronik. DeepMind фактически формирует стандартизированный слой управления физическим интеллектом, где обычный текст транслируется в точную кинематику гуманоидов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад