Компанія Google DeepMind офіційно анонсувала вихід нового покоління штучного інтелекту для робототехніки — сімейства моделей Gemini Robotics 2. Це оновлення означає перехід від простих автоматизованих рухів до складних когнітивних процесів у фізичному світі. Розробники називають цю технологію «фізичним AGI» (загальним штучним інтелектом), головною метою якого є створення універсального робота, здатного виконувати широкий спектр побутових та виробничих завдань.
«Утілене мислення» та робота в реальному часі
Ключовою нововведенням стала модель Gemini Robotics ER 2, яка відповідає за функцію «утіленого мислення» (embodied reasoning). Алгоритм здатний аналізувати відеопотік з камер робота в режимі реального часу, інтегруючись з Gemini Live API. Це дозволяє машинам відстежувати хід виконання завдань покроково та самостійно коригувати помилки без необхідності перезавантаження всього процесу.
За словами розробників, якщо робот випадково впаде предмет, система миттєво відкоригує рух, а не почне дію знову. Точність визначення ключових моментів дій досягла майже 90 відсотків. Це дозволяє роботу розуміти нюанси, наприклад, точно визначити момент, коли потрібно перестати наливати каву в чашку, щоб не розлити рідину.
Покращена координація та командна робота
Модель Gemini Robotics 2 трансформує текстові та візуальні команди в безпосередні рухи механічних кінцівок. Значний прогрес було досягнуто в управлінні складними гуманоїдними руками з багатьма пальцями: нова версія системи забезпечила безпрецедентну точність та координацію.
Особливу увагу приділено здатності роботів до взаємодії. Під час тестування моделі Apollo 2 та Franka F3 Duo продемонстрували вміння спільно виконувати завдання, не заважаючи одне одному та ефективно розподіляючи ролі в команді.
Автономність та швидка адаптація
Для забезпечення роботи в умовах відсутності інтернету була представлена спрощена версія — Gemini Robotics On-Device 2. Вона здатна функціонувати локально, безпосередньо на пристрої, без підключення до хмарних серверів.
Система відрізняється високою швидкістю навчання. Алгоритм адаптується до нової конструкції робота всього за кілька годин тренувань або на основі аналізу всього 200 прикладів. На даний момент технології вже проходять тестування на обладнанні компанії Boston Dynamics.
Безпека та захист від галюцинацій
Розробники врахували ризики, пов'язані з помилками ШІ, та впровадили спеціальні рівні захисту від «галюцинацій» та хибних дій. Разом із релізом було представлено новий бенчмарк безпеки під назвою ASIMOV-Agentic. Модель ER 2 демонструє високу здатність розпізнавати потенційну небезпеку та зупиняти рух, якщо людина наближається занадто близько до робочої зони.
Разом із технічними характеристиками Google опублікувала та цінову політику нової розробки, відкриваючи шлях до комерційного впровадження цих технологій.