Навчання роботів роботі в реальному середовищі — це завдання, яке десятиліттями викликало складнощі у інженерів. Основна проблема полягала в тому, що роботи часто буквально сприймали інструкції, пропускаючи контекст та приховані наміри людини. Якщо попросити робота поставити чашку кави на стіл під час відеодзвінка, він може поставити її занадто близько до ноутбука або підійти занадто близько, порушивши тишу. Але тепер дослідники з Массачусетського технологічного інституту (MIT) знайшли спосіб навчити машини «читати між рядків».

Дві моделі — один результат

Команда з Лабораторії комп'ютерних наук та штучного інтелекту (CSAIL) розробила метод, який отримав назву Masked Inverse Reinforcement Learning (Masked IRL). Його суть полягає у використанні двох великих мовних моделей, кожна з яких виконує свою функцію.

Перша модель займається уточненням неоднозначних інструкцій. Наприклад, якщо користувач каже «залишатися близько», система інтерпретує це не як «прилягти до людини», а як «підійти ближче до поверхні столу». Друга модель аналізує оточення, виділяючи важливі деталі та відсіюючи зайві. Так, той факт, що інструктор спирається на стіл під час демонстрації, буде проігноровано, оскільки він не впливає на виконання завдання.

Ефективність у цифрах

Результати тестів вражають: новий метод скоротив обсяг необхідних даних для навчання майже в п'ять разів. При цьому роботи стали на 15% ефективнішими у визначенні невисловлених уподобань користувачів порівняно з попередніми алгоритмами.

У симуляціях роботи швидко опановували складні завдання, такі як переміщення чашки навколо ноутбука або витирання столу з дотриманням контакту з поверхнею. У реальних умовах після приблизно 50 демонстрацій робот вже міг самостійно виконувати дії, уникаючи зіткнень з об'єктами, про які йому явно не повідомляли.

Як це працює на практиці

Навчання відбувається через кінестетичну демонстрацію — метод, за допомогою якого людина буквально «веде» робота за руки, показуючи, як правильно виконувати рухи. Датчики фіксують процес, а мовні моделі аналізують логіку дій та оточуюче середовище.

За словами Мін'єн Хвана, аспіранта MIT та ведучого автора дослідження, мета команди — мінімізувати зусилля людини при керуванні роботами. «Ми хотіли, щоб роботи розуміли, чого насправді хочуть користувачі, навіть якщо вони не можуть повністю виразити це вербально», — зазначив він.

Де це застосовується?

Технологія Masked IRL особливо актуальна для ситуацій, де люди очікують, що робот «сам все зрозуміє». Наприклад, на кухні робот може шукати закуски, але повинен знати, що не можна зачіпати ноутбук на столі. На виробництві робот, що переміщує товари, повинен обходити полиці та обладнання, навіть якщо оператор не вказував це явно.

Система вже показала здатність адаптуватися до нових завдань, з якими робот не стикався під час навчання. Це відкриває перспективи для широкого впровадження подібних рішень у побуті, медицині, логістиці та промисловості.