Дослідники створили унікальну мовну модель Talkie, яка «застрягла» у 1930 році. Цей проєкт є цифровою капсулою часу, оскільки штучний інтелект не має жодного уявлення про події, технології та історичні повороти, що сталися після 31 грудня 1930 року. Для навчання моделі використовувалися виключно тексти, що перебувають у суспільному надбанні, що дозволило повністю ізолювати ШІ від інформації XX та XXI століть. Вибір настільки незвичного часового рубежу зумовлений юридичними нормами США, згідно з якими твори переходять у суспільне надбання після закінчення 95 років.

Передісторія та технічні особливості експерименту

Створення моделі Talkie зажадало колосальних ресурсів. Навчальний датасет еквивалентний приблизно 234 мільярдам сторінок текстів англійською мовою, оцифрованих за допомогою сучасних систем оптичного розпізнавання символів (OCR). Головним викликом для авторів проєкту був захист від «забруднення» бази даних: потрапляння в систему хоча б одного документа, створеного після 1930 року, могло безповоротно зіпсувати чистоту експерименту. Вчені прагнули отримати чистого цифрового співрозмовника, чий світогляд сформований виключно на літературі початку XX століття та попередніх епох.

Під час масштабних випробувань дослідники перевірили реакцію ШІ на 5 000 ключових історичних віх, що залишилися для нього в майбутньому. Модель виявилася абсолютно нездатною передбачити глобальні конфлікти, включаючи Другу світову війну або прихід нацистів до влади. Більше того, коли боту розповідали про сучасні технології, його реакція була наповнена непіддельним технологічним шоком: Talkie ніколи не чув про інтернет, смартфони, телебачення чи космічну гонку, сприймаючи подібні концепти як щось фантастичне.

Суперечливі дані

Незважаючи на сувору ізоляцію від сучасної інформації, під час експериментів з моделлю виявилися цікаві когнітивні парадокси. З одного боку, дослідники відзначають абсолютну чистоту історичного контексту та нездатність бота передбачити технологічний прогрес. З іншого боку, скептики та експерти з безпеки ставлять питання про межі «юридичної чистоти» датасетів: критики стверджують, що в величезному масиві даних обсягом у 234 мільярди сторінок все ж таки могли зберегтися приховані анахронізми або непрямі вказівки на майбутні відкриття, які модель інтерпретує через складні мовні аналогії, створюючи ілюзію справжнього мислення людини 1930-х років.

Незвичні здібності та практична користь

Одним із найяскравіших результатів став експеримент із програмуванням. Коли боту запропонували написати код мовою Python, створеною в 1991 році, алгоритм, який ніколи в житті не бачив комп'ютерів і не знає самого слова «комп'ютер», зміг згенерувати синтаксично правдоподібний код, використовуючи глибокі мовні аналогії. В іншому експерименті модель навчили на матеріалах до 1911 року і перевірили, чи здатна вона самостійно вивести загальну теорію відносності, подібно до Альберта Ейнштейна в 1915 році. Наразі бот доступний для публічного спілкування в мережі, де вчені та ентузіасти можуть спостерігати за його дискусіями, незважаючи на схильність ШІ до класичних «галюцинацій» та вигадування неіснуючих фактів із минулого.