Исследователи создали уникальную языковую модель Talkie, которая «застряла» в 1930 году. Этот проект представляет собой цифровую капсулу времени, поскольку искусственный интеллект не имеет ни малейшего представления о событиях, технологиях и исторических поворотах, произошедших после 31 декабря 1930 года. Для обучения модели использовались исключительно тексты, находящиеся в общественном достоянии, что позволило полностью изолировать ИИ от информации XX и XXI веков. Выбор столь необычной временной отсечки обусловлен юридическими нормами США, согласно которым произведения переходят в общественное достояние по истечении 95 лет.

Предыстория и технические особенности эксперимента

Создание модели Talkie потребовало колоссальных ресурсов. Обучающий датасет эквивалентен примерно 234 миллиардам страниц текстов на английском языке, оцифрованных с помощью современных систем оптического распознавания символов (OCR). Главным вызовом для авторов проекта была защита от «загрязнения» базы данных: попадание в систему хотя бы одного документа, созданного после 1930 года, могло безвозвратно испортить чистоту эксперимента. Ученые стремились получить чистого цифрового собеседника, чье мировоззрение сформировано исключительно на литературе начала XX века и более ранних эпох.

В ходе масштабных испытаний исследователи проверили реакцию ИИ на 5 000 ключевых исторических вех, оставшихся для него в будущем. Модель оказалась совершенно неспособна предсказать глобальные конфликты, включая Вторую мировую войну или приход нацистов к власти. Более того, когда боту рассказывали о современных технологиях, его реакция была наполнена неподдельным технологическим шоком: Talkie никогда не слышал об интернете, смартфонах, телевидении или космической гонке, воспринимая подобные концепты как нечто фантастическое.

Противоречивые данные

Несмотря на строгую изоляцию от современной информации, в ходе экспериментов с моделью выявились интересные когнитивные парадоксы. С одной стороны, исследователи отмечают абсолютную чистоту исторического контекста и неспособность бота предвидеть технологический прогресс. С другой стороны, скептики и эксперты по безопасности задаются вопросом о границах «юридической чистоты» датасетов: критики утверждают, что в огромном массиве данных объемом в 234 миллиарда страниц все же могли сохраниться скрытые анахронизмы или косвенные указания на будущие открытия, которые модель интерпретирует через сложные языковые аналогии, создавая иллюзию подлинного мышления человека 1930-х годов.

Необычные способности и практическая польза

Одним из самых поразительных результатов стал эксперимент с программированием. Когда боту предложили написать код на языке Python, созданном в 1991 году, алгоритм, никогда в жизни не видевший компьютеров и не знающий самого слова «компьютер», смог сгенерировать синтаксически правдоподобный код, используя глубокие языковые аналогии. В другом эксперименте модель обучили на материалах до 1911 года и проверили, способна ли она самостоятельно вывести общую теорию относительности, подобно Альберту Эйнштейну в 1915 году. В настоящее время бот доступен для публичного общения в сети, где ученые и энтузиасты могут наблюдать за его дискуссиями, несмотря на склонность ИИ к классическим «галлюцинациям» и выдумыванию несуществующих фактов из прошлого.