В научном сообществе разгорелась дискуссия вокруг вымышленного термина «vegetative electron microscopy» (вегетативная электронная микроскопия), который не имеет под собой никакой физической или биологической основы, однако присутствует как минимум в 22 рецензированных научных публикациях и, что более тревожно, устойчиво воспроизводится современными языковыми моделями. По данным Google Scholar, фантомный термин укоренился в англоязычном научном дискурсе настолько прочно, что автоматические системы проверки текста теперь используют его как один из маркеров сгенерированного нейросетями контента. История этого «призрака» в научной литературе началась задолго до эпохи машинного обучения — ещё в 1950-х годах, когда две статьи из журнала Bacteriological Reviews проходили процедуру оцифровки.
Как опечатка стала термином: рождение фантома в 1950-х
Механизм возникновения аномалии оказался предельно прост и характерен для ранней эпохи автоматического распознавания текста (OCR). При оцифровке двух статей из Bacteriological Reviews алгоритм случайно «сшил» слово «vegetative» из одной колонки с словом «electron» из соседней. В результате в цифровых базах данных появился комбинированный термин, которого в оригинальных печатных изданиях никогда не существовало. Десятилетиями этот артефакт оставался незамеченным: ни один исследователь не обратил внимания на странную фразу, поскольку она была погребена в оцифрованных архивах, к которым у научного сообщества был ограниченный доступ.
Персидский мост: как термин попал в международный оборот
Первое заметное «оживление» фантомного термина произошло в 2017 и 2019 годах, когда он начал появляться в англоязычных аннотациях иранских научных публикаций. Причиной стала тонкость персидского языка (фарси): слова, соответствующие русским «вегетативный» и «сканирующий», различаются всего одним диакритическим знаком. Мелкая ошибка машинного или даже человеческого перевода запустила фразу в международное научное обращение, после чего она начала копироваться из статьи в статью по классическому механизму цитирования. К настоящему моменту, по данным Google Scholar, бессмысленный термин зафиксирован как минимум в 22 научных работах, прошедших рецензирование.
Нейросети усвоили баг: результаты тестирования языковых моделей
Исследователи, обнаружившие аномалию, решили проверить, насколько глубоко она проникла в архитектуру современных ИИ-систем. Тестирование показало неоднозначную картину: при подаче фрагментов оригинальных статей в качестве контекста модель GPT-3 автоматически дополняла предложение фразой «vegetative electron microscopy», демонстрируя устойчивую склонность к воспроизведению фантомного термина. При этом более ранние системы — GPT-2 и BERT — подобной «памяти» не проявляли. Однако стойкость аномалии подтвердилась и в более новых поколениях моделей: как GPT-4o, так и Claude 3.5 от Anthropic также воспроизводят вымышленный термин в соответствующем контексте. Главным каналом «инфицирования» стал массивный открытый архив веб-данных Common Crawl, на котором обучается подавляющее большинство современных нейросетей: именно через него OCR-артефакт 1950-х годов оказался в обучающих выборках.
Противоречивые данные
В доступных источниках присутствует ряд нюансов, которые требуют осторожной интерпретации. Во-первых, точное количество публикаций, содержащих фантомный термин, указано как «не менее 22» — это нижняя граница по данным Google Scholar, а не исчерпывающая статистика; реальный охват может быть шире, особенно с учётом неиндексируемых репозиториев и предпечатных версий. Во-вторых, степень «заражённости» моделей неоднородна: если GPT-2 и BERT не воспроизводят термин, это не означает, что они не содержат его в своих эмбеддингах — возможно, порог активации для данных архитектур просто выше. В-третьих, точная реконструкция того, какие именно две статьи Bacteriological Reviews были оцифрованы с ошибкой и какой конкретно OCR-процесс использовался в 1950-х, основана на косвенных уликах и лингвистическом анализе, а не на прямых архивных документах того периода. Эти оговорки не ставят под сомнение сам факт существования аномалии, но указывают на то, что полная хронология и статистика её распространения могут быть уточнены по мере дополнительных исследований.
Системная уязвимость и призыв к прозрачности
Случай «vegetative electron microscopy» наглядно демонстрирует системную уязвимость ИИ-алгоритмов к накопленным за десятилетия ошибкам цифровизации. Пока автоматические инструменты проверки текста способны фиксировать лишь те аномалии, которые уже обнаружены человеком, цикл самовоспроизводства фейковых данных остаётся незакрытым. Специалисты призывают разработчиков нейросетей обеспечить открытость обучающих датасетов, чтобы научное сообщество могло аудировать источники «заражения», а издательства — усилить рецензирование на предмет фантомных терминов, унаследованных из оцифрованных архивов. Без таких мер, предупреждают исследователи, каждый новый OCR-баг или ошибка машинного перевода рискует стать ещё одним «призраком», который нейросети будут уверенно цитировать как устоявшееся научное понятие.