Древняя опечатка инфицировала нейросети: как это возможно

3 Мин Чтения

19:12 09.09.2026 Ср 2 мин Как обычная ошибка запутала ученых?

Бессмысленная фраза из прошлого подрывает науку (фото: Magnific) Не трать время на шум! Читай только суть из РБК-Украина в Google

Ученые обнаружили десятки рецензированных работ с полностью вымышленным термином, которого нет в научном дискурсе. Он возник из-за ошибок автоматического распознавания текста и машинного перевода, а затем попал в базы данных, из которых учится ИИ.

Об этом информирует РБК-Украина со ссылкой на Futura.

Призрачный термин: от опечатки 1950-х до Ирана

Все началось еще в 1950-х годах, когда оцифровывали две статьи из журнала Bacteriological Reviews.

Из-за ошибки при автоматическом распознавании текста слово «vegetative» из одной колонки случайно соединилось со словом «electron» из соседней — так в базах данных появился вымышленный термин, которого на самом деле не существует.

Десятилетиями фантом оставался незамеченным, пока в 2017 и 2019 годах не вынырнул в англоязычных аннотациях иранских научных публикаций.

Причиной послужила ошибка перевода: в персидском языке (фарсе) слова «вегетативный» и «сканирующий» отличаются лишь одним диакритическим знаком. Мелкая ошибка запустила фразеологизм в международное научное обращение.

Читайте больше: В Украине запустили собственный ChatGPT: как работает чат-бот Lapathoniia

«Инфицирование» ИИ-моделей

По данным Google Scholar, бессмысленный термин оказался, по меньшей мере, в 22 научных публикациях.

Ученые решили проверить, усвоили ли этот баг языковые модели.

Так, при тестировании с фрагментами оригинальных статей GPT-3 автоматически дополняла предложение фразой «vegetative electron microscopy», тогда как более старые системы типа GPT-2 или BERT подобной склонности не имели.

Свою стойкость аномалия демонстрирует и в более новых версиях — GPT-4o и Claude 3.5 от Anthropic.

Главным источником «инфицирования» стал массивный открытый архив веб-данных Common Crawl, на котором обучают большинство современных нейросетей.

Больше интересного: ИИ-галюцинации уничтожили важное исследование: фейки попали в ChatGPT и Gemini

Почему «цифровые окаменелости» опасны для науки?

Случай показывает, насколько уязвимы ИИ-алгоритмы к систематическим ошибкам прошлого.

Автоматические инструменты проверки текста теперь маркируют фразу «vegetative electron microscopy» как маркер сгенерированного ИИ-контента.

Со всем тем, подобные системы способны фиксировать только те ошибки, которые уже обнаружены человеком.

Для сохранения чистоты научных наработок специалисты призывают разработчиков ИИ открыть учебные датасеты, а научные издательства — усилить рецензирование, чтобы предотвратить самовоспроизводство и укоренение фейковых данных в цифровом пространстве.

Поделиться этой статьей