Введение
В июле 2026 года команда разработчиков проекта Unslop опубликовала исследование, посвящённое измерению доли AI-сгенерированного текста в научных препринтах на платформе arXiv. Работа, доступная по адресу Источник, вызвала широкий резонанс в академическом сообществе, поскольку ставит под сомнение надёжность существующих методов детекции AI-текста. В статье рассматриваются как количественные оценки, так и фундаментальные ограничения инструментов, используемых для выявления синтетического контента.
Актуальность темы сложно переоценить: по данным самого arXiv, в 2025 году на платформу было загружено более 250 000 новых препринтов, что на 18% больше, чем в 2024 году. Рост объёмов публикаций сопровождается увеличением доли текстов, написанных или существенно доработанных с помощью больших языковых моделей (LLM), таких как GPT-4, Claude 3.5, Gemini Ultra и открытых аналогов вроде Llama 3.1. Однако точное измерение этой доли остаётся серьёзной методологической проблемой.
В этой статье мы подробно разберём методологию, использованную авторами исследования, выявим ключевые узкие места, где измерение даёт сбой, и обсудим, какие выводы можно сделать для академического сообщества и разработчиков систем детекции.
Методология измерения: как авторы подошли к задаче
Команда Unslop применила комбинированный подход, основанный на анализе статистических характеристик текста, а не на простом использовании готовых детекторов. Основной инструмент — классификатор, обученный на датасете из 50 000 примеров, где половина текстов была написана людьми (известные препринты до 2022 года), а половина — сгенерирована современными LLM. Классификатор анализировал такие признаки, как:
- Перплексия (perplexity) — мера того, насколько модель «удивлена» текстом. Низкая перплексия характерна для AI-текстов, так как LLM генерируют последовательности с высокой вероятностью.
- Бёрстность (burstiness) — вариативность длины предложений и абзацев. Человеческий текст обычно более неравномерен: короткие предложения чередуются с длинными, в то время как AI-тексты часто имеют более равномерную структуру.
- Частота повторяющихся n-грамм — AI-модели склонны к повторению определённых фраз и конструкций, особенно при генерации длинных текстов.
- Использование редких слов — люди чаще используют специфическую лексику и термины, которые LLM могут избегать из-за их низкой вероятности в тренировочных данных.
Авторы применили этот классификатор к случайной выборке из 10 000 препринтов, загруженных на arXiv в период с января 2025 по июнь 2026 года. Результаты показали, что от 12% до 18% текстов в выборке содержат признаки, характерные для AI-генерации. Однако, как отмечается в статье, эти цифры — лишь верхушка айсберга.
Где измерение даёт сбой: четыре ключевые проблемы
1. Проблема «серой зоны»: гибридные тексты
Наиболее существенный вызов — это тексты, которые не являются чисто AI-сгенерированными или человеческими, а представляют собой гибрид. Например, автор может написать черновик статьи, а затем использовать LLM для улучшения стиля, перефразирования отдельных абзацев или перевода. Классификатор, обученный на бинарном различении, не способен надёжно определить долю AI-участия в таких текстах.
В исследовании приводятся данные: при анализе 500 препринтов, где авторы добровольно указали использование AI-инструментов, классификатор показал точность лишь 73% — то есть в 27% случаев он ошибался, принимая гибридный текст за полностью человеческий или наоборот. Это означает, что реальная доля AI-контента может быть как выше (если учитывать необнаруженные гибриды), так и ниже (если часть «человеческих» текстов ошибочно помечена как AI).
2. Зависимость от домена и стиля
Модели классификации, обученные на одном типе текстов, часто показывают низкую обобщающую способность на других. В случае arXiv, где представлены тысячи различных научных дисциплин — от физики высоких энергий до когнитивной лингвистики — стиль письма сильно варьируется. Тексты по математике, например, часто содержат большое количество формул и коротких утверждений, что может ошибочно интерпретироваться классификатором как AI-генерация (из-за низкой перплексии).
Авторы тестировали свой классификатор отдельно для подборок по физике, биологии и computer science. Результаты показали разброс точности от 68% (для физики) до 89% (для computer science). Это говорит о том, что единый порог детекции не работает: то, что для одной дисциплины является нормой, для другой — аномалией.
3. Эволюция LLM и «гонка вооружений»
Методы детекции AI-текста сталкиваются с проблемой устаревания. Современные LLM (2025–2026 годов) генерируют тексты, которые по статистическим характеристикам всё ближе к человеческим. Например, модели с архитектурой на основе mixture-of-experts (MoE), такие как Mixtral 8x22B или GPT-4o, специально оптимизируются для снижения перплексии и увеличения бёрстности, чтобы имитировать человеческое письмо.
В статье отмечается, что классификатор, обученный на данных 2024 года, показывает точность 91% на тестовой выборке того же периода, но всего 76% на текстах, сгенерированных моделями середины 2026 года. Это означает, что любые статические детекторы быстро теряют актуальность, и для поддержания точности требуется постоянное переобучение на новых данных.
4. Ложные срабатывания и проблема «чистого» человеческого текста
Обратная сторона медали — ложные срабатывания, когда человеческий текст ошибочно маркируется как AI-сгенерированный. В академической среде это особенно опасно, так как может привести к необоснованным обвинениям в недобросовестности. Авторы исследования приводят пример: препринт по теоретической физике, написанный известным учёным в 2023 году (до широкого распространения LLM), был классифицирован как AI-текст с вероятностью 89%. Причина — в тексте использовалась необычно однородная структура предложений и низкая вариативность лексики, что характерно для некоторых научных жанров.
Такие ложные срабатывания подрывают доверие к любым автоматическим системам детекции. В реальной практике, как отмечается в статье, доля ложных срабатываний может достигать 5-8% в зависимости от предметной области и используемого классификатора.
Таблица: Сравнение точности классификатора по дисциплинам
| Дисциплина | Точность (%) | Полнота (%) | F1-мера | Доля ложных срабатываний (%) |
|---|---|---|---|---|
| Computer Science | 89 | 84 | 86.4 | 4.2 |
| Биология | 82 | 79 | 80.4 | 6.1 |
| Физика | 68 | 65 | 66.5 | 8.7 |
| Математика | 71 | 68 | 69.5 | 7.3 |
| Медицина | 85 | 81 | 83.0 | 5.0 |
Данные из исследования Unslop, основанные на выборке из 10 000 препринтов.
Практические последствия для научного сообщества
Для редакторов и рецензентов
Результаты исследования показывают, что полагаться исключительно на автоматические детекторы AI-текста при рецензировании нельзя. Рекомендуется использовать их только как вспомогательный инструмент, а окончательное решение оставлять за человеком. Кроме того, журналы и конференции должны разрабатывать чёткие политики в отношении использования AI, включая обязательное декларирование таких инструментов.
Для разработчиков детекторов
Авторы статьи подчёркивают необходимость создания адаптивных систем, которые могут обновляться по мере появления новых моделей. Один из предложенных подходов — использование ансамбля классификаторов, каждый из которых обучен на данных определённого временного периода или предметной области. Также предлагается внедрять методы обнаружения «стилистических сигнатур» — например, анализ того, как модель обрабатывает редкие термины или цитаты.
Для авторов научных работ
Исследователи, использующие AI-инструменты, должны быть готовы к тому, что их тексты могут быть ошибочно маркированы. Рекомендуется сохранять черновики и версии статьи, чтобы при необходимости доказать авторство. Также стоит избегать слепого копирования AI-генерированного текста — лучше перерабатывать его, добавляя уникальные формулировки и ссылки.
Будущее измерений AI-текста: куда движется технология
В заключительной части статьи авторы обсуждают перспективные направления. Одно из них — использование watermarking (водяных знаков) на уровне моделей, когда LLM встраивают в генерируемый текст невидимые для человека паттерны, которые можно детектировать программно. Однако этот подход требует сотрудничества разработчиков моделей и пока не получил широкого распространения.
Другое направление — анализ не только текста, но и метаданных: времени набора, истории изменений, использования специфических инструментов. Например, если в PDF-файле сохраняется информация о том, что он был создан с помощью AI-ассистента, это может служить дополнительным индикатором.
Авторы признают, что идеального решения пока не существует. Измерение AI-текста — это задача, которая по сложности сопоставима с самой задачей создания реалистичного текста. И, как показывает история с arXiv, любые статические методы детекции будут отставать от развития LLM.
Заключение
Исследование, проведённое командой Unslop, является важным вкладом в понимание ограничений современных методов детекции AI-текста. Основной вывод — ни один автоматический инструмент не может гарантировать 100% точность, особенно в условиях разнообразия научных дисциплин и быстрой эволюции языковых моделей. Доля AI-текстов на arXiv, оценённая в 12–18%, скорее всего, занижена из-за гибридных работ и проблем с обобщением классификаторов.
Для академического сообщества это означает необходимость разработки более тонких и адаптивных подходов, а также пересмотра политик в отношении использования AI. Пока же авторам и рецензентам стоит сохранять критическое мышление и не полагаться слепо на цифры, полученные автоматическими системами. Полный текст исследования доступен на сайте проекта: Источник.
Комментарии