Как мы измеряли AI-тексты на arXiv и где измерения дают сбой: анализ методологии

Введение

В июле 2026 года команда разработчиков проекта Unslop опубликовала исследование, посвящённое измерению доли AI-сгенерированного текста в научных препринтах на платформе arXiv. Работа, доступная по адресу Источник, вызвала широкий резонанс в академическом сообществе, поскольку ставит под сомнение надёжность существующих методов детекции AI-текста. В статье рассматриваются как количественные оценки, так и фундаментальные ограничения инструментов, используемых для выявления синтетического контента.

Актуальность темы сложно переоценить: по данным самого arXiv, в 2025 году на платформу было загружено более 250 000 новых препринтов, что на 18% больше, чем в 2024 году. Рост объёмов публикаций сопровождается увеличением доли текстов, написанных или существенно доработанных с помощью больших языковых моделей (LLM), таких как GPT-4, Claude 3.5, Gemini Ultra и открытых аналогов вроде Llama 3.1. Однако точное измерение этой доли остаётся серьёзной методологической проблемой.

В этой статье мы подробно разберём методологию, использованную авторами исследования, выявим ключевые узкие места, где измерение даёт сбой, и обсудим, какие выводы можно сделать для академического сообщества и разработчиков систем детекции.

Методология измерения: как авторы подошли к задаче

Команда Unslop применила комбинированный подход, основанный на анализе статистических характеристик текста, а не на простом использовании готовых детекторов. Основной инструмент — классификатор, обученный на датасете из 50 000 примеров, где половина текстов была написана людьми (известные препринты до 2022 года), а половина — сгенерирована современными LLM. Классификатор анализировал такие признаки, как:

  • Перплексия (perplexity) — мера того, насколько модель «удивлена» текстом. Низкая перплексия характерна для AI-текстов, так как LLM генерируют последовательности с высокой вероятностью.
  • Бёрстность (burstiness) — вариативность длины предложений и абзацев. Человеческий текст обычно более неравномерен: короткие предложения чередуются с длинными, в то время как AI-тексты часто имеют более равномерную структуру.
  • Частота повторяющихся n-грамм — AI-модели склонны к повторению определённых фраз и конструкций, особенно при генерации длинных текстов.
  • Использование редких слов — люди чаще используют специфическую лексику и термины, которые LLM могут избегать из-за их низкой вероятности в тренировочных данных.

Авторы применили этот классификатор к случайной выборке из 10 000 препринтов, загруженных на arXiv в период с января 2025 по июнь 2026 года. Результаты показали, что от 12% до 18% текстов в выборке содержат признаки, характерные для AI-генерации. Однако, как отмечается в статье, эти цифры — лишь верхушка айсберга.

Где измерение даёт сбой: четыре ключевые проблемы

1. Проблема «серой зоны»: гибридные тексты

Наиболее существенный вызов — это тексты, которые не являются чисто AI-сгенерированными или человеческими, а представляют собой гибрид. Например, автор может написать черновик статьи, а затем использовать LLM для улучшения стиля, перефразирования отдельных абзацев или перевода. Классификатор, обученный на бинарном различении, не способен надёжно определить долю AI-участия в таких текстах.

В исследовании приводятся данные: при анализе 500 препринтов, где авторы добровольно указали использование AI-инструментов, классификатор показал точность лишь 73% — то есть в 27% случаев он ошибался, принимая гибридный текст за полностью человеческий или наоборот. Это означает, что реальная доля AI-контента может быть как выше (если учитывать необнаруженные гибриды), так и ниже (если часть «человеческих» текстов ошибочно помечена как AI).

2. Зависимость от домена и стиля

Модели классификации, обученные на одном типе текстов, часто показывают низкую обобщающую способность на других. В случае arXiv, где представлены тысячи различных научных дисциплин — от физики высоких энергий до когнитивной лингвистики — стиль письма сильно варьируется. Тексты по математике, например, часто содержат большое количество формул и коротких утверждений, что может ошибочно интерпретироваться классификатором как AI-генерация (из-за низкой перплексии).

Авторы тестировали свой классификатор отдельно для подборок по физике, биологии и computer science. Результаты показали разброс точности от 68% (для физики) до 89% (для computer science). Это говорит о том, что единый порог детекции не работает: то, что для одной дисциплины является нормой, для другой — аномалией.

3. Эволюция LLM и «гонка вооружений»

Методы детекции AI-текста сталкиваются с проблемой устаревания. Современные LLM (2025–2026 годов) генерируют тексты, которые по статистическим характеристикам всё ближе к человеческим. Например, модели с архитектурой на основе mixture-of-experts (MoE), такие как Mixtral 8x22B или GPT-4o, специально оптимизируются для снижения перплексии и увеличения бёрстности, чтобы имитировать человеческое письмо.

В статье отмечается, что классификатор, обученный на данных 2024 года, показывает точность 91% на тестовой выборке того же периода, но всего 76% на текстах, сгенерированных моделями середины 2026 года. Это означает, что любые статические детекторы быстро теряют актуальность, и для поддержания точности требуется постоянное переобучение на новых данных.

4. Ложные срабатывания и проблема «чистого» человеческого текста

Обратная сторона медали — ложные срабатывания, когда человеческий текст ошибочно маркируется как AI-сгенерированный. В академической среде это особенно опасно, так как может привести к необоснованным обвинениям в недобросовестности. Авторы исследования приводят пример: препринт по теоретической физике, написанный известным учёным в 2023 году (до широкого распространения LLM), был классифицирован как AI-текст с вероятностью 89%. Причина — в тексте использовалась необычно однородная структура предложений и низкая вариативность лексики, что характерно для некоторых научных жанров.

Такие ложные срабатывания подрывают доверие к любым автоматическим системам детекции. В реальной практике, как отмечается в статье, доля ложных срабатываний может достигать 5-8% в зависимости от предметной области и используемого классификатора.

Таблица: Сравнение точности классификатора по дисциплинам

Дисциплина Точность (%) Полнота (%) F1-мера Доля ложных срабатываний (%)
Computer Science 89 84 86.4 4.2
Биология 82 79 80.4 6.1
Физика 68 65 66.5 8.7
Математика 71 68 69.5 7.3
Медицина 85 81 83.0 5.0

Данные из исследования Unslop, основанные на выборке из 10 000 препринтов.

Практические последствия для научного сообщества

Для редакторов и рецензентов

Результаты исследования показывают, что полагаться исключительно на автоматические детекторы AI-текста при рецензировании нельзя. Рекомендуется использовать их только как вспомогательный инструмент, а окончательное решение оставлять за человеком. Кроме того, журналы и конференции должны разрабатывать чёткие политики в отношении использования AI, включая обязательное декларирование таких инструментов.

Для разработчиков детекторов

Авторы статьи подчёркивают необходимость создания адаптивных систем, которые могут обновляться по мере появления новых моделей. Один из предложенных подходов — использование ансамбля классификаторов, каждый из которых обучен на данных определённого временного периода или предметной области. Также предлагается внедрять методы обнаружения «стилистических сигнатур» — например, анализ того, как модель обрабатывает редкие термины или цитаты.

Для авторов научных работ

Исследователи, использующие AI-инструменты, должны быть готовы к тому, что их тексты могут быть ошибочно маркированы. Рекомендуется сохранять черновики и версии статьи, чтобы при необходимости доказать авторство. Также стоит избегать слепого копирования AI-генерированного текста — лучше перерабатывать его, добавляя уникальные формулировки и ссылки.

Будущее измерений AI-текста: куда движется технология

В заключительной части статьи авторы обсуждают перспективные направления. Одно из них — использование watermarking (водяных знаков) на уровне моделей, когда LLM встраивают в генерируемый текст невидимые для человека паттерны, которые можно детектировать программно. Однако этот подход требует сотрудничества разработчиков моделей и пока не получил широкого распространения.

Другое направление — анализ не только текста, но и метаданных: времени набора, истории изменений, использования специфических инструментов. Например, если в PDF-файле сохраняется информация о том, что он был создан с помощью AI-ассистента, это может служить дополнительным индикатором.

Авторы признают, что идеального решения пока не существует. Измерение AI-текста — это задача, которая по сложности сопоставима с самой задачей создания реалистичного текста. И, как показывает история с arXiv, любые статические методы детекции будут отставать от развития LLM.

Заключение

Исследование, проведённое командой Unslop, является важным вкладом в понимание ограничений современных методов детекции AI-текста. Основной вывод — ни один автоматический инструмент не может гарантировать 100% точность, особенно в условиях разнообразия научных дисциплин и быстрой эволюции языковых моделей. Доля AI-текстов на arXiv, оценённая в 12–18%, скорее всего, занижена из-за гибридных работ и проблем с обобщением классификаторов.

Для академического сообщества это означает необходимость разработки более тонких и адаптивных подходов, а также пересмотра политик в отношении использования AI. Пока же авторам и рецензентам стоит сохранять критическое мышление и не полагаться слепо на цифры, полученные автоматическими системами. Полный текст исследования доступен на сайте проекта: Источник.

← Все статьи

Комментарии

Читайте также

Опыт моего общения с «близняшками»: что скрывает ИИ Gemini от Google

21 июля 2026

YouTube против AI-мусора: новые правила платформы и их влияние на контент в 2026 году

21 июля 2026

15 промтов для Docker: от Dockerfile до multi-stage сборок и оптимизации образов

21 июля 2026

Я построил приложение и несколько навыков: скорость разработки удвоилась, расход токенов сократился вдвое

21 июля 2026

12 промтов для CI/CD: GitHub Actions, GitLab CI и ArgoCD

21 июля 2026

От кода к управлению: Почему автономные системы и робототехника (ROS 2, SLAM, компьютерное зрение) — это смена карьеры, которая вам нужна в 2026 году

21 июля 2026

ПБО/ФТ — Сотрудник по комплаенсу: ИИ-курс, формирующий экспертов по комплаенсу завтрашнего дня

21 июля 2026

Криптотрейдинг, DeFi и Web3-инвестиции: как освоить рынок с нуля с помощью AI-обучения на Asibiont

21 июля 2026

Executive MBA / DBA — стратегическое управление бизнесом: AI-революция в обучении CEO, которая заменит Harvard

21 июля 2026