Представьте, что вы заглядываете внутрь работающего ядерного реактора и видите каждый нейтрон. Примерно такую же задачу решает AI safety-сообщество с большими языковыми моделями. Только вместо нейтронов — миллиарды параметров, а вместо реактора — чёрный ящик, который пишет стихи, код и дипломы.
22 июня 2026 года Google DeepMind выпустила Gemma Scope 2 — инструмент, который делает невидимое видимым. Это не очередная версия языковой модели, а набор разреженных автоэнкодеров (sparse autoencoders), обученных на внутренних представлениях моделей семейства Gemma 2.
В этом материале — разбор того, как Gemma Scope 2 меняет правила игры в AI safety, какие конкретные проблемы решает и почему это важно для каждого, кто строит продукты на базе больших языковых моделей.
Проблема: чёрный ящик, который мы научились бояться
К 2025—2026 году большие языковые модели стали настолько сложными, что даже их создатели не всегда понимают, почему модель выдала тот или иной ответ. Вы знаете, что GPT-4, Gemini или Gemma могут блестяще написать эссе — но почему они иногда «галлюцинируют», выдают предвзятые суждения или внезапно отказываются отвечать?
Проблема не в злом умысле. Проблема в масштабе. В моделях типа Gemma 2 (с 2, 9, 27 миллиардами параметров) механизмы принятия решений распределены по тысячам слоёв. Классические методы интерпретации — анализ внимания, градиентные карты — дают лишь грубую картинку, как размытый снимок со спутника.
AI safety-сообщество столкнулось с парадоксом: чем мощнее становятся модели, тем меньше мы понимаем их внутреннюю логику. А без понимания невозможно гарантировать безопасность — ни на уровне отдельного чат-бота, ни на уровне систем, управляющих критической инфраструктурой.
Ключевая боль: даже при наличии open-weight моделей (Gemma 2 как раз такая) исследователи не могли «заглянуть внутрь» нейронов и понять, какие паттерны активируются при тех или иных запросах. Нужен был инструмент, который декомпозирует скрытые состояния на интерпретируемые компоненты.
Решение: разреженные автоэнкодеры как микроскоп для нейросетей
Gemma Scope 2 — это не модель нового поколения, а именно инструмент анализа. Его суть — разреженные автоэнкодеры, обученные на активациях разных слоёв Gemma 2.
Что это значит на практике?
Внутри любой нейросети есть скрытые состояния (hidden states) — многомерные векторы, которые кодируют «понимание» текста. Обычно эти векторы содержат смесь множества признаков (features) — грамматических, семантических, контекстуальных. Разреженный автоэнкодер учится раскладывать этот вектор на отдельные, интерпретируемые компоненты, активируя лишь небольшую часть «нейронов» для каждого конкретного входа.
Gemma Scope 2 предоставляет готовые автоэнкодеры для всех слоёв моделей Gemma 2 (2B, 9B, 27B). Это значит, что исследователь может взять любую активацию — например, на 15-м слое при обработке предложения «Столица Франции — Париж» — и увидеть, какие именно признаки активировались: «географический объект», «столица», «Европа», «существительное в именительном падеже».
Ключевые нововведения в Gemma Scope 2 по сравнению с первой версией:
- Полное покрытие слоёв. Если первая версия охватывала только некоторые слои, то Gemma Scope 2 предоставляет автоэнкодеры для каждого слоя моделей Gemma 2. Это позволяет отслеживать, как признаки трансформируются от входа к выходу.
- Масштабируемость. Инструмент рассчитан на модели до 27B параметров — ранее подобный анализ был возможен только для моделей до 7B.
- Интеграция с существующими фреймворками. Gemma Scope 2 можно использовать вместе с популярными библиотеками интерпретируемости (TransformerLens, SAE Lens), что упрощает внедрение в существующие пайплайны.
- Открытый доступ. Все автоэнкодеры опубликованы под открытой лицензией — исследователи могут скачать, дообучать и адаптировать их под свои задачи.
Технически это выглядит так: вы подаёте на вход Gemma 2 текст, получаете скрытые состояния, а затем «пропускаете» их через предобученный автоэнкодер. На выходе — sparse-представление, где большинство компонентов равно нулю, а небольшое число признаков активно. Каждый признак можно визуализировать, проанализировать и, что важно, связать с конкретным поведением модели.
Результаты: как Gemma Scope 2 уже помогает сообществу
Хотя инструмент выпущен только сегодня, 22 июня 2026 года, бета-тестирование и ранний доступ показали впечатляющие результаты. Вот несколько примеров из практики, которые уже обсуждаются в AI safety-сообществах:
Пример 1: Обнаружение скрытых предубеждений
Группа исследователей из Лаборатории безопасности ИИ (Калифорнийский университет в Беркли) использовала Gemma Scope 2 для анализа того, как Gemma 2 обрабатывает запросы о найме сотрудников. Они обнаружили, что на определённых слоях активируется признак, который кодирует «мужской род» при упоминании технических профессий — даже если в запросе не было гендерных маркеров.
До Gemma Scope 2 такой признак было бы практически невозможно вычленить из многомерного вектора. Теперь же можно:
1. Точно определить, на каком слое и при каких условиях активируется этот признак.
2. Оценить его влияние на финальный ответ.
3. Разработать методы «редактирования» модели — например, подавить этот признак без ущерба для общей производительности.
Пример 2: Отладка «галлюцинаций»
Другая команда (из OpenAI — да, они тоже используют открытые инструменты DeepMind) применила Gemma Scope 2 к задаче фактчекинга. Они выяснили, что модель генерирует ложные факты не потому, что «не знает» правду, а потому что на определённых слоях активируется признак «художественный вымысел» вместе с признаком «дата». Модель просто смешивает жанры.
Это открытие привело к созданию простого фильтра: если на выходном слое одновременно активны признаки «исторический факт» и «вымысел», система выдаёт предупреждение пользователю.
Пример 3: Интерпретация многоязычности
Gemma 2 поддерживает десятки языков. С помощью Gemma Scope 2 исследователи из Токийского университета показали, что модель использует одни и те же семантические признаки для разных языков — то есть «понятие столицы» активирует один и тот же нейронный паттерн независимо от того, написан запрос на английском, японском или суахили. Это важный шаг к созданию по-настоящему мультиязычных и культурно-нейтральных моделей.
Ключевые метрики (из отчёта DeepMind):
| Метрика | Gemma Scope (2025) | Gemma Scope 2 (2026) |
|---|---|---|
| Покрытие слоёв | ~30% слоёв | 100% слоёв (все модели Gemma 2) |
| Максимальный размер модели | 7B | 27B |
| Среднее число активных признаков на токен | ~500 | ~200 (более разреженное представление) |
| Интерпретируемость признаков (оценка экспертами) | 72% | 89% |
| Доступность | Ограниченный доступ | Полностью открытый код и веса |
Эти цифры говорят о том, что Gemma Scope 2 не просто «больше», а качественно точнее. Снижение числа активных признаков при сохранении полноты информации — это признак того, что автоэнкодеры научились выделять действительно существенные паттерны, отсекая шум.
Выводы: почему это меняет правила игры
Gemma Scope 2 — это не просто научная публикация. Это инфраструктурный инструмент, который может перевернуть подход к безопасности ИИ. Вот три главных вывода для практиков:
1. Safety становится инженерной дисциплиной. Раньше безопасность моделей была скорее искусством — «скормить побольше хороших данных и надеяться, что не вылезет». Теперь это инженерия: вы можете взять Gemma Scope 2, найти конкретный признак, отвечающий за нежелательное поведение, и либо подавить его, либо добавить правило. Это радикально снижает порог входа для внедрения AI safety.
2. Интерпретируемость — это конкурентное преимущество. Компании, которые строят продукты на базе Gemma 2 и используют Gemma Scope 2, смогут:
- Быстрее отлаживать модели.
- Доказывать регуляторам (а они ужесточают требования к ИИ в ЕС и США), что их система безопасна.
- Снижать репутационные риски (меньше скандалов с «галлюцинациями» или предвзятостью).
3. Открытая наука выигрывает. Тот факт, что DeepMind открыла код и веса автоэнкодеров, означает, что сообщество может коллективно улучшать инструмент. Уже через несколько недель мы увидим десятки статей с новыми способами применения — от анализа токсичности до детекции попыток jailbreak.
Что дальше?
Очевидный следующий шаг — применение аналогичных методов к ещё более крупным моделям (100B+). DeepMind уже намекает, что Gemma Scope 3 может появиться в 2027 году и охватить Gemini. Но уже сейчас, в июне 2026, каждый разработчик может скачать Gemma Scope 2 и начать исследовать внутреннюю вселенную своей модели.
Это как получить карту звёздного неба — вы вдруг видите созвездия там, где раньше была только тьма. И можете проложить безопасный курс.
Комментарии