Рост ИИ повышает спрос на память: как индустрия хранилищ отвечает на вызов

Современные языковые модели требуют всё больше вычислительных ресурсов, и одним из ключевых ограничений становится память. Пока индустрия наращивает объёмы GPU и ускорителей, подсистема хранения данных — то, что находится «за чипом», — зачастую остаётся узким местом. В свежем материале NVIDIA поднимается именно эта тема: с ростом требований ИИ к памяти, хранилища вынуждены эволюционировать, чтобы не тормозить обучение и вывод моделей. Источник

Сегодня мы разберём, почему классическая трёхуровневая иерархия «регистры → кэш → DRAM» уже не справляется, как новые типы памяти и протоколы хранения меняют ландшафт, и что это значит для инженеров, исследователей и компаний, внедряющих ИИ.

ИИ-модели становятся больше: почему прежних мощностей не хватает

Параметры моделей растут экспоненциально. GPT-3 в 2020 году имела 175 миллиардов параметров, а уже к середине 2020-х годов появились модели с триллионом параметров. Обучение такой модели требует не только огромного количества GPU, но и способности быстро перекачивать гигабайты данных из хранилища в память. Даже вывод (inference) для больших языковых моделей требует удержания весов в быстрой памяти, а это десятки и сотни гигабайт.

Традиционный подход — всё доставить в RAM, а затем в VRAM GPU. Но когда модель не помещается в память одного устройства, приходится использовать техники типа пайплайнинга, тензорного параллелизма или offloading. И здесь ключевую роль играет скорость подсистемы хранения: если нужно быстро загрузить веса или сохранить чекпоинт, от пропускной способности и задержек хранилища зависит, насколько эффективно используются дорогие GPU.

Иерархия памяти в ИИ-системах: от HBM до NVMe

Чтобы понять, какие требования предъявляет ИИ к памяти, полезно взглянуть на современную иерархию. На самом верху — видеопамять HBM (High Bandwidth Memory), установленная на GPU. Она очень быстрая (пропускная способность 1–4 ТБ/с), но и очень дорогая. Ниже — обычная DRAM (например, DDR5), которая используется в серверах и рабочих станциях. Ещё ниже — хранилище: твёрдотельные накопители (NVMe SSD) и жёсткие диски.

Модель, которая не умещается в HBM, может частично размещаться в DRAM, а если и этого мало — в SSD. Но задержки при этом возрастают с десятков наносекунд до микросекунд и даже миллисекунд. В результате возникает необходимость в новых решениях: например, в использовании Storage Class Memory (SCM) — типа памяти, которая сочетает скорость DRAM с энергонезависимостью SSD. Хотя Intel Optane, ранний представитель SCM, был снят с производства, идеи живут дальше: появляются аналоги на базе новых материалов.

Главные проблемы: загрузка данных и контрольные точки

При обучении больших моделей есть два сценария, где хранилище становится критически важным.

Первый — загрузка данных. Даже если весь датасет не помещается в память, нужно быстро подавать данные в GPU. В конвейерах обучения данные часто читаются прямо с SSD, и медленный диск сведёт на нет всё преимущество мощного GPU. Поэтому используются такие технологии, как GPUDirect Storage (GDS) — они позволяют передавать данные с NVMe SSD напрямую в память GPU, минуя CPU и дополнительное копирование.

Второй сценарий — сохранение контрольных точек (checkpointing). При обучении больших моделей каждые несколько часов (или даже чаще) сохраняется состояние модели, чтобы в случае сбоя не потерять прогресс. Для модели на 1 триллион параметров чекпоинт может занимать несколько терабайт. Сохранить его на медленное хранилище — значит, надолго остановить обучение. Поэтому индустрия движется к созданию сверхбыстрых систем хранения, способных работать с пропускной способностью в десятки и сотни гигабайт в секунду.

Как индустрия хранилищ отвечает на новые требования

В материале NVIDIA подчёркивается, что просто увеличить объём дисков недостаточно. Нужны комплексные решения, включающие новые протоколы передачи данных, смарт-контроллеры, интеллектуальные планировщики ввода-вывода и даже обработку прямо в хранилище.

Вот несколько направлений, которые активно развиваются:

  • NVMe over Fabrics (NVMe-oF) — протокол, позволяющий обращаться к SSD по сети с задержкой в микросекундах, как к локальным дискам. Это делает возможным построение распределённых хранилищ, которые не уступают в скорости локальным накопителям.
  • Вычислительное хранение (Computational Storage) — размещение процессоров прямо в SSD, чтобы выполнять часть операций (например, фильтрацию или агрегацию) внутри накопителя, не загружая CPU. Это особенно полезно для обработки больших данных перед подачей в ИИ-модель.
  • Иерархическое управление хранилищем (Tiering) — автоматическое перемещение данных между быстрыми NVMe, более медленными но ёмкими SATA SSD и дешёвыми HDD. Алгоритмы машинного обучения могут предсказывать, какие данные понадобятся раньше, и заранее размещать их на быстрых носителях.
  • Метаданные и индексация в памяти — для распределённых файловых систем используются in-memory метаданные, чтобы ускорить поиск файлов по всему кластеру.

Особое место занимает программное обеспечение для управления хранилищем. Например, NVIDIA Magnum IO — набор библиотек и технологий для оптимизации ввода-вывода в ИИ-приложениях. Он включает в себя реализацию GPUDirect Storage, поддержку NVMe-oF и другие модули, которые позволяют выжать максимум из оборудования.

Сравнение технологий: таблица

Чтобы было нагляднее, представим сводку основных технологий хранения, используемых в ИИ-инфраструктурах, и их характеристик.

Технология Типичные задержки Пропускная способность Стоимость за ГБ Применение в ИИ
Регистры CPU <1 нс До 10 ТБ/с (внутри чипа) Очень высокая (невозможно купить отдельно) Непосредственные вычисления
HBM (на GPU) 20–50 нс 1–4 ТБ/с Высокая Хранение весов и градиентов во время обучения
DRAM (DDR5) 50–100 нс 50–100 ГБ/с на канал Средняя Кэширование данных, временное хранение
Storage Class Memory 100–500 нс 100–200 ГБ/с (теоретически) Средняя Находится в стадии развития, потенциально для offloading
NVMe SSD (PCIe 5.0) 1–5 мкс 7–10 ГБ/с на диск Низкая Основное хранилище для данных и чекпоинтов
NVMe over Fabrics 5–20 мкс До 100 ГБ/с в сети Низкая Распределённые хранилища в кластерах
HDD (SAS/SATA) 5–10 мс 150–250 МБ/с Очень низкая Архивы, редко используемые данные

Как видно, разрыв в скорости между памятью и хранилищем огромен. Именно поэтому архитекторы ИИ-систем всё чаще задумываются о «память-центричных» решениях, где границы между памятью и хранилищем стираются.

Практические примеры: как это работает в жизни

Для реальной иллюстрации возьмём задачу обучения модели на 1 триллион параметров. Пусть размер модели в формате fp16 составляет примерно 2 ТБ. Если мы хотим использовать 100 GPU, на каждом GPU должно оказаться около 20 ГБ весов — это умещается в HBM, но при использовании тензорного параллелизма веса реплицируются, и фактический объём данных на GPU становится больше. Однако вспомогательные данные — оптимизатор, градиенты, состояние слоёв — увеличивают требуемую память в 3–10 раз.

Теперь представьте, что мы каждые 10 минут сохраняем чекпоинт. Если хранилище выдаёт только 1 ГБ/с, сохранение 2 ТБ займёт более получаса — это катастрофа для скорости обучения. Современные системы NVMe-oF с пропускной способностью 10 ГБ/с и выше справляются за минуты, а с использованием асинхронной записи и распределённых чекпоинтов время можно сократить до секунд.

Другой пример — пакетная обработка изображений. Пусть каждый тренировочный батч — это 4096 изображений по 1 МБ, итого около 4 ГБ. При обучении конвейеру нужно читать такие батчи со скоростью 1000 раз в секунду, чтобы не простаивать GPU. Значит, требуется поток данных 4 ТБ/с — это вызов даже для самых современных хранилищ. Здесь на помощь приходят чтение прямо из SSD с помощью GPUDirect Storage и предварительное кэширование в DRAM.

Что дальше: прогноз и рекомендации

Развитие ИИ стимулирует спрос не только на вычислительные мощности, но и на инновации в памяти и хранилищах. Можно ожидать, что в ближайшие годы мы увидим:

  • Рост пропускной способности NVMe до 14–16 ГБ/с с появлением PCIe 6.0, что вдвое увеличит скорость отдельного накопителя.
  • Расширение применения SCM — новые типы энергонезависимой памяти (например, ReRAM, MRAM) постепенно выходят из лабораторий в коммерческие продукты.
  • Гетерогенные хранилища с интеллектуальным управлением, где горячие данные автоматически живут в памяти, тёплые — на NVMe, а холодные — на ленточных или дисковых архивах.

Для инженеров и архитекторов важно уже сейчас закладывать в свои ИИ-инфраструктуры возможность масштабировать подсистему хранения независимо от вычислительной части. Это означает использование стандартных протоколов, поддерживающих удалённый доступ к памяти, и программных инструментов, которые умеют оптимизировать ввод-вывод без ручной настройки.

Заключение

Статья NVIDIA напоминает: рост ИИ повышает спрос на память, и хранилища вынуждены догонять. Традиционные HDD и даже обычные SSD уже не могут обеспечить нужную эффективность для больших моделей. Решения нового поколения — NVMe-oF, вычислительное хранение, интеллектуальная иерархия данных — постепенно становятся стандартом в ИИ-кластерах.

Ключевой вывод: не стоит недооценивать роль хранилища в ИИ-проектах. Инвестиции в быструю подсистему хранения окупаются за счёт сокращения времени обучения, ускорения экспериментов и снижения простоя дорогих GPU. Поэтому при проектировании ИИ-инфраструктуры память и хранилище должны рассматриваться как единая система, а не как отдельные компоненты.

Новость от NVIDIA — ещё один сигнал, что мы на пороге перехода от «памяти внутри чипа» к «памяти вокруг системы». И те, кто учтёт это сегодня, завтра получат значительное конкурентное преимущество в разработке и внедрении искусственного интеллекта.

← Все статьи

Комментарии

Читайте также

ISO 27001:2022 — Ведущий специалист по внедрению (СУИБ): Карьерный план 2026 года для специалистов по кибербезопасности

9 августа 2026

Интеграция ИИ с Sentry: как ASI Biont автоматизирует триаж ошибок и реагирование на инциденты

9 августа 2026

Как настроить интеграцию HTTP/WebSocket с AI-агентом ASI Biont: от API-ключа до автоматизации бизнеса

9 августа 2026

UART (any MCU) + ASI Biont: как подключить Arduino, ESP32 или STM32 к AI-агенту через COM-порт

9 августа 2026

Международное право и арбитраж — уровень LL.M.: Полный курс по глобальному разрешению споров

9 августа 2026

Firebird запускает крупнейший в СНГ ИИ-завод в Армении: как это изменит рынок

9 августа 2026

Курс Java и C# — корпоративная разработка: освойте Spring Boot, .NET и микросервисы с ИИ-обучением на asibiont.com

9 августа 2026

Мой сервер — теперь телефон: как vibe coding превращает смартфон в хостинг

9 августа 2026

Как подключить 3D-принтер на Marlin/Klipper к AI-агенту ASI Biont: автоматизация печати, мониторинг и диагностика

9 августа 2026