Современные языковые модели требуют всё больше вычислительных ресурсов, и одним из ключевых ограничений становится память. Пока индустрия наращивает объёмы GPU и ускорителей, подсистема хранения данных — то, что находится «за чипом», — зачастую остаётся узким местом. В свежем материале NVIDIA поднимается именно эта тема: с ростом требований ИИ к памяти, хранилища вынуждены эволюционировать, чтобы не тормозить обучение и вывод моделей. Источник
Сегодня мы разберём, почему классическая трёхуровневая иерархия «регистры → кэш → DRAM» уже не справляется, как новые типы памяти и протоколы хранения меняют ландшафт, и что это значит для инженеров, исследователей и компаний, внедряющих ИИ.
ИИ-модели становятся больше: почему прежних мощностей не хватает
Параметры моделей растут экспоненциально. GPT-3 в 2020 году имела 175 миллиардов параметров, а уже к середине 2020-х годов появились модели с триллионом параметров. Обучение такой модели требует не только огромного количества GPU, но и способности быстро перекачивать гигабайты данных из хранилища в память. Даже вывод (inference) для больших языковых моделей требует удержания весов в быстрой памяти, а это десятки и сотни гигабайт.
Традиционный подход — всё доставить в RAM, а затем в VRAM GPU. Но когда модель не помещается в память одного устройства, приходится использовать техники типа пайплайнинга, тензорного параллелизма или offloading. И здесь ключевую роль играет скорость подсистемы хранения: если нужно быстро загрузить веса или сохранить чекпоинт, от пропускной способности и задержек хранилища зависит, насколько эффективно используются дорогие GPU.
Иерархия памяти в ИИ-системах: от HBM до NVMe
Чтобы понять, какие требования предъявляет ИИ к памяти, полезно взглянуть на современную иерархию. На самом верху — видеопамять HBM (High Bandwidth Memory), установленная на GPU. Она очень быстрая (пропускная способность 1–4 ТБ/с), но и очень дорогая. Ниже — обычная DRAM (например, DDR5), которая используется в серверах и рабочих станциях. Ещё ниже — хранилище: твёрдотельные накопители (NVMe SSD) и жёсткие диски.
Модель, которая не умещается в HBM, может частично размещаться в DRAM, а если и этого мало — в SSD. Но задержки при этом возрастают с десятков наносекунд до микросекунд и даже миллисекунд. В результате возникает необходимость в новых решениях: например, в использовании Storage Class Memory (SCM) — типа памяти, которая сочетает скорость DRAM с энергонезависимостью SSD. Хотя Intel Optane, ранний представитель SCM, был снят с производства, идеи живут дальше: появляются аналоги на базе новых материалов.
Главные проблемы: загрузка данных и контрольные точки
При обучении больших моделей есть два сценария, где хранилище становится критически важным.
Первый — загрузка данных. Даже если весь датасет не помещается в память, нужно быстро подавать данные в GPU. В конвейерах обучения данные часто читаются прямо с SSD, и медленный диск сведёт на нет всё преимущество мощного GPU. Поэтому используются такие технологии, как GPUDirect Storage (GDS) — они позволяют передавать данные с NVMe SSD напрямую в память GPU, минуя CPU и дополнительное копирование.
Второй сценарий — сохранение контрольных точек (checkpointing). При обучении больших моделей каждые несколько часов (или даже чаще) сохраняется состояние модели, чтобы в случае сбоя не потерять прогресс. Для модели на 1 триллион параметров чекпоинт может занимать несколько терабайт. Сохранить его на медленное хранилище — значит, надолго остановить обучение. Поэтому индустрия движется к созданию сверхбыстрых систем хранения, способных работать с пропускной способностью в десятки и сотни гигабайт в секунду.
Как индустрия хранилищ отвечает на новые требования
В материале NVIDIA подчёркивается, что просто увеличить объём дисков недостаточно. Нужны комплексные решения, включающие новые протоколы передачи данных, смарт-контроллеры, интеллектуальные планировщики ввода-вывода и даже обработку прямо в хранилище.
Вот несколько направлений, которые активно развиваются:
- NVMe over Fabrics (NVMe-oF) — протокол, позволяющий обращаться к SSD по сети с задержкой в микросекундах, как к локальным дискам. Это делает возможным построение распределённых хранилищ, которые не уступают в скорости локальным накопителям.
- Вычислительное хранение (Computational Storage) — размещение процессоров прямо в SSD, чтобы выполнять часть операций (например, фильтрацию или агрегацию) внутри накопителя, не загружая CPU. Это особенно полезно для обработки больших данных перед подачей в ИИ-модель.
- Иерархическое управление хранилищем (Tiering) — автоматическое перемещение данных между быстрыми NVMe, более медленными но ёмкими SATA SSD и дешёвыми HDD. Алгоритмы машинного обучения могут предсказывать, какие данные понадобятся раньше, и заранее размещать их на быстрых носителях.
- Метаданные и индексация в памяти — для распределённых файловых систем используются in-memory метаданные, чтобы ускорить поиск файлов по всему кластеру.
Особое место занимает программное обеспечение для управления хранилищем. Например, NVIDIA Magnum IO — набор библиотек и технологий для оптимизации ввода-вывода в ИИ-приложениях. Он включает в себя реализацию GPUDirect Storage, поддержку NVMe-oF и другие модули, которые позволяют выжать максимум из оборудования.
Сравнение технологий: таблица
Чтобы было нагляднее, представим сводку основных технологий хранения, используемых в ИИ-инфраструктурах, и их характеристик.
| Технология | Типичные задержки | Пропускная способность | Стоимость за ГБ | Применение в ИИ |
|---|---|---|---|---|
| Регистры CPU | <1 нс | До 10 ТБ/с (внутри чипа) | Очень высокая (невозможно купить отдельно) | Непосредственные вычисления |
| HBM (на GPU) | 20–50 нс | 1–4 ТБ/с | Высокая | Хранение весов и градиентов во время обучения |
| DRAM (DDR5) | 50–100 нс | 50–100 ГБ/с на канал | Средняя | Кэширование данных, временное хранение |
| Storage Class Memory | 100–500 нс | 100–200 ГБ/с (теоретически) | Средняя | Находится в стадии развития, потенциально для offloading |
| NVMe SSD (PCIe 5.0) | 1–5 мкс | 7–10 ГБ/с на диск | Низкая | Основное хранилище для данных и чекпоинтов |
| NVMe over Fabrics | 5–20 мкс | До 100 ГБ/с в сети | Низкая | Распределённые хранилища в кластерах |
| HDD (SAS/SATA) | 5–10 мс | 150–250 МБ/с | Очень низкая | Архивы, редко используемые данные |
Как видно, разрыв в скорости между памятью и хранилищем огромен. Именно поэтому архитекторы ИИ-систем всё чаще задумываются о «память-центричных» решениях, где границы между памятью и хранилищем стираются.
Практические примеры: как это работает в жизни
Для реальной иллюстрации возьмём задачу обучения модели на 1 триллион параметров. Пусть размер модели в формате fp16 составляет примерно 2 ТБ. Если мы хотим использовать 100 GPU, на каждом GPU должно оказаться около 20 ГБ весов — это умещается в HBM, но при использовании тензорного параллелизма веса реплицируются, и фактический объём данных на GPU становится больше. Однако вспомогательные данные — оптимизатор, градиенты, состояние слоёв — увеличивают требуемую память в 3–10 раз.
Теперь представьте, что мы каждые 10 минут сохраняем чекпоинт. Если хранилище выдаёт только 1 ГБ/с, сохранение 2 ТБ займёт более получаса — это катастрофа для скорости обучения. Современные системы NVMe-oF с пропускной способностью 10 ГБ/с и выше справляются за минуты, а с использованием асинхронной записи и распределённых чекпоинтов время можно сократить до секунд.
Другой пример — пакетная обработка изображений. Пусть каждый тренировочный батч — это 4096 изображений по 1 МБ, итого около 4 ГБ. При обучении конвейеру нужно читать такие батчи со скоростью 1000 раз в секунду, чтобы не простаивать GPU. Значит, требуется поток данных 4 ТБ/с — это вызов даже для самых современных хранилищ. Здесь на помощь приходят чтение прямо из SSD с помощью GPUDirect Storage и предварительное кэширование в DRAM.
Что дальше: прогноз и рекомендации
Развитие ИИ стимулирует спрос не только на вычислительные мощности, но и на инновации в памяти и хранилищах. Можно ожидать, что в ближайшие годы мы увидим:
- Рост пропускной способности NVMe до 14–16 ГБ/с с появлением PCIe 6.0, что вдвое увеличит скорость отдельного накопителя.
- Расширение применения SCM — новые типы энергонезависимой памяти (например, ReRAM, MRAM) постепенно выходят из лабораторий в коммерческие продукты.
- Гетерогенные хранилища с интеллектуальным управлением, где горячие данные автоматически живут в памяти, тёплые — на NVMe, а холодные — на ленточных или дисковых архивах.
Для инженеров и архитекторов важно уже сейчас закладывать в свои ИИ-инфраструктуры возможность масштабировать подсистему хранения независимо от вычислительной части. Это означает использование стандартных протоколов, поддерживающих удалённый доступ к памяти, и программных инструментов, которые умеют оптимизировать ввод-вывод без ручной настройки.
Заключение
Статья NVIDIA напоминает: рост ИИ повышает спрос на память, и хранилища вынуждены догонять. Традиционные HDD и даже обычные SSD уже не могут обеспечить нужную эффективность для больших моделей. Решения нового поколения — NVMe-oF, вычислительное хранение, интеллектуальная иерархия данных — постепенно становятся стандартом в ИИ-кластерах.
Ключевой вывод: не стоит недооценивать роль хранилища в ИИ-проектах. Инвестиции в быструю подсистему хранения окупаются за счёт сокращения времени обучения, ускорения экспериментов и снижения простоя дорогих GPU. Поэтому при проектировании ИИ-инфраструктуры память и хранилище должны рассматриваться как единая система, а не как отдельные компоненты.
Новость от NVIDIA — ещё один сигнал, что мы на пороге перехода от «памяти внутри чипа» к «памяти вокруг системы». И те, кто учтёт это сегодня, завтра получат значительное конкурентное преимущество в разработке и внедрении искусственного интеллекта.
Комментарии