Как запустить 35B-модель на ноутбуке с 8 ГБ VRAM: опыт команды Ornith с AMD Strix Halo
Представьте: запустить нейросеть с 35 миллиардами параметров на ноутбуке с 8 гигабайтами видеопамяти и получить скорость 99 токенов в секунду. Звучит как научная фантастика? Для команды разработчиков из Ornith это стало реальностью. В июле 2026 года они опубликовали подробный отчет о том, как им удалось разогнать модель Ornith‑35B до невероятной производительности на новейшем APU AMD Strix Halo. Источник
Это не просто технический трюк — это прорыв, который может изменить представление о локальном запуске больших языковых моделей (LLM). В этой статье мы разберем, как именно разработчики этого добились, какие технологии использовали и что это значит для индустрии.
Почему 35B-модели обычно не работают на 8 ГБ VRAM?
Большие языковые модели требуют огромного количества памяти. Для справки: модель с 7 миллиардами параметров (например, Llama 2 7B) в 4-битной квантизации занимает около 4 ГБ. Модель с 35 миллиардами параметров — это уже 5 раз больше. В обычной 4-битной точности (QLoRA) она потребовала бы около 20 ГБ видеопамяти. Ноутбук с 8 ГБ VRAM — это, по сути, игрушечное ограничение.
Разработчики столкнулись с классической проблемой: как уместить слоноподобную модель в мышиную нору. Обычные методы — квантизация, оффлоадинг слоев на CPU — давали либо катастрофическое падение качества, либо скорость ниже 10 ток/с.
Что такое AMD Strix Halo и почему он особенный?
AMD Strix Halo — это не просто процессор. Это APU (Accelerated Processing Unit), который объединяет мощное CPU ядро (на архитектуре Zen 5) и встроенную графику на архитектуре RDNA 3.5. Но ключевая особенность для машинного обучения — это поддержка единой памяти (Unified Memory) и огромная пропускная способность (до 256 ГБ/с) при подключении к оперативной памяти DDR5.
В отличие от дискретных видеокарт, где VRAM жестко ограничена (8 ГБ, 16 ГБ, 24 ГБ), у Strix Halo видеопамять и системная память — это одно и то же. Если установить 64 ГБ оперативной памяти, то и GPU получит доступ к тем же 64 ГБ. Это радикально меняет правила игры для запуска больших моделей.
Как команда Ornith обошла ограничение в 8 ГБ?
Авторы статьи рассказывают, что они использовали комбинацию из нескольких приемов:
-
4-битная квантизация с групповым масштабированием — они применили формат GPTQ с размером группы 32, что позволило снизить потребление памяти до ~9 ГБ на саму модель. Это уже меньше 8 ГБ, но оставались накладные расходы на KV-кэш и буферы.
-
Динамическое управление KV-кэшем — вместо того чтобы держать весь кэш в VRAM, они использовали технику PagedAttention (как в vLLM), но адаптированную под унифицированную память. Часть кэша хранится в системной RAM, а подгружается по мере необходимости.
-
Использование ROCm и оптимизированных ядер — AMD предоставляет библиотеку ROCm, которая позволяет запускать модели на своих GPU. Но разработчики не просто взяли готовую сборку. Они переписали ключевые ядра на HIP, используя специфические инструкции Strix Halo для работы с матрицами (WMMA).
-
Тенсорный параллелизм на одном чипе — они разбили модель на 2 части, которые выполняются параллельно на разных вычислительных блоках GPU, а затем синхронизируются. Это дало прирост в 15-20% скорости.
Результаты: 99 ток/с — это много или мало?
99 токенов в секунду — это скорость, сравнимая с работой моделей в облаке (например, GPT-4 через API дает около 50-100 ток/с). Для локального запуска 35B-модели на ноутбуке это феноменальный результат.
Для сравнения:
- Llama 2 7B на RTX 4090 (24 ГБ) — 120-150 ток/с
- Mixtral 8x7B (46.7B параметров) на MacBook Pro M3 Max (48 ГБ) — 30-40 ток/с
- Ornith‑35B на ноутбуке с 8 ГБ VRAM (Strix Halo) — 99 ток/с
Разработчики отмечают, что скорость достигается только при длине контекста до 2048 токенов. При увеличении контекста до 4096 токенов скорость падает до 55 ток/с из-за роста KV-кэша.
Практический гайд: как повторить этот эксперимент
Если вы хотите попробовать запустить Ornith‑35B на своем оборудовании, вот что для этого нужно:
Шаг 1: Подготовка оборудования
- Ноутбук или ПК с APU AMD Strix Halo (например, модели на базе Ryzen AI 300 серии)
- Минимум 32 ГБ оперативной памяти (лучше 64 ГБ)
- ОС: Ubuntu 24.04 или Windows 11 с WSL2
Шаг 2: Установка ПО
- Установите ROCm 6.2 (последняя версия на июль 2026)
- Клонируйте репозиторий Ornith с GitHub: git clone https://github.com/ornith-ai/ornith-35b
- Установите зависимости: pip install -r requirements.txt
Шаг 3: Скачивание модели
- Модель доступна на Hugging Face: huggingface-cli download ornith-ai/Ornith-35B-GPTQ
- Вес файлов: ~9 ГБ (в 4-битной квантизации)
Шаг 4: Запуск с оптимизациями
- Используйте скрипт run_optimized.sh из репозитория. Он автоматически настроит PagedAttention и тенсорный параллелизм.
- Пример команды:
python run.py --model ornith-ai/Ornith-35B-GPTQ --max-length 2048 --tensor-parallel 2 --use-paged-attention
Шаг 5: Мониторинг
- Проверьте, что модель использует унифицированную память: rocm-smi покажет, что VRAM и RAM объединены.
- Если скорость ниже 50 ток/с, попробуйте уменьшить max-length до 1024 или отключить один из вычислительных блоков.
Что это значит для индустрии?
Успех команды Ornith — это не просто демонстрация возможностей AMD. Это сигнал о том, что локальные LLM могут догнать облачные решения по производительности. Если раньше для работы с 30B+ моделями нужно было арендовать GPU в облаке за сотни долларов в месяц, то теперь это можно делать на ноутбуке за $1500-2000.
Разработчики проекта отмечают, что ключевым фактором стала не только мощность Strix Halo, но и программная оптимизация. Они использовали открытые библиотеки (vLLM, FlashAttention-3) и адаптировали их под архитектуру AMD. Это показывает, что экосистема для запуска LLM на не-NVIDIA оборудовании становится зрелой.
Для компаний, которые хотят внедрять AI-решения без передачи данных в облако (например, в медицине или финансах), это открывает новые возможности. ASI Biont поддерживает подключение к AMD ROCm через API для локального запуска моделей — подробнее на asibiont.com/courses.
Ограничения и что дальше
Несмотря на впечатляющие результаты, у подхода есть ограничения:
- Модель работает только на APU Strix Halo (пока нет поддержки для обычных видеокарт AMD)
- Скорость падает при длинном контексте (более 4096 токенов)
- Требуется ручная настройка параметров для каждой модели
Авторы статьи планируют выпустить автоматический тюнер, который будет подбирать оптимальные настройки для любого оборудования. Также они работают над поддержкой моделей до 70B параметров (например, Llama 3 70B).
Заключение
Запуск Ornith‑35B на ноутбуке с 8 ГБ VRAM и скорость 99 ток/с — это не миф, а реальность 2026 года. Команда Ornith показала, что даже скромное оборудование может тянуть большие модели, если правильно подойти к оптимизации. Для энтузиастов и профессионалов это открывает путь к локальному AI без компромиссов.
Если вы хотите глубже изучить технические детали, рекомендуем прочитать оригинальную статью на Habr. А если вы ищете готовые решения для запуска LLM на своем оборудовании, обратите внимание на курсы ASI Biont, где разбираются подобные кейсы.
Комментарии