Как запустить 35B-модель на ноутбуке с 8 ГБ VRAM: опыт команды Ornith с AMD Strix Halo

Как запустить 35B-модель на ноутбуке с 8 ГБ VRAM: опыт команды Ornith с AMD Strix Halo

Представьте: запустить нейросеть с 35 миллиардами параметров на ноутбуке с 8 гигабайтами видеопамяти и получить скорость 99 токенов в секунду. Звучит как научная фантастика? Для команды разработчиков из Ornith это стало реальностью. В июле 2026 года они опубликовали подробный отчет о том, как им удалось разогнать модель Ornith‑35B до невероятной производительности на новейшем APU AMD Strix Halo. Источник

Это не просто технический трюк — это прорыв, который может изменить представление о локальном запуске больших языковых моделей (LLM). В этой статье мы разберем, как именно разработчики этого добились, какие технологии использовали и что это значит для индустрии.

Почему 35B-модели обычно не работают на 8 ГБ VRAM?

Большие языковые модели требуют огромного количества памяти. Для справки: модель с 7 миллиардами параметров (например, Llama 2 7B) в 4-битной квантизации занимает около 4 ГБ. Модель с 35 миллиардами параметров — это уже 5 раз больше. В обычной 4-битной точности (QLoRA) она потребовала бы около 20 ГБ видеопамяти. Ноутбук с 8 ГБ VRAM — это, по сути, игрушечное ограничение.

Разработчики столкнулись с классической проблемой: как уместить слоноподобную модель в мышиную нору. Обычные методы — квантизация, оффлоадинг слоев на CPU — давали либо катастрофическое падение качества, либо скорость ниже 10 ток/с.

Что такое AMD Strix Halo и почему он особенный?

AMD Strix Halo — это не просто процессор. Это APU (Accelerated Processing Unit), который объединяет мощное CPU ядро (на архитектуре Zen 5) и встроенную графику на архитектуре RDNA 3.5. Но ключевая особенность для машинного обучения — это поддержка единой памяти (Unified Memory) и огромная пропускная способность (до 256 ГБ/с) при подключении к оперативной памяти DDR5.

В отличие от дискретных видеокарт, где VRAM жестко ограничена (8 ГБ, 16 ГБ, 24 ГБ), у Strix Halo видеопамять и системная память — это одно и то же. Если установить 64 ГБ оперативной памяти, то и GPU получит доступ к тем же 64 ГБ. Это радикально меняет правила игры для запуска больших моделей.

Как команда Ornith обошла ограничение в 8 ГБ?

Авторы статьи рассказывают, что они использовали комбинацию из нескольких приемов:

  1. 4-битная квантизация с групповым масштабированием — они применили формат GPTQ с размером группы 32, что позволило снизить потребление памяти до ~9 ГБ на саму модель. Это уже меньше 8 ГБ, но оставались накладные расходы на KV-кэш и буферы.

  2. Динамическое управление KV-кэшем — вместо того чтобы держать весь кэш в VRAM, они использовали технику PagedAttention (как в vLLM), но адаптированную под унифицированную память. Часть кэша хранится в системной RAM, а подгружается по мере необходимости.

  3. Использование ROCm и оптимизированных ядер — AMD предоставляет библиотеку ROCm, которая позволяет запускать модели на своих GPU. Но разработчики не просто взяли готовую сборку. Они переписали ключевые ядра на HIP, используя специфические инструкции Strix Halo для работы с матрицами (WMMA).

  4. Тенсорный параллелизм на одном чипе — они разбили модель на 2 части, которые выполняются параллельно на разных вычислительных блоках GPU, а затем синхронизируются. Это дало прирост в 15-20% скорости.

Результаты: 99 ток/с — это много или мало?

99 токенов в секунду — это скорость, сравнимая с работой моделей в облаке (например, GPT-4 через API дает около 50-100 ток/с). Для локального запуска 35B-модели на ноутбуке это феноменальный результат.

Для сравнения:
- Llama 2 7B на RTX 4090 (24 ГБ) — 120-150 ток/с
- Mixtral 8x7B (46.7B параметров) на MacBook Pro M3 Max (48 ГБ) — 30-40 ток/с
- Ornith‑35B на ноутбуке с 8 ГБ VRAM (Strix Halo) — 99 ток/с

Разработчики отмечают, что скорость достигается только при длине контекста до 2048 токенов. При увеличении контекста до 4096 токенов скорость падает до 55 ток/с из-за роста KV-кэша.

Практический гайд: как повторить этот эксперимент

Если вы хотите попробовать запустить Ornith‑35B на своем оборудовании, вот что для этого нужно:

Шаг 1: Подготовка оборудования
- Ноутбук или ПК с APU AMD Strix Halo (например, модели на базе Ryzen AI 300 серии)
- Минимум 32 ГБ оперативной памяти (лучше 64 ГБ)
- ОС: Ubuntu 24.04 или Windows 11 с WSL2

Шаг 2: Установка ПО
- Установите ROCm 6.2 (последняя версия на июль 2026)
- Клонируйте репозиторий Ornith с GitHub: git clone https://github.com/ornith-ai/ornith-35b
- Установите зависимости: pip install -r requirements.txt

Шаг 3: Скачивание модели
- Модель доступна на Hugging Face: huggingface-cli download ornith-ai/Ornith-35B-GPTQ
- Вес файлов: ~9 ГБ (в 4-битной квантизации)

Шаг 4: Запуск с оптимизациями
- Используйте скрипт run_optimized.sh из репозитория. Он автоматически настроит PagedAttention и тенсорный параллелизм.
- Пример команды:

python run.py --model ornith-ai/Ornith-35B-GPTQ --max-length 2048 --tensor-parallel 2 --use-paged-attention

Шаг 5: Мониторинг
- Проверьте, что модель использует унифицированную память: rocm-smi покажет, что VRAM и RAM объединены.
- Если скорость ниже 50 ток/с, попробуйте уменьшить max-length до 1024 или отключить один из вычислительных блоков.

Что это значит для индустрии?

Успех команды Ornith — это не просто демонстрация возможностей AMD. Это сигнал о том, что локальные LLM могут догнать облачные решения по производительности. Если раньше для работы с 30B+ моделями нужно было арендовать GPU в облаке за сотни долларов в месяц, то теперь это можно делать на ноутбуке за $1500-2000.

Разработчики проекта отмечают, что ключевым фактором стала не только мощность Strix Halo, но и программная оптимизация. Они использовали открытые библиотеки (vLLM, FlashAttention-3) и адаптировали их под архитектуру AMD. Это показывает, что экосистема для запуска LLM на не-NVIDIA оборудовании становится зрелой.

Для компаний, которые хотят внедрять AI-решения без передачи данных в облако (например, в медицине или финансах), это открывает новые возможности. ASI Biont поддерживает подключение к AMD ROCm через API для локального запуска моделей — подробнее на asibiont.com/courses.

Ограничения и что дальше

Несмотря на впечатляющие результаты, у подхода есть ограничения:
- Модель работает только на APU Strix Halo (пока нет поддержки для обычных видеокарт AMD)
- Скорость падает при длинном контексте (более 4096 токенов)
- Требуется ручная настройка параметров для каждой модели

Авторы статьи планируют выпустить автоматический тюнер, который будет подбирать оптимальные настройки для любого оборудования. Также они работают над поддержкой моделей до 70B параметров (например, Llama 3 70B).

Заключение

Запуск Ornith‑35B на ноутбуке с 8 ГБ VRAM и скорость 99 ток/с — это не миф, а реальность 2026 года. Команда Ornith показала, что даже скромное оборудование может тянуть большие модели, если правильно подойти к оптимизации. Для энтузиастов и профессионалов это открывает путь к локальному AI без компромиссов.

Если вы хотите глубже изучить технические детали, рекомендуем прочитать оригинальную статью на Habr. А если вы ищете готовые решения для запуска LLM на своем оборудовании, обратите внимание на курсы ASI Biont, где разбираются подобные кейсы.

← Все статьи

Комментарии

Читайте также

Bristol Myers Squibb строит самый передовой AI-завод в биофарме: что такое Vibe Coding на базе NVIDIA Vera Rubin

20 июля 2026

Я протестировал ScrapeOps AI Scraper Builder на 5 разных сайтах: вот что случилось

20 июля 2026

На дворе C++23, а заставить компилятор проверять код всё ещё помогает только ассемблер

20 июля 2026

Автоматизация SEO-аналитики: как подключить Яндекс.Вебмастер к AI-агенту ASI Biont

20 июля 2026

Почему курс «SEC и инсайдерская торговля: регулирование и соблюдение требований» является обязательным для специалистов по комплаенсу в 2026 году

20 июля 2026

CISA — Certified Information Systems Auditor (ISACA): Как AI-обучение на asibiont.com упрощает подготовку к сертификации

20 июля 2026

Почему стратегия открытых весов Китая побеждает в гонке ИИ

20 июля 2026

TypeScript — статическая типизация в JavaScript: как декораторы упрощают код и почему AI-обучение на Asibiont ускоряет прогресс

20 июля 2026

Углы так не выглядят: что такое Screen Space Ambient Occlusion (SSAO) и почему это важно для vibe coding

20 июля 2026