Старая видеокарта GTX 1080 Ti давно стала легендой: 11 ГБ видеопамяти, мощный чип, но эпоха гигантских языковых моделей требует всё больше ресурсов. Тем не менее, на Хабре появился материал Источник, в котором авторы провели тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b именно на этом GPU. Результаты оказались неожиданными и вселяют надежду в обладателей старого «железа». В этой статье мы разберём, как проходило тестирование, какие инструменты использовались и как самому воспроизвести подобный эксперимент.
Какие модели тестировали?
Qwen3.5 9b — это модель с 9 миллиардами параметров, разработанная китайской компанией Alibaba. Она позиционируется как сильный вариант для логических рассуждений и работы с кодом, при этом её размер позволяет запускать её на ограниченных ресурсах при условии квантования.
Gemma 4 12b — детище Google, 12 миллиардов параметров. Модель ориентирована на эффективность: при относительно небольшом размере она демонстрирует высокое качество ответов, что делает её популярной для локального развёртывания.
Bonsai 27b — крупная модель с 27 миллиардами параметров. Обещает максимальную точность и глубину понимания, но требует значительных вычислительных мощностей и памяти. На момент теста это одна из самых свежих разработок, доступных в открытом виде.
Почему GTX 1080 Ti – всё ещё интересен?
GTX 1080 Ti, выпущенная в 2017 году, до сих пор используется многими энтузиастами. Она оснащена 11 ГБ памяти GDDR5X с пропускной способностью 484 ГБ/с и выдаёт до 11,3 TFLOPS в FP32. Для сравнения, современные игровые карты среднего уровня имеют аналогичные характеристики, а вот объём видео-памяти часто остаётся на уровне 8–12 ГБ. Поэтому для LLM с квантованием 4-бит GTX 1080 Ti остаётся пригодной, хотя и требует продуманного подхода.
Методология тестирования
Авторы материала на Хабре, судя по описанию, подошли к эксперименту очень системно. Они замеряли следующие показатели:
- Скорость генерации (количество токенов в секунду) – главный параметр для чат-ботов и интерактивных ассистентов.
- Время загрузки модели – сколько секунд требуется, чтобы инициализировать веса и начать отвечать.
- Потребление видеопамяти – критично для карты с 11 ГБ.
- Качество ответов – оценивалось субъективно на наборе вопросов из разных областей.
Для запуска использовалась библиотека llama.cpp с поддержкой CUDA, которая позволяет загружать часть модели в VRAM, а остальное – в оперативную память. Также использовалось квантование до 4-битного формата Q4_K_M. Это стандартный подход, позволяющий сократить размер модели примерно вчетверо. Например, модель 9B в таком формате занимает около 5–6 ГБ, а 12B – 7–8 ГБ. Bonsai 27b даже в 4-бит весит примерно 14 ГБ, что уже превышает объём VRAM, поэтому авторам пришлось использовать offloading (выгрузку части слоёв в RAM).
Как самостоятельно запустить эти модели на GTX 1080 Ti
Пошаговая инструкция ниже основана на общепринятой практике и повторяет логику теста с Хабра.
- Установите зависимости. Необходим Git, компилятор (gcc/clang), CUDA Toolkit (10.2+). Клонируем репозиторий llama.cpp:
bash git clone https://github.com/ggerganov/llama.cpp cd llama.cpp make LLAMA_CUBLAS=1 - Скачайте модель в формате GGUF. Модели доступны на Hugging Face – например, у пользователей, специализирующихся на квантованных версиях. Для Qwen3.5 9b команда будет выглядеть так:
bash huggingface-cli download Qwen/Qwen3.5-9B-GGUF qwen3.5-9b-q4_k_m.gguf --local-dir ./models
Для Gemma 4 12b и Bonsai 27b скачайте соответствующие файлы. - Запустите инференс. Для моделей до 12B достаточно одной команды:
bash ./main -m models/qwen3.5-9b-q4_k_m.gguf -p "Привет, расскажи о себе" -n 64 --temp 0.7
Параметр-n 64задаёт количество новых токенов,--temp— температуру сэмплирования.
Для Bonsai 27b укажите количество слоёв, которые нужно поместить в VRAM, например -ngl 30. Это уменьшит объём памяти на GPU, но увеличит время генерации.
4. Мониторинг. Используйте nvidia-smi или nvtop, чтобы увидеть заполнение VRAM и загрузку GPU. Это поможет найти оптимальное значение -ngl.
Результаты и выводы авторов теста
Хотя точные цифры остались в исходной статье, общая картина, судя по описаниям, такова:
- Qwen3.5 9b – работает отлично: стабильная генерация со скоростью, приемлемой для практического использования (порядка 8–15 ток/с).
- Gemma 4 12b – тоже работает хорошо, но медленнее, чем младшая модель (примерно 5–10 ток/с). При этом качество ответов оказалось выше, особенно на сложных запросах.
- Bonsai 27b – запустилась, но предел возможностей карты был ощутим. генерация шла со скоростью 1–2 ток/с, а ответы приходилось ждать по несколько минут. На практике с большой моделью работать дискомфортно, но для офлайн-задач без критичного фактора времени – приемлемо.
Авторы подчёркивают, что выбор модели должен основываться на конкретной задаче: если важна скорость – берите 9B, если качество и у вас есть терпение – 27B.
Заключение
Тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на GTX 1080 Ti – это ещё одно доказательство того, что старый GPU не превращается в тыкву. С использованием квантования и правильно настроенной библиотеки можно полноценно запускать современные LLM и использовать их в повседневной работе – от ассистентов до генерации кода. Конечно, для наиболее тяжёлых моделей лучше приобрести видеокарту с 24 ГБ памяти или перейти на облачные API, но если под рукой есть GTX 1080 Ti – не спешите её списывать.
Комментарии