Как запустить модель на 125B параметров на RTX 4090: квантизация, offload и 100 токенов в секунду
Обновлено: 05.10.2026 · AI Release · @ai_release1
Модель на 125 миллиардов параметров кажется невозможной для одной потребительской видеокарты. Но связка «квантизация + offload» позволяет запустить её на RTX 4090 и вплотную подойти к 100 токенам в секунду.
TL;DR
В полной точности (16 бит) веса модели на 125B занимают около 250 ГБ — это в разы больше памяти одной видеокарты.
Квантизация до 4 бит сжимает веса примерно до 62 ГБ, но целиком в 24 ГБ они всё равно не влезают.
Offload переносит часть слоёв на CPU и в оперативную память: модель запускается, но скорость падает.
Скорость генерации ограничивает пропускная способность памяти, а не вычислительная мощность GPU.
100 токенов в секунду достижимы только при удачном распределении слоёв, небольшом контексте и достаточной RAM.
Сколько памяти нужно модели на 125B
Размер весов считается просто: число параметров умножается на число байт на параметр. Для 125B это даёт ориентиры, которые полезно держать в голове до скачивания файлов.
Точность
Байт на параметр
Примерный размер весов для 125B
FP16 / BF16
2
~250 ГБ
8 бит
1
~125 ГБ
6 бит
0,75
~94 ГБ
4 бита
0,5
~62 ГБ
2 бита
0,25
~31 ГБ
К весам добавляются служебные расходы: KV-кэш контекста, активации, буферы рантайма. Чем длиннее контекст и чем больше одновременных запросов, тем выше эти расходы.
Квантизация уменьшает число бит на каждый вес. Чем меньше бит, тем меньше файл и тем ниже требования к памяти. Плата за это — потеря качества: модель начинает чаще ошибаться на сложных рассуждениях, коде и математике.
Темы: запустить 125B модель на RTX 4090, Qwen 3.8 Flash Next запуск, квантизация GGUF для больших моделей, offload слоёв в VRAM, сколько VRAM нужно для 125B модели
Кратко: Практический гайд по запуску больших моделей вроде Qwen 3.8 Flash Next на домашней видеокарте: выбор квантизации, распределение слоёв между VRAM и RAM и реальная скорость генерации.
Ключевые факты:
Модель на 125 миллиардов параметров кажется невозможной для одной потребительской видеокарты.
Но связка «квантизация + offload» позволяет запустить её на RTX 4090 и вплотную подойти к 100 токенам в секунду.
TL;DR В полной точности (16 бит) веса модели на 125B занимают около 250 ГБ — это в разы больше памяти одной видеокарты.
Квантизация до 4 бит сжимает веса примерно до 62 ГБ, но целиком в 24 ГБ они всё равно не влезают.
Offload переносит часть слоёв на CPU и в оперативную память: модель запускается, но скорость падает.
Скорость генерации ограничивает пропускная способность памяти, а не вычислительная мощность GPU.