Руководство Monsder
Сколько VRAM нужно для LLM
Память для запуска LLM складывается из весов модели, KV-кэша, рабочих буферов и накладных расходов среды исполнения. Одного числа параметров недостаточно: нужны точная версия модели, формат весов, длина контекста и число одновременных запросов.
Как посчитать память весов
Упрощённая формула: память весов в байтах ≈ число параметров × число бит на параметр / 8. Для условной модели ровно с 8 млрд параметров FP16 даёт 16 GB, или около 14,90 GiB; идеализированные 4-битные веса — 4 GB, или около 3,73 GiB. GB = 10⁹ байт, GiB = 2³⁰ байт.
Это арифметический пример, а не требование конкретной модели 8B. Реальный формат квантования добавляет служебные данные; часть тензоров может храниться в другой точности. Полученные 3,73 GiB не означают, что модель заработает на видеокарте с 4 GiB.
Почему контекст и параллельность меняют результат
KV-кэш хранит промежуточные ключи и значения механизма внимания. Его размер зависит от архитектуры, точности кэша, сохраняемых токенов и активных последовательностей. Длинный контекст и несколько одновременных диалогов могут заметно увеличить расход памяти; для оконного внимания и других архитектур зависимость отличается.
Количество сотрудников не равно количеству одновременно обрабатываемых запросов. Для профиля нагрузки укажите активную параллельность, длину входа и ожидаемого ответа. Если пока известны только пользователи в день, оставьте допущение явным и уточните пиковую нагрузку.
Как читать результат Monsder
В калькуляторе выберите модель и режим работы, затем задайте точность, контекст и параллельность. Результат показывает расчётную потребность и известные ограничения. Если профиль памяти неполон, нижняя граница остаётся нижней границей: неизвестная память не становится нулевой.
Размещение в VRAM не подтверждает скорость, задержку или надёжность. Следующий шаг — проверка выбранной среды исполнения и измерения на целевом оборудовании. Для обучения дополнительно нужны градиенты, состояния оптимизатора и активации; оценку инференса нельзя переносить на обучение без пересчёта.
Частые вопросы
Достаточно ли 24 ГБ для LLM?
Без модели, формата весов, контекста и параллельности ответ неизвестен. Даже когда веса помещаются, KV-кэш и среда исполнения могут потребовать дополнительную память. Укажите эти параметры в калькуляторе и проверьте допущения результата.
Квантование в 4 бита уменьшает всю память в четыре раза?
Нет. Идеальное соотношение 4 к 16 относится к представлению весов. KV-кэш, рабочие буферы и служебные данные имеют собственные форматы и расходы памяти.
Источники и границы материала
Первичная документация объясняет принципы работы памяти и среды исполнения. Описание сценария Monsder относится к текущему предварительному калькулятору. Примеры не являются GPU-испытаниями; окончательное инженерное решение требует проверки специалистов.
Перейти от методики к расчёту
- Как выбрать сервер для ИИ
Подбор сервера для ИИ по задаче: модель, нагрузка, GPU, память, питание и охлаждение. Что проверяет калькулятор и что требует инженерной проверки.
- Какие модели поместятся на вашей GPU
Как подобрать LLM под видеокарту: доступная VRAM, квантование, контекст и параллельность. Почему «помещается в память» не означает подтверждённый запуск.