Что именно “съедает” память в локальных LLM?
Производительность и требования к памяти зависят не только от “7B/13B/32B”, а от трёх факторов:
Подбор модели по доступной памяти
| Память устройства | Безопасный старт | Первый контекст | Что проверить |
|---|---|---|---|
| 8 ГБ RAM | 1B-4B, Q4 | 2K | Система не уходит в постоянный swap |
| 16 ГБ RAM | 7B-12B, Q4 | 2K-4K | ollama ps и скорость на вашем файле |
| 24 ГБ RAM | 12B-20B, Q4 после замера | 4K | Запас для IDE и KV-кэша |
| 32 ГБ RAM | 14B-27B, Q4 | 4K-8K после теста | Пиковая память длинного запроса |
| VRAM меньше веса | Частичный offload или меньшая модель | Минимальный | Не путать запуск с удобной скоростью |
Диапазоны являются стартовой оценкой, а не гарантией совместимости. Архитектура, квантизация, параллельные запросы и длина контекста меняют бюджет. Выберите строку, оставьте системе запас и переходите к следующему размеру только после измерения.
Как считать память до скачивания модели
Бюджет памяти считают до загрузки весов, а не после первого зависания. Возьмите Q4-тег нужного размера, поставьте контекст 2048-4096 и один типовой запрос. Запустите модель, выполните ollama ps и сверьте, попала она в VRAM целиком или частично ушла в RAM.
1B-4B в Q4, контекст 2k, следим за постоянным swap.
7B-12B в Q4, контекст 4k и замер скорости на своём файле.
14B-27B в Q4 с запасом памяти под IDE и KV-кэш.
Размер файла на диске это только веса, к ним прибавляются KV-кэш и рабочие буферы, которые растут вместе с длиной диалога. Сравнивайте две соседние модели на одном и том же запросе, тогда разница видна честно. Названия моделей из таблиц ниже берите как исторический пример, а тег подбирайте свежий.
Веса модели (параметры + квантизация). Это то, что загружается в RAM/VRAM.
KV-кэш (зависит от контекста и количества слоёв). Он растёт во время диалога.
Оверхед (рантайм, токенизатор, буферы, драйверы, UI). Обычно “пара гигабайт сверху”.
Ключевая идея: если модель “влезла” - это ещё не значит, что она не будет лагать. Часто лаги начинаются, когда растёт KV-кэш (вы увеличили контекст или долго общаетесь).

Быстрая оценка: сколько памяти нужно модели?
Это грубая, но рабочая прикидка. Точные цифры зависят от архитектуры и реализации, но логика такая:
FP16 ≈ 2 байта на параметр → очень прожорливо, почти всегда не нужно дома.
8-bit ≈ 1 байт на параметр → заметно легче.
4-bit ≈ 0.5 байта на параметр (плюс служебные данные) → самый популярный вариант для ПК.
Практическое правило: для домашнего запуска чаще всего выбирают 4-bit (Q4) или 5-bit (Q5). Они дают хорошее соотношение “качество/скорость/память”.
Ориентиры по VRAM для GPU-инференса (4-bit)
Размер | Минимум VRAM | Комфортно | Что реально можно делать |
|---|---|---|---|
3B-4B | 2-4 ГБ | 6 ГБ | Быстрые ответы, простые задачи, чат “на каждый день”. |
7B-8B | 4-6 ГБ | 8 ГБ | Код, объяснения, резюме текстов, базовые RAG-сценарии. |
13B-14B | 8-10 ГБ | 12-16 ГБ | Сложнее рассуждает, лучше в коде/инструкциях, меньше “галлюцинаций”. |
30B-34B | 16-24 ГБ | 24+ ГБ | Большие задачи, длинные диалоги, сложные проекты, более “взрослый” ассистент. |
70B | 40+ ГБ | сервер | Для домашнего ПК - редко рационально. |
Важно: если VRAM впритык, модель может частично “спилливаться” в RAM (offload), и скорость резко падает. Поэтому “минимум” - это про запуск, а “комфортно” - про отсутствие лагов.
Подбор модели по твоему железу
Сетап A: 8 ГБ RAM, без дискретной GPU
Выбор: 3B-7B в 4-bit.
Контекст: 2k-4k (не ставь 16k “на всякий”).
Ожидания: норм для чата/справки, но кодогенерация может быть медленной.
Сетап B: 16 ГБ RAM, 6-8 ГБ VRAM
Выбор: 7B (комфортно) или 13B в 4-bit.
Контекст: 4k-8k (по задаче).
Ожидания: хороший “локальный помощник” для разработчика.
Сетап C: 32 ГБ RAM, 12-16 ГБ VRAM
Выбор: 13B без компромиссов, 32B в 4-bit (часто уже реально).
Контекст: 8k-16k (если нужно RAG/длинные документы).
Ожидания: можно держать несколько моделей и переключаться.
Сетап D: 24 ГБ VRAM и выше
Выбор: 32B комфортно, иногда - больше (в 4-bit).
Контекст: 16k+ при необходимости.
Ожидания: почти “домашний сервер”, особенно если CPU тоже сильный.

Как не словить лаги?
Квантизация
Если не уверен - бери Q4 как базу.
Если качество важно, а память позволяет - попробуй Q5 или 8-bit.
Контекст (context window)
Ставь контекст по задаче. Для обычного чата часто хватает 4k-8k.
Для работы с документами/RAG - повышай, но следи за памятью (KV-кэш растёт).
Offload (часть модели в RAM)
Offload помогает запуститься на слабой VRAM, но может резко замедлить ответы.
Если “тормозит” - сначала уменьши модель/контекст, и только потом играйся с offload.
Стабильная формула: меньше модель + Q4/Q5 + разумный контекст = почти всегда “без лагов”.
Что выбрать разработчику: “универсальная” vs “кодовая” модель
Если у вас цель - код, то часто лучше работает специализированная “code” модель того же размера, чем “универсальная” модель побольше, но впритык по памяти.
Универсальная модель - чат, объяснения, письма, идеи, RAG.
Code-модель - генерация/рефакторинг, объяснение ошибок, подсказки по API.
Типичная ошибка: взять “самую большую”, а потом выключить GPU-ускорение и терпеть. Лучше взять “поменьше”, но быстро.
Если ты только начинаешь: где прокачать базу (и зачем это важно)?
Локальные LLM - отличный инструмент, но они не заменяют понимание основ: переменных, циклов, SQL-запросов, работы с API. Чтобы нейросеть реально усиливала, а не “генерила магию”, база должна быть.
В приложении Кодик удобно учиться программированию через практику: короткие уроки, упражнения, закрепление на задачах. А в нашем Telegram-сообществе регулярно выходят полезные посты и разборы - отличный способ повторять темы “по пути”.
Частые вопросы про память и размер модели
Сколько видеопамяти нужно модели 7B в 4-bit?
Модели 7B-8B в 4-bit нужно примерно 4-6 ГБ VRAM для запуска и около 8 ГБ для комфортной работы. Минимум означает, что модель просто стартует, а комфорт это отсутствие лагов на длинных ответах.
Сколько памяти занимает модель в FP16, 8-bit и 4-bit?
Прикидка простая: FP16 берёт около 2 байт на параметр, 8-bit около 1 байта, 4-bit около 0.5 байта плюс служебные данные. Дома чаще всего выбирают Q4 или Q5: они дают хорошее соотношение качества, скорости и расхода памяти.
Почему модель начинает тормозить в длинном диалоге?
В длинном диалоге растёт KV-кэш: он зависит от контекста и числа слоёв и занимает память сверх весов модели. Сверху идёт оверхед рантайма, токенизатора и буферов, обычно пара гигабайт. Поэтому модель может влезть в память при старте и начать лагать через полчаса общения.
Какую модель выбрать для 8 ГБ RAM без дискретной видеокарты?
Для 8 ГБ оперативной памяти без дискретной видеокарты подходят модели 3B-7B в 4-bit с контекстом 2k-4k. Для чата и справки этого хватает, а генерация кода будет медленной. Ставить контекст 16k про запас не нужно: он съедает память впустую.
Что такое offload и когда его включать?
Offload это выгрузка части модели из видеопамяти в оперативную, когда VRAM не хватает. Запуститься так можно, но скорость ответов падает резко. Если тормозит, сначала уменьшите модель или контекст и только потом играйтесь с offload.
Что лучше для кода: большая универсальная модель или code-модель поменьше?
Для кода специализированная code-модель часто работает лучше, чем универсальная побольше, которая влезает в память впритык. Частая ошибка это взять самую большую модель, остаться без GPU-ускорения и ждать каждый ответ. Меньше и быстро обычно полезнее.