Data и ИИДругой язык

Какая нейросеть подойдёт твоему ПК? Подбираем LLM по RAM и VRAM без лагов

Разбираем, какую LLM можно запускать на твоём железе: от 8 ГБ RAM до 24 ГБ VRAM.

Кодик

Автор

6 мин чтения

Что именно “съедает” память в локальных LLM?

Производительность и требования к памяти зависят не только от “7B/13B/32B”, а от трёх факторов:

Подбор модели по доступной памяти

Память устройстваБезопасный стартПервый контекстЧто проверить
8 ГБ RAM1B-4B, Q42KСистема не уходит в постоянный swap
16 ГБ RAM7B-12B, Q42K-4Kollama ps и скорость на вашем файле
24 ГБ RAM12B-20B, Q4 после замера4KЗапас для IDE и KV-кэша
32 ГБ RAM14B-27B, Q44K-8K после тестаПиковая память длинного запроса
VRAM меньше весаЧастичный offload или меньшая модельМинимальныйНе путать запуск с удобной скоростью

Диапазоны являются стартовой оценкой, а не гарантией совместимости. Архитектура, квантизация, параллельные запросы и длина контекста меняют бюджет. Выберите строку, оставьте системе запас и переходите к следующему размеру только после измерения.

Как считать память до скачивания модели

Бюджет памяти считают до загрузки весов, а не после первого зависания. Возьмите Q4-тег нужного размера, поставьте контекст 2048-4096 и один типовой запрос. Запустите модель, выполните ollama ps и сверьте, попала она в VRAM целиком или частично ушла в RAM.

8 ГБ RAM

1B-4B в Q4, контекст 2k, следим за постоянным swap.

16 ГБ RAM

7B-12B в Q4, контекст 4k и замер скорости на своём файле.

24-32 ГБ

14B-27B в Q4 с запасом памяти под IDE и KV-кэш.

Размер файла на диске это только веса, к ним прибавляются KV-кэш и рабочие буферы, которые растут вместе с длиной диалога. Сравнивайте две соседние модели на одном и том же запросе, тогда разница видна честно. Названия моделей из таблиц ниже берите как исторический пример, а тег подбирайте свежий.

  • Веса модели (параметры + квантизация). Это то, что загружается в RAM/VRAM.

  • KV-кэш (зависит от контекста и количества слоёв). Он растёт во время диалога.

  • Оверхед (рантайм, токенизатор, буферы, драйверы, UI). Обычно “пара гигабайт сверху”.

Ключевая идея: если модель “влезла” - это ещё не значит, что она не будет лагать. Часто лаги начинаются, когда растёт KV-кэш (вы увеличили контекст или долго общаетесь).

Разложенные комплектующие ПК: материнская плата, две видеокарты, планки памяти, кулеры, процессор

Быстрая оценка: сколько памяти нужно модели?

Это грубая, но рабочая прикидка. Точные цифры зависят от архитектуры и реализации, но логика такая:

  • FP16 ≈ 2 байта на параметр → очень прожорливо, почти всегда не нужно дома.

  • 8-bit ≈ 1 байт на параметр → заметно легче.

  • 4-bit ≈ 0.5 байта на параметр (плюс служебные данные) → самый популярный вариант для ПК.

Практическое правило: для домашнего запуска чаще всего выбирают 4-bit (Q4) или 5-bit (Q5). Они дают хорошее соотношение “качество/скорость/память”.

Ориентиры по VRAM для GPU-инференса (4-bit)

Размер

Минимум VRAM

Комфортно

Что реально можно делать

3B-4B

2-4 ГБ

6 ГБ

Быстрые ответы, простые задачи, чат “на каждый день”.

7B-8B

4-6 ГБ

8 ГБ

Код, объяснения, резюме текстов, базовые RAG-сценарии.

13B-14B

8-10 ГБ

12-16 ГБ

Сложнее рассуждает, лучше в коде/инструкциях, меньше “галлюцинаций”.

30B-34B

16-24 ГБ

24+ ГБ

Большие задачи, длинные диалоги, сложные проекты, более “взрослый” ассистент.

70B

40+ ГБ

сервер

Для домашнего ПК - редко рационально.

Важно: если VRAM впритык, модель может частично “спилливаться” в RAM (offload), и скорость резко падает. Поэтому “минимум” - это про запуск, а “комфортно” - про отсутствие лагов.

Подбор модели по твоему железу

Сетап A: 8 ГБ RAM, без дискретной GPU

  • Выбор: 3B-7B в 4-bit.

  • Контекст: 2k-4k (не ставь 16k “на всякий”).

  • Ожидания: норм для чата/справки, но кодогенерация может быть медленной.

Сетап B: 16 ГБ RAM, 6-8 ГБ VRAM

  • Выбор: 7B (комфортно) или 13B в 4-bit.

  • Контекст: 4k-8k (по задаче).

  • Ожидания: хороший “локальный помощник” для разработчика.

Сетап C: 32 ГБ RAM, 12-16 ГБ VRAM

  • Выбор: 13B без компромиссов, 32B в 4-bit (часто уже реально).

  • Контекст: 8k-16k (если нужно RAG/длинные документы).

  • Ожидания: можно держать несколько моделей и переключаться.

Сетап D: 24 ГБ VRAM и выше

  • Выбор: 32B комфортно, иногда - больше (в 4-bit).

  • Контекст: 16k+ при необходимости.

  • Ожидания: почти “домашний сервер”, особенно если CPU тоже сильный.

    Стеклянная банка со светящимися кубиками рядом с модулем памяти и чипом видеокарты

Как не словить лаги?

Квантизация

  • Если не уверен - бери Q4 как базу.

  • Если качество важно, а память позволяет - попробуй Q5 или 8-bit.

Контекст (context window)

  • Ставь контекст по задаче. Для обычного чата часто хватает 4k-8k.

  • Для работы с документами/RAG - повышай, но следи за памятью (KV-кэш растёт).

Offload (часть модели в RAM)

  • Offload помогает запуститься на слабой VRAM, но может резко замедлить ответы.

  • Если “тормозит” - сначала уменьши модель/контекст, и только потом играйся с offload.

Стабильная формула: меньше модель + Q4/Q5 + разумный контекст = почти всегда “без лагов”.

Что выбрать разработчику: “универсальная” vs “кодовая” модель

Если у вас цель - код, то часто лучше работает специализированная “code” модель того же размера, чем “универсальная” модель побольше, но впритык по памяти.

  • Универсальная модель - чат, объяснения, письма, идеи, RAG.

  • Code-модель - генерация/рефакторинг, объяснение ошибок, подсказки по API.

Типичная ошибка: взять “самую большую”, а потом выключить GPU-ускорение и терпеть. Лучше взять “поменьше”, но быстро.

Если ты только начинаешь: где прокачать базу (и зачем это важно)?

Локальные LLM - отличный инструмент, но они не заменяют понимание основ: переменных, циклов, SQL-запросов, работы с API. Чтобы нейросеть реально усиливала, а не “генерила магию”, база должна быть.

В приложении Кодик удобно учиться программированию через практику: короткие уроки, упражнения, закрепление на задачах. А в нашем Telegram-сообществе регулярно выходят полезные посты и разборы - отличный способ повторять темы “по пути”.

Частые вопросы про память и размер модели

Сколько видеопамяти нужно модели 7B в 4-bit?

Модели 7B-8B в 4-bit нужно примерно 4-6 ГБ VRAM для запуска и около 8 ГБ для комфортной работы. Минимум означает, что модель просто стартует, а комфорт это отсутствие лагов на длинных ответах.

Сколько памяти занимает модель в FP16, 8-bit и 4-bit?

Прикидка простая: FP16 берёт около 2 байт на параметр, 8-bit около 1 байта, 4-bit около 0.5 байта плюс служебные данные. Дома чаще всего выбирают Q4 или Q5: они дают хорошее соотношение качества, скорости и расхода памяти.

Почему модель начинает тормозить в длинном диалоге?

В длинном диалоге растёт KV-кэш: он зависит от контекста и числа слоёв и занимает память сверх весов модели. Сверху идёт оверхед рантайма, токенизатора и буферов, обычно пара гигабайт. Поэтому модель может влезть в память при старте и начать лагать через полчаса общения.

Какую модель выбрать для 8 ГБ RAM без дискретной видеокарты?

Для 8 ГБ оперативной памяти без дискретной видеокарты подходят модели 3B-7B в 4-bit с контекстом 2k-4k. Для чата и справки этого хватает, а генерация кода будет медленной. Ставить контекст 16k про запас не нужно: он съедает память впустую.

Что такое offload и когда его включать?

Offload это выгрузка части модели из видеопамяти в оперативную, когда VRAM не хватает. Запуститься так можно, но скорость ответов падает резко. Если тормозит, сначала уменьшите модель или контекст и только потом играйтесь с offload.

Что лучше для кода: большая универсальная модель или code-модель поменьше?

Для кода специализированная code-модель часто работает лучше, чем универсальная побольше, которая влезает в память впритык. Частая ошибка это взять самую большую модель, остаться без GPU-ускорения и ждать каждый ответ. Меньше и быстро обычно полезнее.