Нейросеть без видеокарты на слабом ноутбуке запускается на CPU, если выбрать небольшую Q4-модель и короткий контекст. Для 8 ГБ RAM начните с 1B-3B, для 16 ГБ попробуйте 4B-7B. Ожидайте более медленную генерацию, чем на GPU, и проверяйте, не уходит ли система в swap.
llama.cpp изначально ориентирован в том числе на локальный inference на CPU, а Ollama упрощает загрузку и запуск моделей. Видеокарта не является обязательным условием, но влияет на скорость. На старом ноутбуке важны набор инструкций процессора, число физических ядер, пропускная способность памяти и охлаждение. Маленькая модель, которая отвечает стабильно, полезнее большой, из-за которой зависает вся система.
Генерирует токены без дискретной видеокарты, но медленнее.
Уменьшает размер весов и нагрузку на пропускную способность памяти.
Снижает расход дополнительной памяти в первом тесте.

Нейросеть без видеокарты на слабом ноуте через Ollama
Начните с небольшой модели и короткого ответа. Команда ollama run скачает модель при первом вызове и откроет сессию, а API позволит измерить параметры. Для первичной диагностики достаточно CLI. Если ноутбук начинает активно писать в swap, остановите модель и выберите меньший вариант.
# Загружаем маленькую модель для CPU-теста
ollama pull gemma3:1b
# Проверяем короткий реальный запрос
ollama run gemma3:1b "Объясни цикл for на Python в 5 предложениях"
# Смотрим активную модель и размещение
ollama ps
# После теста освобождаем память
ollama stop gemma3:1b- Ответ появляется без ошибки out of memory
- Система остаётся отзывчивой, swap не растёт постоянно
Если скорость приемлема, увеличьте задачу, но не меняйте одновременно модель и контекст. Для llama.cpp подберите количество потоков около числа физических ядер и сравните два значения. Максимальное число потоков не всегда даёт выигрыш: процессор упирается в память и нагрев, а система теряет отзывчивость. Квантизация Q5 может дать чуть больше качества, но требует больше памяти и пропускной способности.
Что реально делать на слабом CPU
| Элемент | Что означает | Что делать |
|---|---|---|
| Классификация текста | Хорошо | Короткий ввод и ограниченный ответ |
| Конспект страницы | Нормально | Делить материал на части |
| Небольшой код | Нормально | Давать один файл и тесты |
| Агент по всему репозиторию | Тяжело | Слишком много контекста и вызовов |
| Распознавание изображений | Тяжелее текста | Нужна vision-модель и больше памяти |
Не сравнивайте CPU-ноутбук с облачной моделью только по красоте ответа. Определите задачу: переписать письмо, объяснить ошибку, классифицировать заметки или помочь с одной функцией. Для узкой задачи маленькая модель может быть достаточной. Для длинного анализа разумнее облако или удалённый домашний компьютер, если данные и условия это позволяют.

Практика: замерьте gemma3:1b на своём CPU и найдите потолок памяти
Соберите короткий замер на своём ноутбуке: одна модель gemma3:1b, один запрос, один результат в секундах. Успехом считайте ответ, который пришёл целиком без строки out of memory, при этом система осталась отзывчивой, а swap не рос всю генерацию. Все действия идут в терминале, отдельный интерфейс не нужен.
- Освободить RAM перед замером. Закройте браузер с вкладками и запущенные контейнеры, потом посмотрите в диспетчере задач, сколько гигабайт свободно, и запишите это число. Оно понадобится, чтобы понять, ушла ли система в swap во время генерации.
- Скачать gemma3:1b. Выполните ollama pull gemma3:1b и дождитесь конца загрузки. В консоли видно размер скачанных слоёв, это нижняя граница памяти, которую займёт модель.
- Запрос через ollama run. Запустите ollama run gemma3:1b с запросом «Объясни цикл for на Python в 5 предложениях» и засеките, сколько секунд идёт первый токен. Ответ должен появиться целиком, без строки out of memory.
- Посмотреть вывод ollama ps. Во втором окне терминала выполните ollama ps, пока модель ещё в памяти. Команда покажет имя модели, занятый объём и размещение, так вы убедитесь, что счёт идёт по CPU.
- Остановить модель ollama stop. Выполните ollama stop gemma3:1b и повторите ollama ps: список должен стать пустым. Сверьте свободную память с числом из первого шага, она должна вернуться примерно к нему.
Теперь сломайте сценарий намеренно: скачайте 7B-модель на ноутбук с 8 ГБ и задайте тот же запрос про цикл for. Первый токен пойдёт минутами, накопитель начнёт постоянно шуршать подкачкой, а окна перестанут отзываться, потому что весам не хватает оперативной памяти и часть уезжает в swap. Остановите модель через ollama stop, вернитесь к gemma3:1b и убедитесь, что отзывчивость восстановилась.
Дальше сравните 1B и 3B на одних и тех же трёх запросах и запишите время до первого токена по каждому. Меняйте что-то одно: сначала модель при контексте 2K, потом контекст при той же модели. Если перейдёте на llama.cpp, поставьте число потоков около количества физических ядер и сравните два значения, а не выкручивайте максимум. Q5 пробуйте последней: качество чуть выше, но памяти и пропускной способности она требует больше.
Частые ошибки и почему они появляются
Самая дорогая ошибка состоит в попытке доказать, что ноутбук «может» запустить большую модель. Если первый токен приходится ждать минуты, рабочий сценарий уже проигран. Вторая ошибка: держать браузер с десятками вкладок и контейнеры. Третья: оценивать скорость по одному короткому ответу до прогрева и не записывать условия.
Разовая подкачка возможна, но постоянный swap резко ухудшает задержку и изнашивает накопитель.
Разбейте задачу на один файл, одну функцию и один тестовый результат.
Маленькая модель чаще ошибается. Запускайте код, тесты и сверяйте факты по первичным источникам.
Самопроверка
Нужна ли дискретная видеокарта, чтобы запустить нейросеть локально?
Дискретная видеокарта для локального запуска не обязательна: llama.cpp и Ollama выполняют inference на CPU. Видеокарта влияет на скорость генерации, а не на саму возможность запуска. На старом ноутбуке сильнее решают объём памяти, число физических ядер и охлаждение.
Какую модель брать на ноутбуке с 8 ГБ оперативной памяти?
На 8 ГБ RAM начинайте с модели 1B-3B в квантизации Q4 и с контекстом 2K. Для 16 ГБ можно пробовать 4B-7B, но следите, остаётся ли система отзывчивой. Маленькая модель, которая отвечает стабильно, полезнее большой, из-за которой ноутбук зависает.
Что уменьшать при ошибке out of memory?
При out of memory уменьшают три вещи: размер модели, битность квантизации и длину контекста. Меняйте по одному параметру за раз, иначе непонятно, что именно помогло. Начинать проще с размера модели, он даёт самый заметный выигрыш.
Как понять, что модель слишком тяжёлая для ноутбука?
Модель слишком тяжёлая, если система уходит в постоянный swap, первый токен приходится ждать минуты, а интерфейс перестаёт отзываться. Разовая подкачка допустима, постоянная резко увеличивает задержку и изнашивает накопитель. В этом случае берите вариант меньше, а не ждите дольше.
Какие задачи реально тянет модель на слабом CPU?
На слабом CPU нормально идут классификация коротких текстов, конспект страницы по частям и правки в одном небольшом файле кода. Тяжело даются агент по всему репозиторию и распознавание изображений: первому нужно много контекста и вызовов, второму нужна vision-модель и лишняя память.
Что даёт квантизация Q5 по сравнению с Q4?
Квантизация Q5 даёт чуть больше качества, чем Q4, но забирает больше памяти и пропускной способности. На слабом ноутбуке такой обмен часто невыгоден: скорость падает заметнее, чем растёт качество ответа. Переходите на Q5 только после того, как Q4 работает стабильно.
Что делать дальше
Сравните 1B и 3B на трёх своих запросах и сохраните таблицу результатов. Код для замеров и обработки ответов можно написать после курса GenAI. Для более точного выбора используйте статью про память Ollama, а интеграцию с редактором делайте после проверки из материала про VS Code.
