{}const=>[]async()letfn</>var
ИИОсновы

Нейросеть без видеокарты на слабом ноутбуке: рабочая схема

Запускаем локальную нейросеть только на CPU: выбираем маленькую GGUF или Ollama-модель, Q4, короткий контекст, число потоков и измеряем реальную скорость.

К

Кодик

Автор

7 мин чтения

Нейросеть без видеокарты на слабом ноутбуке запускается на CPU, если выбрать небольшую Q4-модель и короткий контекст. Для 8 ГБ RAM начните с 1B-3B, для 16 ГБ попробуйте 4B-7B. Ожидайте более медленную генерацию, чем на GPU, и проверяйте, не уходит ли система в swap.

llama.cpp изначально ориентирован в том числе на локальный inference на CPU, а Ollama упрощает загрузку и запуск моделей. Видеокарта не является обязательным условием, но влияет на скорость. На старом ноутбуке важны набор инструкций процессора, число физических ядер, пропускная способность памяти и охлаждение. Маленькая модель, которая отвечает стабильно, полезнее большой, из-за которой зависает вся система.

1CPU

Генерирует токены без дискретной видеокарты, но медленнее.

2Q4

Уменьшает размер весов и нагрузку на пропускную способность памяти.

3Контекст 2K

Снижает расход дополнительной памяти в первом тесте.

Выбор Q4-модели по объёму RAM и запуск на CPU без видеокарты
Порядок настройки слабого ноутбука: смотрим свободную RAM, берём модель 1B-3B в Q4, ставим контекст 2K и только после этого запускаем генерацию на CPU.

Нейросеть без видеокарты на слабом ноуте через Ollama

Начните с небольшой модели и короткого ответа. Команда ollama run скачает модель при первом вызове и откроет сессию, а API позволит измерить параметры. Для первичной диагностики достаточно CLI. Если ноутбук начинает активно писать в swap, остановите модель и выберите меньший вариант.

# Загружаем маленькую модель для CPU-теста
ollama pull gemma3:1b

# Проверяем короткий реальный запрос
ollama run gemma3:1b "Объясни цикл for на Python в 5 предложениях"

# Смотрим активную модель и размещение
ollama ps

# После теста освобождаем память
ollama stop gemma3:1b
Ожидаемый результат
  • Ответ появляется без ошибки out of memory
  • Система остаётся отзывчивой, swap не растёт постоянно

Если скорость приемлема, увеличьте задачу, но не меняйте одновременно модель и контекст. Для llama.cpp подберите количество потоков около числа физических ядер и сравните два значения. Максимальное число потоков не всегда даёт выигрыш: процессор упирается в память и нагрев, а система теряет отзывчивость. Квантизация Q5 может дать чуть больше качества, но требует больше памяти и пропускной способности.

🔥 100 000+ учеников уже с нами

Устал читать теорию?
Пора кодить!

Кодик — приложение, где ты учишься программировать через практику. AI-наставник, интерактивные уроки, реальные проекты.

🤖 AI 24/7
🎓 Сертификаты
💰 Бесплатно
🚀 Начать учиться
Присоединились сегодня

Что реально делать на слабом CPU

ЭлементЧто означаетЧто делать
Классификация текстаХорошоКороткий ввод и ограниченный ответ
Конспект страницыНормальноДелить материал на части
Небольшой кодНормальноДавать один файл и тесты
Агент по всему репозиториюТяжелоСлишком много контекста и вызовов
Распознавание изображенийТяжелее текстаНужна vision-модель и больше памяти

Не сравнивайте CPU-ноутбук с облачной моделью только по красоте ответа. Определите задачу: переписать письмо, объяснить ошибку, классифицировать заметки или помочь с одной функцией. Для узкой задачи маленькая модель может быть достаточной. Для длинного анализа разумнее облако или удалённый домашний компьютер, если данные и условия это позволяют.

Размер модели, квантизация и контекст: что менять при нехватке памяти
Три рычага, которыми вы гасите нехватку памяти: размер модели, битность квантизации и длина контекста, причём двигать их нужно по одному.

Практика: замерьте gemma3:1b на своём CPU и найдите потолок памяти

Соберите короткий замер на своём ноутбуке: одна модель gemma3:1b, один запрос, один результат в секундах. Успехом считайте ответ, который пришёл целиком без строки out of memory, при этом система осталась отзывчивой, а swap не рос всю генерацию. Все действия идут в терминале, отдельный интерфейс не нужен.

  1. Освободить RAM перед замером. Закройте браузер с вкладками и запущенные контейнеры, потом посмотрите в диспетчере задач, сколько гигабайт свободно, и запишите это число. Оно понадобится, чтобы понять, ушла ли система в swap во время генерации.
  2. Скачать gemma3:1b. Выполните ollama pull gemma3:1b и дождитесь конца загрузки. В консоли видно размер скачанных слоёв, это нижняя граница памяти, которую займёт модель.
  3. Запрос через ollama run. Запустите ollama run gemma3:1b с запросом «Объясни цикл for на Python в 5 предложениях» и засеките, сколько секунд идёт первый токен. Ответ должен появиться целиком, без строки out of memory.
  4. Посмотреть вывод ollama ps. Во втором окне терминала выполните ollama ps, пока модель ещё в памяти. Команда покажет имя модели, занятый объём и размещение, так вы убедитесь, что счёт идёт по CPU.
  5. Остановить модель ollama stop. Выполните ollama stop gemma3:1b и повторите ollama ps: список должен стать пустым. Сверьте свободную память с числом из первого шага, она должна вернуться примерно к нему.

Теперь сломайте сценарий намеренно: скачайте 7B-модель на ноутбук с 8 ГБ и задайте тот же запрос про цикл for. Первый токен пойдёт минутами, накопитель начнёт постоянно шуршать подкачкой, а окна перестанут отзываться, потому что весам не хватает оперативной памяти и часть уезжает в swap. Остановите модель через ollama stop, вернитесь к gemma3:1b и убедитесь, что отзывчивость восстановилась.

Критерий готовности. Вы можете объяснить, какой из трёх рычагов сдвинули: размер модели, битность Q4 или длину контекста. Подтверждение простое: ollama ps показывает модель на CPU, ответ приходит целиком, а свободная память после ollama stop возвращается к исходному значению. Записанные секунды до первого токена весомее ощущения «вроде работает».

Дальше сравните 1B и 3B на одних и тех же трёх запросах и запишите время до первого токена по каждому. Меняйте что-то одно: сначала модель при контексте 2K, потом контекст при той же модели. Если перейдёте на llama.cpp, поставьте число потоков около количества физических ядер и сравните два значения, а не выкручивайте максимум. Q5 пробуйте последней: качество чуть выше, но памяти и пропускной способности она требует больше.

Частые ошибки и почему они появляются

Самая дорогая ошибка состоит в попытке доказать, что ноутбук «может» запустить большую модель. Если первый токен приходится ждать минуты, рабочий сценарий уже проигран. Вторая ошибка: держать браузер с десятками вкладок и контейнеры. Третья: оценивать скорость по одному короткому ответу до прогрева и не записывать условия.

Использовать swap как норму

Разовая подкачка возможна, но постоянный swap резко ухудшает задержку и изнашивает накопитель.

Просить большой агентный проект

Разбейте задачу на один файл, одну функцию и один тестовый результат.

Не проверять качество

Маленькая модель чаще ошибается. Запускайте код, тесты и сверяйте факты по первичным источникам.

Самопроверка

Нужна ли дискретная видеокарта, чтобы запустить нейросеть локально?

Дискретная видеокарта для локального запуска не обязательна: llama.cpp и Ollama выполняют inference на CPU. Видеокарта влияет на скорость генерации, а не на саму возможность запуска. На старом ноутбуке сильнее решают объём памяти, число физических ядер и охлаждение.

Какую модель брать на ноутбуке с 8 ГБ оперативной памяти?

На 8 ГБ RAM начинайте с модели 1B-3B в квантизации Q4 и с контекстом 2K. Для 16 ГБ можно пробовать 4B-7B, но следите, остаётся ли система отзывчивой. Маленькая модель, которая отвечает стабильно, полезнее большой, из-за которой ноутбук зависает.

Что уменьшать при ошибке out of memory?

При out of memory уменьшают три вещи: размер модели, битность квантизации и длину контекста. Меняйте по одному параметру за раз, иначе непонятно, что именно помогло. Начинать проще с размера модели, он даёт самый заметный выигрыш.

Как понять, что модель слишком тяжёлая для ноутбука?

Модель слишком тяжёлая, если система уходит в постоянный swap, первый токен приходится ждать минуты, а интерфейс перестаёт отзываться. Разовая подкачка допустима, постоянная резко увеличивает задержку и изнашивает накопитель. В этом случае берите вариант меньше, а не ждите дольше.

Какие задачи реально тянет модель на слабом CPU?

На слабом CPU нормально идут классификация коротких текстов, конспект страницы по частям и правки в одном небольшом файле кода. Тяжело даются агент по всему репозиторию и распознавание изображений: первому нужно много контекста и вызовов, второму нужна vision-модель и лишняя память.

Что даёт квантизация Q5 по сравнению с Q4?

Квантизация Q5 даёт чуть больше качества, чем Q4, но забирает больше памяти и пропускной способности. На слабом ноутбуке такой обмен часто невыгоден: скорость падает заметнее, чем растёт качество ответа. Переходите на Q5 только после того, как Q4 работает стабильно.

Что делать дальше

Сравните 1B и 3B на трёх своих запросах и сохраните таблицу результатов. Код для замеров и обработки ответов можно написать после курса GenAI. Для более точного выбора используйте статью про память Ollama, а интеграцию с редактором делайте после проверки из материала про VS Code.

🎯Хватит откладывать

Понравилась статья?
Пора применять на практике!

В Кодик ты не просто читаешь — ты сразу пишешь код. Теория + практика = реальный скилл.

Мгновенная практика
🧠AI объяснит код
🏆Сертификат

Без регистрации • Без карты