{}const=>[]async()letfn</>var
РазработкаИИ

Ollama: установка и настройка на ПК — как запустить Llama/другие модели локально

Разбираем, как установить Ollama на Windows, macOS и Linux, скачать Llama, Mistral и другие модели и запустить локальный AI-сервер. Пошаговый гайд для разработчиков.

К

Кодик

Автор

6 мин чтения

Что такое Ollama и зачем она тебе?

Ollama - это способ запускать LLM-модели (Llama, Mistral, Gemma, CodeLlama и др.) прямо на своём компьютере. Без внешних API, без подписок на токены и без “сервис временно недоступен”.

Как подобрать модель под свою машину

Тег latest в командах ниже скачивает не то, что вы ожидаете, поэтому указывайте конкретную версию и квантование Q4. Начните с контекста 2048-4096 и одной живой задачи, например разбора своей функции. Пока модель отвечает, выполните в соседнем терминале ollama ps и посмотрите, легла ли она в VRAM или частично осталась в RAM. Заодно засеките время до первого токена и проверьте, не ушла ли система в постоянный swap.

8 ГБ RAM

Берите 1B-4B в Q4 и один короткий запрос, иначе ответа придётся ждать минутами.

16 ГБ RAM

Здесь уже нормально живут 7B-12B в Q4, если не раздувать контекст.

24-32 ГБ

Можно пробовать 14B-27B в Q4, оставляя запас редактору и системе.

Цифра рядом с моделью в ollama list это только вес файла. Сверху лягут KV-кэш, буферы рантайма, ваш редактор и сама ОС, поэтому свободной памяти нужно заметно больше. Сравнивайте две соседние модели на одном и том же prompt, а имена вроде llama3 и codellama из примеров ниже считайте историческими: перед pull загляните в библиотеку и возьмите актуальный тег.

Идеально, если ты:

👨‍💻 хочешь тестить AI-фичи локально (прототипы, интеграции, dev-tools)

🔐 не хочешь отправлять данные «куда-то»

🌍 иногда работаешь без нормального интернета

💸 устал платить за каждый чих в облаке

Ментальная модель простая: Ollama ≈ “git для моделей”. Ты делаешь pull - и модель скачивается и готова к запуску.

Фигурки ламы, совы и лисы рядом с мини-компьютером, бирюзовая подсветка
🔥 100 000+ учеников уже с нами

Устал читать теорию?
Пора кодить!

Кодик — приложение, где ты учишься программировать через практику. AI-наставник, интерактивные уроки, реальные проекты.

🤖 AI 24/7
🎓 Сертификаты
💰 Бесплатно
🚀 Начать учиться
Присоединились сегодня

⚙️ Установка Ollama (Windows / macOS / Linux)

🍏 macOS / 🐧 Linux

На Linux открываешь терминал и ставишь одной командой. На macOS этот скрипт не подойдёт: там качаешь приложение с сайта ollama.com и переносишь в Applications.

curl -fsSL https://ollama.com/install.sh | sh

Проверка версии:

ollama --version

Windows

Скачай установщик Ollama с официального сайта и установи как обычную программу. Затем проверь в PowerShell:

ollama --version

⚠️ Если команда не находится, проверь, добавилась ли Ollama в PATH или перезапусти терминал/ПК.

📦 Скачиваем модели: Llama и “друзья”

Скачивание - это прям кайф: один pull и готово.

ollama pull llama3

Другие популярные варианты:

ollama pull mistral
ollama pull gemma
ollama pull codellama

🧑‍💻 Для кода: codellama давно не обновлялась, поэтому перед pull посмотри свежие кодовые модели в библиотеке Ollama

🧠 Универсально: llama3, mistral

⚡ Полегче: выбирай меньшие размеры (часто “7B” версии)

▶️ Запуск модели и чат

ollama run llama3

И всё - ты внутри локального чата. Да, это “как ChatGPT”, только твой. Работает офлайн, не просит подписку, не кидает капчу, не уходит “на техработы”.

Мини-ПК с кабелями и ноутбук с кодом в розово-бирюзовом неоновом свете

🧪 Локальный API для разработчика (вот тут начинается магия)

Ollama поднимает локальный сервер (обычно) на: http://localhost:11434

Пример запроса генерации:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "Напиши функцию сортировки на Python и объясни шаги"
}'

Что это даёт:

🔌 подключаешь к своему backend

🧩 делаешь чат внутри приложения

🤖 пилишь телеграм-бота на локальной модели

🛠️ автоматизируешь рутину: резюме текстов, подсказки, генерация шаблонов

Свои пресеты и Modelfile

Если хочется, чтобы модель отвечала более “строго” или “креативно”, можно сделать кастомную сборку. Например, снижая temperature.

Пример Modelfile:

FROM llama3
PARAMETER temperature 0.2

Создание кастомной модели:

ollama create mymodel -f Modelfile

Запуск:

ollama run mymodel

💡 Идея: сделай “mymodel-docs” для документации, “mymodel-code” для кода, “mymodel-support” для саппорта. Это как разные “персонажи”, но без мульти-аккаунтов.

💻 Требования к ПК: чтобы не “лагало и плакало”

  • Минимум: 8 ГБ RAM + SSD (будет жить, но без лишнего героизма)

  • Комфорт: 16-32 ГБ RAM (нормальный дев-режим)

  • GPU: приятно иметь, но не обязательно (зависит от модели и размеров)

⚠️ Если у тебя 8-16 ГБ RAM - начинай с моделей поменьше. Большие модели любят съедать память так, будто это бесплатный шведский стол.

📌 Где прокачаться дальше?

Окей, модель ты поднял. Но чтобы реально расти как разработчик (и не быть человеком, который просто красиво вводит промпты 😅), нужна практика.

В приложении Кодик можно учить программирование через задания и практику: меньше “воды” - больше реального кода и полезных упражнений.

А ещё у нас есть Telegram-сообщество, где выходят полезные посты для разработчиков - удобно повторять и держать мозг в тонусе прямо в телефоне.

AI - это усилитель. Но базовые навыки (код, алгоритмы, архитектура) - это то, что делает тебя разработчиком, а не “оператором умной клавиатуры”.

Что спрашивают про Ollama

Команда ollama не найдена после установки, что делать?

Если терминал не находит команду ollama, проверьте, добавилась ли программа в PATH, и перезапустите терминал или компьютер. Затем выполните ollama --version: вывод версии значит, что установка прошла нормально.

Чем ollama pull отличается от ollama run?

Команда ollama pull только скачивает модель в локальный кэш, например ollama pull llama3. Команда ollama run открывает чат с моделью и при необходимости скачивает её сама. Ментальная модель простая: Ollama работает как git для моделей.

На каком порту работает локальный API Ollama?

Ollama поднимает локальный сервер обычно на http://localhost:11434. Запрос генерации отправляют на /api/generate с полями model и prompt. Этот API удобно подключать к своему бэкенду, чату внутри приложения или телеграм-боту.

Как задать модели свою температуру в Ollama?

Свои параметры задают через Modelfile: строка FROM llama3 указывает базовую модель, а PARAMETER temperature 0.2 делает ответы строже. Дальше выполните ollama create mymodel -f Modelfile и ollama run mymodel. Так удобно держать отдельные пресеты для кода, документации и поддержки.

Какую модель скачать в Ollama для работы с кодом?

Для кода в Ollama обычно берут codellama, для универсальных задач llama3 или mistral, есть ещё gemma. Скачиваются они одной командой вида ollama pull codellama. Если железо слабое, выбирайте версии поменьше, часто это варианты 7B.

Пойдёт ли Ollama на ноутбуке с 8 ГБ оперативной памяти?

На 8 ГБ оперативной памяти и SSD Ollama запустится, но начинать нужно с небольших моделей: крупные съедают память очень быстро. Комфортный режим для разработки это 16-32 ГБ. Видеокарта приятна, но не обязательна, многое зависит от модели и её размера.

🎯Хватит откладывать

Понравилась статья?
Пора применять на практике!

В Кодик ты не просто читаешь — ты сразу пишешь код. Теория + практика = реальный скилл.

Мгновенная практика
🧠AI объяснит код
🏆Сертификат

Без регистрации • Без карты