ПостСредне ⏱ ~7 мин

Ollama vs llama.cpp: как запустить локальную LLM за 5 минут

Оглавление

Выбрали модель? Отлично. Теперь самое время её запустить. В этом посте — пошаговая инструкция без воды: от совсем простого варианта с графическим интерфейсом (LM Studio) до Ollama и llama.cpp. Для Mac и Windows отдельно, потому что есть нюансы.

Почему Ollama

Есть три способа запускать локальные LLM: LM Studio (приложение с интерфейсом), Ollama (командная строка) и llama.cpp (максимум контроля). Ollama и llama.cpp используют один и тот же движок (llama.cpp под капотом у Ollama), но подход разный.

Ollama — это обёртка, которая прячет сложность. Одна команда для установки, одна для скачивания модели, одна для запуска. Не нужно разбираться в параметрах квантизации, форматах тензоров, размере контекста. Ollama сама выберет оптимальные настройки под ваше железо.

llama.cpp — низкоуровневый инструмент. Полный контроль над каждым параметром: сколько потоков использовать, какой размер батча, какую стратегию размещения слоёв выбрать. Мощно, но требует понимания.

Мой совет: если хочется начать вообще без терминала — поставьте LM Studio на один вечер и пощупайте модели. А для ежедневной работы берите Ollama: она покроет 90% ваших потребностей. Переходите на llama.cpp только когда столкнётесь с ограничениями: нужна максимальная производительность, нестандартная модель, или вы хотите разобраться, как всё работает изнутри.

Самый простой старт: LM Studio

Если терминал пугает или хочется сначала просто пощупать модели мышкой — начните с LM Studio. Это десктопное приложение с графическим интерфейсом (macOS, Windows, Linux), и порог входа у него самый низкий из всех.

Как выглядит процесс: скачали приложение с lmstudio.ai → открыли встроенный каталог моделей (это фронтенд для Hugging Face) → нашли нужную модель → нажали Download → открыли чат и работаете. Ни одной команды. Каталог удобен тем, что сразу показывает, влезет ли модель в вашу память: LM Studio знает железо и помечает совместимые варианты, а квант (Q4_K_M и компания) выбирается выпадающим списком у каждой модели.

Главное, что это не «чат-игрушка»: в LM Studio есть встроенный локальный сервер с OpenAI-совместимым API на http://localhost:1234/v1. То есть всё, что дальше в этом посте подключается к Ollama (Continue, скрипты, агенты), можно подключить и к LM Studio — отличается только порт.

Минусы честно: код закрытый (Ollama и llama.cpp открыты), тонких параметров запуска меньше — хотя основные (context length, GPU offload, temperature) доступны прямо в интерфейсе. И модели в каталоге иногда отстают от свежих релизов на Hugging Face.

Моя раскладка простая: LM Studio — быстро попробовать и сравнить модели между собой, Ollama — ежедневная работа и автоматизация, llama.cpp — когда нужен максимум контроля.

Установка на macOS

Шаг 1: Установка Ollama

Самый простой способ — через Homebrew:

brew install ollama

Если Homebrew не установлен — скачайте установщик с ollama.com. Инсталлятор весит около 300 MB, установка занимает пару минут.

После установки Ollama работает как фоновый сервис. Проверьте:

ollama --version
# ollama version is 0.9.x — любая свежая подойдёт

Шаг 2: Скачивание модели

Ollama хранит модели в своём репозитории, но мы хотим использовать модели с Hugging Face — там больше выбор и свежие квантизации.

Есть два пути:

Вариант A: Модель есть в репозитории Ollama

Просто выполните:

ollama pull qwen3.5:9b

Ollama скачает модель (~6 GB для 9B-модели в Q4_K_M). Время зависит от интернета — обычно 5-15 минут.

Вариант B: Модель только на Hugging Face

Это наш случай для многих свежих моделей. Нужно создать Modelfile — инструкцию для Ollama, как использовать GGUF-файл.

Сначала скачайте GGUF с Hugging Face. Удобнее всего через huggingface-cli:

# Установка CLI
pip install huggingface-hub

# Скачивание (пример для Qwen 3 8B)
# в свежих версиях huggingface-hub CLI называется hf,
# старый huggingface-cli пока работает, но с предупреждениями
hf download unsloth/Qwen3-8B-GGUF \
  --include "*Q4_K_M.gguf" \
  --local-dir ./models

Или просто скачайте через браузер с huggingface.co — страница модели → Files and versions → нужный .gguf файл.

Теперь создайте Modelfile:

FROM ./models/qwen3-8b-q4_k_m.gguf

PARAMETER temperature 0.7
PARAMETER num_ctx 8192

SYSTEM "Ты — опытный QA automation engineer. Помогаешь писать тесты, анализировать требования, генерировать чек-листы."

Создайте модель в Ollama:

ollama create my-qwen -f Modelfile

Шаг 3: Проверка

Запустите интерактивный режим:

ollama run my-qwen

Или сразу с промптом:

ollama run my-qwen "Напиши чек-лист тестирования для формы регистрации с полями email, пароль, подтверждение пароля"

Если видите осмысленный ответ — поздравляю, ваша локальная LLM работает.

Установка на Windows

Шаг 1: Установка Ollama

Скачайте установщик с ollama.com. Запустите .exe, следуйте инструкциям. Ollama установится как служба Windows.

После установки откройте PowerShell или CMD и проверьте:

ollama --version

Шаг 2: Скачивание модели

Аналогично macOS. Если модель есть в репозитории Ollama:

ollama pull qwen2.5:4b

Для моделей с Hugging Face — скачайте .gguf через браузер (huggingface-cli на Windows может быть капризным), создайте Modelfile и выполните:

ollama create my-model -f Modelfile

Особенности Windows

WSL2: Ollama на Windows работает нативно, но для некоторых сценариев (например, интеграция с Linux-инструментами) удобнее установить её в WSL2:

# В WSL2 Ubuntu
curl -fsSL https://ollama.com/install.sh | sh

Производительность: на Windows Ollama может быть медленнее, чем на macOS с аналогичным железом. Это особенность драйверов и планировщика задач Windows. Если скорость критична — попробуйте WSL2 или llama.cpp напрямую.

Путь к моделям: по умолчанию Ollama хранит модели в C:\Users\%USERNAME%\.ollama\models. Если на диске C мало места — можно изменить через переменную окружения OLLAMA_MODELS:

# PowerShell
[Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama-models", "User")

Интеграция с редакторами

VS Code + Continue

Continue — бесплатное расширение для VS Code, которое подключается к локальной LLM.

Установка:

  1. Откройте Extensions в VS Code
  2. Поиск: «Continue»
  3. Install

Настройка под Ollama:

  1. Нажмите Ctrl+L (Cmd+L на Mac) — откроется панель Continue
  2. Кликните на иконку настроек (шестерёнка)
  3. Выберите «Ollama» как провайдера
  4. Укажите модель: my-qwen (или как вы назвали свою)

Теперь можно выделить код, нажать Ctrl+L, и попросить модель: - «Напиши тест для этой функции» - «Объясни, что делает этот код» - «Найди потенциальные баги»

Cursor

Cursor — VS Code-форк с встроенным AI. Поддерживает локальные модели через OpenAI-compatible API.

Настройка:

  1. Settings → AI → OpenAI API Key
  2. В поле Base URL введите: http://localhost:11434/v1
  3. В поле Model введите: my-qwen
  4. API Key можно указать любой (Ollama не проверяет)

Важная оговорка: через свой endpoint в Cursor заработают чат и Cmd+K, а вот Tab-автодополнение и агентские режимы исторически завязаны на их собственные модели — проверьте актуальные ограничения на момент чтения.

JetBrains IDE

Для IntelliJ IDEA, PyCharm, WebStorm — используйте плагин Continue (тот же, что и для VS Code) или Cody от Sourcegraph с настройкой локального endpoint.

Переход на llama.cpp (опционально)

Когда Ollama становится тесно, переходите на llama.cpp. Вот минимальный набор команд для старта:

Установка

# macOS с Homebrew
brew install llama.cpp

# Или сборка из исходников (make давно заменили на CMake)
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build --config Release -j

Запуск

# Базовый запуск
llama-cli \
  -m models/qwen3-8b-q4_k_m.gguf \
  -p "Напиши тест-кейс для проверки авторизации" \
  -n 512 \
  --temp 0.7

Оптимизация под ваше железо

# Mac с Apple Silicon — используем Metal GPU
llama-cli \
  -m models/qwen3-8b-q4_k_m.gguf \
  -ngl 999 \
  --temp 0.7

# Многоядерный CPU — увеличиваем потоки
llama-cli \
  -m models/qwen3-8b-q4_k_m.gguf \
  -t 8 \
  --temp 0.7

# Большой контекст
llama-cli \
  -m models/qwen3-8b-q4_k_m.gguf \
  -c 32768 \
  --temp 0.7

Параметры, которые стоит знать:

  • -ngl 999 — offload всех слоёв на GPU (для Mac/Windows с GPU)
  • -t N — количество потоков CPU (по умолчанию — все доступные)
  • -c N — размер контекста в токенах
  • -n N — максимальное количество токенов в ответе
  • --temp X — temperature (0.1 для точности, 1.0 для креативности)

Частые проблемы

«Out of memory» при запуске

Модель не помещается в RAM. Решения:

  1. Используйте более агрессивную квантизацию (Q3_K_M вместо Q4_K_M)
  2. Уменьшите размер контекста: PARAMETER num_ctx 2048 в Modelfile
  3. На Mac с Unified Memory закройте лишние приложения — ОС сама выделит память

Медленная генерация на CPU

Нормально для больших моделей на старом железе. Попробуйте:

  1. Меньшую модель (4B вместо 9B)
  2. Увеличить количество потоков: -t 8 или -t 16
  3. Включить GPU offload, если есть дискретная видеокарта

Модель говорит галлюцинации

Уменьшите temperature:

PARAMETER temperature 0.3

Или добавьте в системный промпт инструкцию быть конкретнее.

«Model not found» в Ollama

Проверьте:

  1. Правильное ли имя модели: ollama list
  2. Запущен ли сервис Ollama: ollama serve
  3. Правильный ли путь в Modelfile

Что дальше

В следующем посте — оптимизация. Как выжать максимум скорости из вашего железа без покупки нового. Параметры llama.cpp, которые реально дают прирост, и те, которые только создают видимость работы.

Если застряли на каком-то шаге — пишите в комментариях. Разберёмся вместе.

Назад

Обсуждение

Комментариев пока нет — начните тему.

Комментариев пока нет — начните тему.

Оставить комментарий

Комментарии публикуются сразу после отправки.