Выбрали модель? Отлично. Теперь самое время её запустить. В этом посте — пошаговая инструкция без воды: от совсем простого варианта с графическим интерфейсом (LM Studio) до Ollama и llama.cpp. Для Mac и Windows отдельно, потому что есть нюансы.
Почему Ollama
Есть три способа запускать локальные LLM: LM Studio (приложение с интерфейсом), Ollama (командная строка) и llama.cpp (максимум контроля). Ollama и llama.cpp используют один и тот же движок (llama.cpp под капотом у Ollama), но подход разный.
Ollama — это обёртка, которая прячет сложность. Одна команда для установки, одна для скачивания модели, одна для запуска. Не нужно разбираться в параметрах квантизации, форматах тензоров, размере контекста. Ollama сама выберет оптимальные настройки под ваше железо.
llama.cpp — низкоуровневый инструмент. Полный контроль над каждым параметром: сколько потоков использовать, какой размер батча, какую стратегию размещения слоёв выбрать. Мощно, но требует понимания.
Мой совет: если хочется начать вообще без терминала — поставьте LM Studio на один вечер и пощупайте модели. А для ежедневной работы берите Ollama: она покроет 90% ваших потребностей. Переходите на llama.cpp только когда столкнётесь с ограничениями: нужна максимальная производительность, нестандартная модель, или вы хотите разобраться, как всё работает изнутри.
Самый простой старт: LM Studio
Если терминал пугает или хочется сначала просто пощупать модели мышкой — начните с LM Studio. Это десктопное приложение с графическим интерфейсом (macOS, Windows, Linux), и порог входа у него самый низкий из всех.
Как выглядит процесс: скачали приложение с lmstudio.ai → открыли встроенный каталог моделей (это фронтенд для Hugging Face) → нашли нужную модель → нажали Download → открыли чат и работаете. Ни одной команды. Каталог удобен тем, что сразу показывает, влезет ли модель в вашу память: LM Studio знает железо и помечает совместимые варианты, а квант (Q4_K_M и компания) выбирается выпадающим списком у каждой модели.
Главное, что это не «чат-игрушка»: в LM Studio есть встроенный локальный сервер с OpenAI-совместимым API на http://localhost:1234/v1. То есть всё, что дальше в этом посте подключается к Ollama (Continue, скрипты, агенты), можно подключить и к LM Studio — отличается только порт.
Минусы честно: код закрытый (Ollama и llama.cpp открыты), тонких параметров запуска меньше — хотя основные (context length, GPU offload, temperature) доступны прямо в интерфейсе. И модели в каталоге иногда отстают от свежих релизов на Hugging Face.
Моя раскладка простая: LM Studio — быстро попробовать и сравнить модели между собой, Ollama — ежедневная работа и автоматизация, llama.cpp — когда нужен максимум контроля.
Установка на macOS
Шаг 1: Установка Ollama
Самый простой способ — через Homebrew:
brew install ollama
Если Homebrew не установлен — скачайте установщик с ollama.com. Инсталлятор весит около 300 MB, установка занимает пару минут.
После установки Ollama работает как фоновый сервис. Проверьте:
ollama --version
# ollama version is 0.9.x — любая свежая подойдёт
Шаг 2: Скачивание модели
Ollama хранит модели в своём репозитории, но мы хотим использовать модели с Hugging Face — там больше выбор и свежие квантизации.
Есть два пути:
Вариант A: Модель есть в репозитории Ollama
Просто выполните:
ollama pull qwen3.5:9b
Ollama скачает модель (~6 GB для 9B-модели в Q4_K_M). Время зависит от интернета — обычно 5-15 минут.
Вариант B: Модель только на Hugging Face
Это наш случай для многих свежих моделей. Нужно создать Modelfile — инструкцию для Ollama, как использовать GGUF-файл.
Сначала скачайте GGUF с Hugging Face. Удобнее всего через huggingface-cli:
# Установка CLI
pip install huggingface-hub
# Скачивание (пример для Qwen 3 8B)
# в свежих версиях huggingface-hub CLI называется hf,
# старый huggingface-cli пока работает, но с предупреждениями
hf download unsloth/Qwen3-8B-GGUF \
--include "*Q4_K_M.gguf" \
--local-dir ./models
Или просто скачайте через браузер с huggingface.co — страница модели → Files and versions → нужный .gguf файл.
Теперь создайте Modelfile:
FROM ./models/qwen3-8b-q4_k_m.gguf
PARAMETER temperature 0.7
PARAMETER num_ctx 8192
SYSTEM "Ты — опытный QA automation engineer. Помогаешь писать тесты, анализировать требования, генерировать чек-листы."
Создайте модель в Ollama:
ollama create my-qwen -f Modelfile
Шаг 3: Проверка
Запустите интерактивный режим:
ollama run my-qwen
Или сразу с промптом:
ollama run my-qwen "Напиши чек-лист тестирования для формы регистрации с полями email, пароль, подтверждение пароля"
Если видите осмысленный ответ — поздравляю, ваша локальная LLM работает.
Установка на Windows
Шаг 1: Установка Ollama
Скачайте установщик с ollama.com. Запустите .exe, следуйте инструкциям. Ollama установится как служба Windows.
После установки откройте PowerShell или CMD и проверьте:
ollama --version
Шаг 2: Скачивание модели
Аналогично macOS. Если модель есть в репозитории Ollama:
ollama pull qwen2.5:4b
Для моделей с Hugging Face — скачайте .gguf через браузер (huggingface-cli на Windows может быть капризным), создайте Modelfile и выполните:
ollama create my-model -f Modelfile
Особенности Windows
WSL2: Ollama на Windows работает нативно, но для некоторых сценариев (например, интеграция с Linux-инструментами) удобнее установить её в WSL2:
# В WSL2 Ubuntu
curl -fsSL https://ollama.com/install.sh | sh
Производительность: на Windows Ollama может быть медленнее, чем на macOS с аналогичным железом. Это особенность драйверов и планировщика задач Windows. Если скорость критична — попробуйте WSL2 или llama.cpp напрямую.
Путь к моделям: по умолчанию Ollama хранит модели в C:\Users\%USERNAME%\.ollama\models. Если на диске C мало места — можно изменить через переменную окружения OLLAMA_MODELS:
# PowerShell
[Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama-models", "User")
Интеграция с редакторами
VS Code + Continue
Continue — бесплатное расширение для VS Code, которое подключается к локальной LLM.
Установка:
- Откройте Extensions в VS Code
- Поиск: «Continue»
- Install
Настройка под Ollama:
- Нажмите Ctrl+L (Cmd+L на Mac) — откроется панель Continue
- Кликните на иконку настроек (шестерёнка)
- Выберите «Ollama» как провайдера
- Укажите модель:
my-qwen(или как вы назвали свою)
Теперь можно выделить код, нажать Ctrl+L, и попросить модель: - «Напиши тест для этой функции» - «Объясни, что делает этот код» - «Найди потенциальные баги»
Cursor
Cursor — VS Code-форк с встроенным AI. Поддерживает локальные модели через OpenAI-compatible API.
Настройка:
- Settings → AI → OpenAI API Key
- В поле Base URL введите:
http://localhost:11434/v1 - В поле Model введите:
my-qwen - API Key можно указать любой (Ollama не проверяет)
Важная оговорка: через свой endpoint в Cursor заработают чат и Cmd+K, а вот Tab-автодополнение и агентские режимы исторически завязаны на их собственные модели — проверьте актуальные ограничения на момент чтения.
JetBrains IDE
Для IntelliJ IDEA, PyCharm, WebStorm — используйте плагин Continue (тот же, что и для VS Code) или Cody от Sourcegraph с настройкой локального endpoint.
Переход на llama.cpp (опционально)
Когда Ollama становится тесно, переходите на llama.cpp. Вот минимальный набор команд для старта:
Установка
# macOS с Homebrew
brew install llama.cpp
# Или сборка из исходников (make давно заменили на CMake)
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build --config Release -j
Запуск
# Базовый запуск
llama-cli \
-m models/qwen3-8b-q4_k_m.gguf \
-p "Напиши тест-кейс для проверки авторизации" \
-n 512 \
--temp 0.7
Оптимизация под ваше железо
# Mac с Apple Silicon — используем Metal GPU
llama-cli \
-m models/qwen3-8b-q4_k_m.gguf \
-ngl 999 \
--temp 0.7
# Многоядерный CPU — увеличиваем потоки
llama-cli \
-m models/qwen3-8b-q4_k_m.gguf \
-t 8 \
--temp 0.7
# Большой контекст
llama-cli \
-m models/qwen3-8b-q4_k_m.gguf \
-c 32768 \
--temp 0.7
Параметры, которые стоит знать:
-ngl 999— offload всех слоёв на GPU (для Mac/Windows с GPU)-t N— количество потоков CPU (по умолчанию — все доступные)-c N— размер контекста в токенах-n N— максимальное количество токенов в ответе--temp X— temperature (0.1 для точности, 1.0 для креативности)
Частые проблемы
«Out of memory» при запуске
Модель не помещается в RAM. Решения:
- Используйте более агрессивную квантизацию (Q3_K_M вместо Q4_K_M)
- Уменьшите размер контекста:
PARAMETER num_ctx 2048в Modelfile - На Mac с Unified Memory закройте лишние приложения — ОС сама выделит память
Медленная генерация на CPU
Нормально для больших моделей на старом железе. Попробуйте:
- Меньшую модель (4B вместо 9B)
- Увеличить количество потоков:
-t 8или-t 16 - Включить GPU offload, если есть дискретная видеокарта
Модель говорит галлюцинации
Уменьшите temperature:
PARAMETER temperature 0.3
Или добавьте в системный промпт инструкцию быть конкретнее.
«Model not found» в Ollama
Проверьте:
- Правильное ли имя модели:
ollama list - Запущен ли сервис Ollama:
ollama serve - Правильный ли путь в Modelfile
Что дальше
В следующем посте — оптимизация. Как выжать максимум скорости из вашего железа без покупки нового. Параметры llama.cpp, которые реально дают прирост, и те, которые только создают видимость работы.
Если застряли на каком-то шаге — пишите в комментариях. Разберёмся вместе.
Discussion
No comments yet - start the thread.