Перейти к содержимому
Искусственный интеллект

Как запустить нейросеть локально на компьютере: полный гайд по Ollama и выбору моделей

MJ
Редакция Malina·· 19 мин
Как запустить нейросеть локально на компьютере: полный гайд по Ollama и выбору моделей

Ollama позволяет скачать языковую модель на свой компьютер и обращаться к ней через чат, командную строку или локальный API. Разбираемся, чем Ollama отличается от Llama, как не ошибиться с моделью и памятью, что проверить при медленной работе и какие настройки действительно влияют на приватность.

Локальный ИИ уже не требует собирать программный стек вручную, но кнопки «установить» всё равно недостаточно. Скорость, качество и даже возможность запуска зависят от конкретной модели, её тега, доступной памяти и длины контекста. Ниже — путь от чистой системы до рабочего Ollama с понятной диагностикой, безопасными настройками и, при желании, браузерным интерфейсом Open WebUI.

Сначала главное: Ollama — не Llama

В названиях легко запутаться. Llama — семейство языковых моделей Meta: именно модель получает текст и генерирует продолжение. Ollama — приложение и локальный сервер, который скачивает модели, запускает их на доступном процессоре или GPU и даёт к ним единый интерфейс: командную строку и HTTP API. Через Ollama можно запускать не только Llama, но и Qwen, Gemma, Mistral, DeepSeek, Phi и другие семейства из каталога.

Упрощённо: модель — это «мозг» и набор весов, а Ollama — среда, которая хранит эти веса и организует работу с ними. Ещё один отдельный слой — Open WebUI. Он добавляет браузерный чат, пользователей, историю, работу с документами и подключения к разным провайдерам, но собственных языковых моделей у него нет.

Локальный запуск полезен не потому, что автоматически делает любую модель лучше облачной. Его преимущества практичнее: можно работать при нестабильном интернете, выбирать и фиксировать модель, встраивать локальный API в свои программы и не отправлять содержание локального диалога внешнему поставщику модели. За это приходится платить дисковым пространством, нагрузкой на память, иногда низкой скоростью и необходимостью самостоятельно обновлять и защищать систему.

Что проверить до установки

Ollama работает на Windows, macOS и Linux, но подходящее железо определяется не одной цифрой. Для GPU-вычислений Ollama поддерживает Nvidia с compute capability 5.0+, перечисленные AMD Radeon через ROCm, дополнительные AMD и другие GPU через Vulkan, а Apple GPU — через Metal. На компьютере без совместимого GPU модель может выполняться на CPU и использовать системную RAM — обычно это заметно медленнее, но для небольших моделей и нечастых запросов остаётся рабочим вариантом.

Минимальные требования самих приложений не равны требованиям модели. На Windows нужен Windows 10 22H2 или новее; установка Ollama занимает не менее 4 ГБ, а модели могут потребовать ещё десятки или сотни гигабайт. На Mac требуется macOS Sonoma 14 или новее: компьютеры Apple M получают ускорение CPU и GPU, Intel Mac работает на CPU. Общая страница аппаратной поддержки указывает для Nvidia драйвер 550 или новее, а страница Windows — 551.61 или новее; для compute capability 5.0–6.2 требуется драйвер 570 или новее. Поддержка AMD различается по ОС и конкретной карте, поэтому название «Radeon» само по себе ничего не гарантирует.

Перед выбором модели выясните три вещи:

  1. Задача. Обычный чат, правка русского текста, код, распознавание изображения и семантический поиск требуют разных моделей.
  2. Где будет выполняться модель. В VRAM дискретной видеокарты, в общей памяти Apple Silicon или преимущественно в системной RAM.
  3. Какой контекст нужен. Один вопрос занимает мало памяти; длинная переписка, большой документ или агент с инструментами — гораздо больше.

Не стоит превращать это в формулу вида «8 ГБ VRAM = любая 7B». Размер файла зависит от тега и квантования, во время работы нужны память под саму модель и растущий KV-кэш контекста, часть ресурсов занимает система. Два варианта с одинаковым числом параметров тоже могут вести себя по-разному. Надёжнее оставить запас памяти, начать с меньшего тега и проверить реальную задачу, а не чужой короткий бенчмарк.

Установка Ollama на Windows, macOS и Linux

Windows

Скачайте OllamaSetup.exe со страницы Windows в официальной документации и запустите его. Права администратора для обычной установки не требуются: приложение ставится в профиль пользователя, работает в фоне, а команда ollama становится доступна в PowerShell, cmd и Windows Terminal. Локальный API по умолчанию слушает http://localhost:11434.

Закройте и заново откройте терминал, затем проверьте установку:

ollama -v

Запустите небольшую модель:

ollama run qwen3:4b

При первом запуске нужный тег будет загружен. После появления приглашения задайте вопрос, а для выхода из интерактивного чата введите /bye.

Если системный диск мал, заранее задайте пользовательскую переменную OLLAMA_MODELS с путём к другому каталогу. После изменения полностью завершите Ollama через значок в области уведомлений и запустите снова. По умолчанию модели и конфигурация находятся в C:\Users\<имя>\.ollama, а логи — в %LOCALAPPDATA%\Ollama.

macOS

Официальный способ — открыть ollama.dmg и перетащить Ollama в /Applications. При первом старте приложение проверит команду в PATH и при необходимости предложит создать ссылку в /usr/local/bin.

В новом окне Terminal выполните:

ollama -v
ollama run qwen3:4b

На Apple Silicon Ollama использует Metal. На Intel Mac доступно выполнение на CPU. Модели и конфигурация по умолчанию лежат в ~/.ollama, журналы — в ~/.ollama/logs. Не пытайтесь оценивать возможность запуска только по слову «Mac»: важны архитектура, общий объём памяти и то, сколько её уже заняли другие приложения.

Linux

Для стандартной установки официальная документация предлагает:

curl -fsSL https://ollama.com/install.sh | sh

Проверьте версию и состояние сервиса:

ollama -v
sudo systemctl status ollama

Если сервис ещё не запущен:

sudo systemctl start ollama

Теперь можно скачать и открыть модель:

ollama run qwen3:4b

Для Nvidia сначала должен корректно работать драйвер; команда nvidia-smi должна показать видеокарту. Для AMD на Linux официальная документация требует ROCm v7 для перечисленных карт, а дополнительная поддержка возможна через Vulkan. Не копируйте случайные переменные совместимости для чужой карты: сначала сверьте конкретное устройство со списком Ollama и проверьте, куда реально загрузилась модель.

Скрипт установки удобен, но команда curl | sh исполняет загруженный код. В организации разумно сначала скачать и изучить скрипт либо использовать описанную в документации ручную установку и внутренний процесс контроля пакетов.

Первый запуск и шесть команд, которые стоит запомнить

Ollama можно использовать без отдельного интерфейса. Для явной загрузки выбранного тега и запуска чата подойдут:

ollama pull qwen3:4b
ollama run qwen3:4b

Практический набор для обслуживания:

ollama ls
ollama ps
ollama stop qwen3:4b
ollama rm qwen3:4b

ls показывает установленные модели, ps — модели, находящиеся в памяти, и способ их размещения. stop выгружает модель из оперативной памяти, но не удаляет с диска. rm удаляет выбранный тег и освобождает дисковое место. В имени важна вся строка после двоеточия: qwen3:4b и другой тег того же семейства — не один и тот же локальный объект.

По умолчанию Ollama держит использованную модель в памяти пять минут, чтобы следующий запрос стартовал быстрее. Поэтому занятая VRAM сразу после закрытия чата не обязательно означает зависание. Если память нужна немедленно, используйте ollama stop <имя>.

Как выбрать модель под работу, а не под рейтинг

Число 4b, 8b или 32b приблизительно описывает количество параметров — не требуемую VRAM и не размер загрузки. В каталоге у семейства бывает много тегов: они могут отличаться размером модели, вариантом настройки и квантованием. Теги меняются, а latest не означает «лучший именно для моего компьютера». Перед большой загрузкой откройте страницу семейства в каталоге, выберите конкретный тег и посмотрите указанный там размер.

Ниже — не рейтинг и не полный каталог, а короткий список моделей разных классов по состоянию на 12 сентября 2026 года. В колонке указаны размеры семейства в каталоге, а не гигабайты файла.

СемействоРазмеры и варианты в каталоге на дату проверкиКогда включать в короткий список
llama3.21B, 3BКомпактный текстовый помощник и первый тест слабого компьютера; в каталоге отмечена поддержка tools
llama3.18B, 70B, 405BУниверсальный текстовый чат и инструменты; начинать логично с 8B, крупные варианты требуют несравнимо больше ресурсов
qwen30.6B, 1.7B, 4B, 8B, 14B, 30B, 32B, 235BОбщий чат, tools и thinking; удобная лестница размеров для сравнений на одном наборе задач
gemma3270M, 1B, 4B, 12B, 27BОт очень компактных до крупных вариантов; семейство помечено как vision, но возможности надо сверять у конкретного тега
qwen2.5-coder0.5B, 1.5B, 3B, 7B, 14B, 32BГенерация, объяснение и исправление кода; специализированный кандидат вместо универсального чата
deepseek-r11.5B, 7B, 8B, 14B, 32B, 70B, 671BЗадачи, где полезен режим рассуждения; длинный вывод повышает время ответа и расход контекста
mistral-nemo12BТекст и длинные материалы; каталог указывает контекст 128K, но выделять максимум без проверки памяти не следует
ministral-33B, 8B, 14BСемейство для edge-развёртывания; в каталоге отмечены vision и tools, проверяйте выбранный тег
qwen3-vl2B, 4B, 8B, 30B, 32B, 235BВопросы по изображениям и визуальным документам; обычная текстовая модель картинку не «увидит»
nomic-embed-textсемейство embedding, 3 тегаВекторный поиск и RAG, а не разговорный ассистент
qwen3-embedding0.6B, 4B, 8BТекстовые эмбеддинги разных размеров; не заменяет генеративную чат-модель

У каталога есть также семейства и отдельные теги с пометкой cloud. Такой запуск нельзя считать локальным только потому, что команда начинается с ollama run: облачная модель обрабатывается удалённо. Аналогично метки vision, tools, thinking, audio и embedding описывают назначение, но окончательные возможности зависят от конкретного тега и клиента.

Рабочая стратегия выбора состоит из короткого сравнения:

  • Для писем, заметок и русского текста возьмите два многоязычных кандидата близкого размера, например теги Qwen и ещё одного семейства, и дайте им 10–20 своих типичных запросов.
  • Для кода сравнивайте специализированную coder-модель с универсальной на вашем языке, фреймворке и типе ошибок.
  • Для документов сначала решите, нужен ли весь текст в контексте или поиск по фрагментам через embedding/RAG. Это разные нагрузки и разные риски ошибок.
  • Для изображений выбирайте тег с подтверждённой поддержкой vision. Название семейства без подходящего варианта недостаточно.
  • Для регулярной работы оценивайте не только качество ответа, но и время первого запуска, скорость продолжения, потребление памяти и стабильность на нужной длине диалога.

Начните с модели, которая уверенно помещается в доступную память, затем поднимайтесь на один размер. Если более крупный вариант частично ушёл на CPU, стал в разы менее отзывчивым или заставил сократить рабочий контекст, меньшая модель может оказаться полезнее каждый день.

Контекст: почему модель помещалась, а потом закончилась память

Контекст — максимальный объём токенов, к которому модель имеет доступ при ответе. В него входят системные инструкции, предыдущие реплики, текущий запрос, вставленные документы и служебные результаты инструментов. Токен не равен слову, поэтому переводить лимит в точное число страниц без конкретного текста и токенизатора некорректно.

Чем длиннее контекст, тем больше памяти нужен KV-кэшу. Это объясняет типичную ситуацию: веса модели помещаются в VRAM, короткий чат работает хорошо, а после загрузки документа или увеличения num_ctx начинается перенос на CPU либо ошибка памяти. Параллельность усиливает эффект: по FAQ Ollama требуемая память контекста масштабируется с числом параллельных запросов.

В официальной документации встречаются разные формулировки значения по умолчанию. FAQ называет 4096 токенов, а отдельная страница о контексте описывает автоматический выбор по VRAM: меньше 24 GiB — 4K, от 24 до 48 GiB — 32K, от 48 GiB — 256K. Поэтому не полагайтесь на предполагаемое значение — смотрите фактически выделенный контекст:

ollama ps

Колонка CONTEXT показывает значение, а PROCESSOR — долю CPU/GPU. В shell macOS или Linux контекст при ручном запуске сервера можно задать так (на Windows переменная задаётся в настройках среды, после чего Ollama нужно перезапустить):

OLLAMA_CONTEXT_LENGTH=8192 ollama serve

В интерактивном сеансе ollama run доступна команда:

/set parameter num_ctx 8192

Увеличивайте значение только под измеримую потребность. Для короткой правки текста 64K может просто съесть память. Для больших документов, веб-поиска, агентов и coding tools официальный раздел рекомендует не менее 64 000 токенов, но одновременно предупреждает о росте VRAM. Если железо не позволяет, практичнее разбить материал, начать новый чат, делать промежуточные конспекты или использовать RAG, а не любой ценой выставлять максимум модели.

Open WebUI: когда терминала уже мало

Open WebUI удобен, если нужен интерфейс в браузере, история диалогов, несколько пользователей или работа с документами. Он умеет подключать локальный Ollama и OpenAI-совместимые API. Это важно для приватности: добавленный облачный провайдер, веб-поиск, внешнее распознавание речи или другой плагин может отправлять данные наружу, даже если базовая модель локальная.

Рекомендованный для большинства пользователей способ установки Open WebUI — Docker. Сначала установите и запустите Docker, затем создайте постоянный секрет. В macOS, Linux, WSL или другой среде с OpenSSL:

openssl rand -hex 32

Скопируйте результат вместо REPLACE_WITH_GENERATED_KEY и выполните одной строкой:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=REPLACE_WITH_GENERATED_KEY --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Откройте http://localhost:3000. Первый созданный аккаунт становится администратором. Том open-webui:/app/backend/data обязателен: в нём сохраняются пользователи, чаты и настройки. Постоянный WEBUI_SECRET_KEY нужно сохранить и использовать при пересоздании контейнера, иначе пользователей разлогинит.

Тег образа :main — плавающий: он следует за основной веткой, а не обозначает неизменный стабильный релиз. Для воспроизводимого рабочего развёртывания документация советует закрепить конкретный :vX.Y.Z. Образ :dev предназначен для предварительных сборок. Вариант :ollama содержит Ollama внутри контейнера, но для уже установленного на компьютере Ollama стандартный :main проще и не создаёт второй независимый склад моделей. Образ :cuda нужен для функций Open WebUI, использующих Nvidia GPU; он не требуется лишь для того, чтобы отдельный Ollama на хосте использовал свою видеокарту.

Если список моделей пуст, контейнер, вероятно, не видит API на хосте. Проверьте:

docker logs -f open-webui

Стандартная команда добавляет имя host.docker.internal. В настройках Open WebUI соединение должно вести к http://host.docker.internal:11434. В некоторых Docker-средах Ollama на хосте должен слушать не только 127.0.0.1; это меняется через OLLAMA_HOST. На Linux альтернативой из документации служит --network=host, но тогда интерфейс открывается на порту 8080. Не переключайте Ollama на 0.0.0.0 бездумно: это может сделать API доступным в локальной сети, поэтому одновременно ограничьте доступ файрволом и не публикуйте порт 11434 в интернет.

Насколько это приватно на практике

Для локального запуска Ollama заявляет, что не получает ваши промпты и ответы. Но «локально» не означает «компьютер вообще не обращается к сети». Ollama скачивает модели по HTTPS, может использовать облачные модели и веб-поиск; Open WebUI проверяет обновления и способен обращаться к GitHub, Hugging Face, подключённым API и поисковым сервисам. Slim-образ Open WebUI при первом запуске может отдельно загружать embedding-модель, а при первом локальном распознавании речи — Whisper.

Если нужен режим только с локальными возможностями Ollama, создайте ~/.ollama/server.json:

{
"disable_ollama_cloud": true
}

Либо задайте серверу переменную OLLAMA_NO_CLOUD=1 и перезапустите Ollama. После этого в журнале должна появиться строка Ollama cloud disabled: true; облачные модели и веб-поиск Ollama станут недоступны.

У Open WebUI исходящие проверки отключаются отдельными настройками. Документация перечисляет ENABLE_VERSION_UPDATE_CHECK=false, отключение стандартного OpenAI-подключения через ENABLE_OPENAI_API=false и RAG_EMBEDDING_MODEL_AUTO_UPDATE=false. Для изолированной среды есть OFFLINE_MODE=true, но он меняет поведение функций: без заранее доступной embedding-модели загрузка документов и RAG могут не работать. Настройку приватности следует проверять журналами и сетевыми правилами, а не обещанием «полностью офлайн» на лендинге.

И ещё: локальная модель не делает исходные файлы безопасными автоматически. Чаты Open WebUI, загруженные документы и модели сохраняются на диске; доступ к учётной записи ОС, Docker volume или резервной копии может открыть эти данные. Для рабочих документов нужны шифрование диска, разграничение пользователей, контролируемые бэкапы и правила хранения.

Что с Ollama действительно удобно делать

Черновая редактура. Переписать письмо, предложить заголовки, свернуть заметки в план, привести текст к шаблону. Результат всё равно надо вычитать: локальность не отменяет галлюцинации и стилистические ошибки.

Работа с внутренними материалами. Можно суммировать текст, извлекать поля или задавать вопросы к локальной базе знаний. Для множества документов обычно полезнее RAG с отдельной embedding-моделью, чем помещение всей папки в один огромный контекст.

Помощь с кодом. Специализированные модели объясняют функции, предлагают тесты и ищут вероятные причины ошибки. Не запускайте сгенерированные команды и миграции без просмотра, особенно если агенту открыт терминал или репозиторий.

Локальный API для прототипа. Программа может обращаться к серверу на localhost:11434, не меняя пользовательский интерфейс. Это удобно для классификации, извлечения структурированных данных и автоматической обработки черновиков, но качество нужно проверять на своём наборе примеров.

Эксперименты с моделями. Единая команда позволяет сравнить несколько семейств при одинаковом сценарии. Фиксируйте полный тег, промпт, контекст и параметры — иначе повторить сравнение после обновления не получится.

Не используйте локальную LLM как единственный источник медицинского, юридического или финансового решения. Модель может уверенно выдумать факт, ссылку или условие договора. Конфиденциальность отвечает на вопрос «куда ушли данные», а не на вопрос «верен ли ответ».

Типичные ошибки и диагностика

Модель отвечает очень медленно

Сначала выполните ollama ps. 100% GPU означает полную загрузку в GPU, 100% CPU — работу из системной памяти, смешанная доля показывает разделение. Если ожидали GPU, обновите и проверьте драйвер, сверьте карту с официальным списком и перезапустите Ollama. На Linux после сна Nvidia иногда перестаёт обнаруживаться из-за драйвера; документация предлагает перезагрузить модуль UVM:

sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm

Не применяйте эту команду во время других GPU-задач.

Не хватает памяти или приложение закрывается

Остановите другие модели командой ollama stop <имя-модели>, уменьшите размер модели или контекст, закройте тяжёлые GPU-программы. Проверьте не рекламный максимум контекста семейства, а CONTEXT и PROCESSOR в ollama ps. Для нескольких одновременных пользователей учитывайте: параллельные запросы увеличивают память под контекст.

Модель заняла VRAM после завершения чата

Это штатное пятиминутное удержание. Выполните:

ollama stop qwen3:4b

Удалять модель с диска для освобождения VRAM не нужно.

ollama не найден

Откройте новый терминал. На Windows проверьте наличие %LOCALAPPDATA%\Programs\Ollama и запись в пользовательском PATH. На macOS запустите приложение и разрешите создать ссылку CLI. На Linux проверьте результат установки и путь бинарника.

Не скачивается модель

Проверьте интернет, свободное место и HTTPS-прокси. Ollama использует HTTPS_PROXY для загрузки моделей; FAQ отдельно советует не задавать HTTP_PROXY, поскольку это может нарушить локальные клиентские подключения. При корпоративном сертификате его нужно установить как системный.

Open WebUI открывается, но моделей нет

Убедитесь, что Ollama запущен на хосте, затем проверьте журналы docker logs -f open-webui и адрес подключения http://host.docker.internal:11434. Если порт 3000 занят, измените левую часть публикации, например -p 3001:8080, и открывайте порт 3001.

Где искать журналы

На Windows основные файлы — %LOCALAPPDATA%\Ollama\app.log и server.log. На macOS — ~/.ollama/logs/app.log и server.log. Для systemd на Linux:

journalctl -e -u ollama

Журнал обычно полезнее повторной установки: он показывает выбранный backend, ошибки драйвера, нехватку памяти и сетевые проблемы.

Обновление и удаление без путаницы

Есть три разных обновления. Ollama как программа на Windows и macOS загружает обновления автоматически, а применяет их после команды Restart to update в меню приложения; можно также скачать свежий установщик. На Linux повторно выполните:

curl -fsSL https://ollama.com/install.sh | sh

Модель обновляется повторной загрузкой того же плавающего тега:

ollama pull qwen3:4b

После обновления поведение может измениться, поэтому для важного процесса фиксируйте использованный тег и повторяйте контрольные запросы. Ненужный тег удаляется так:

ollama rm qwen3:4b

Open WebUI в Docker обновляется загрузкой нового образа и пересозданием контейнера с тем же volume и WEBUI_SECRET_KEY. Перед этим сделайте резервную копию. Удаление контейнера не удаляет volume автоматически; команда docker volume rm open-webui стирает чаты, пользователей и настройки без возможности восстановления из самого контейнера.

Безопасная конфигурация без лишней паранойи

По умолчанию Ollama привязан к 127.0.0.1:11434, и это хороший режим для одного компьютера. Не выставляйте API в интернет напрямую: в базовом локальном сценарии нет причин публиковать порт модели. Если доступ в сети действительно нужен, используйте аутентифицирующий reverse proxy, TLS, файрвол и минимальный список клиентов.

В Open WebUI сохраните постоянный секрет, задайте сильный пароль первому администратору и не включайте регистрацию пользователей без необходимости. Перед установкой community-плагина или подключением MCP/OpenAPI-инструмента выясните, какие файлы, сеть и команды он получает. Модель способна ошибочно вызвать разрешённый инструмент; «агент» с терминалом имеет принципиально больше рисков, чем чат без инструментов.

Загруженные модели — сторонние артефакты с собственными лицензиями и ограничениями. Наличие в каталоге Ollama не означает автоматического разрешения на любое коммерческое применение. Для компании отдельно проверьте лицензию выбранного семейства, происхождение fine-tune и допустимость данных.

Итоговая шпаргалка выбора

  1. Нужен первый локальный чат: начните с текстового тега 3B–4B, например qwen3:4b или llama3.2:3b, и проверьте русский язык на своих запросах.
  2. Ответы слабоваты, память остаётся: сравните следующий размер того же семейства и одного конкурента; не меняйте одновременно промпт и контекст.
  3. Нужен код: добавьте qwen2.5-coder подходящего размера и тестируйте на реальном фрагменте проекта.
  4. Нужны изображения: выбирайте конкретный vision-тег, например из qwen3-vl; текстовая модель не подходит.
  5. Нужен поиск по коллекции документов: добавьте embedding-модель и RAG, а не пытайтесь всегда помещать всю коллекцию в контекст.
  6. Чат тормозит по мере роста: смотрите ollama ps, уменьшайте контекст или начинайте новый диалог; размер весов — лишь часть расхода памяти.
  7. Важна изоляция: не используйте теги :cloud, отключите облачные функции, проверьте интеграции Open WebUI, журналы и сетевые правила.
  8. Нужна стабильность для команды: фиксируйте теги моделей и версию Open WebUI, делайте бэкапы, тестируйте обновления отдельно.

Хорошая локальная конфигурация — не самая большая модель, которую компьютер однажды сумел загрузить. Это модель, которая устойчиво решает вашу задачу, сохраняет нужный контекст, не вытесняет рабочие приложения из памяти и остаётся управляемой после обновлений.

Источники