Ответ · TNWS AI
Почему Ollama использует процессор вместо видеокарты
Практический ответ на запрос «почему Ollama работает на CPU а не GPU»: точные команды, реальные параметры Ollama, диагностика, ограничения и проверка результата.
Сначала выполните ollama ps: поле PROCESSOR показывает CPU/GPU-размещение. Причины обычно в неподдерживаемом или старом драйвере, недостатке VRAM, слишком большой модели/контексте либо выборе не той GPU. Логи дают точнее ответ, чем загрузка в диспетчере задач.
Что нужно знать до начала
- ollama ps показывает распределение модели между CPU и GPU.
- На Windows для NVIDIA официальная документация требует драйвер 551.61 или новее.
- Для AMD на Windows используется ROCm/HIP либо Vulkan fallback.
- Большой контекст увеличивает KV-cache и может вызвать offload на CPU.
- Встроенная и дискретная GPU могут определяться одновременно.
- Логи Windows находятся в %LOCALAPPDATA%\Ollama, включая server.log.
Пошаговая настройка
- Запустите короткую генерацию и одновременно выполните ollama ps.
- Обновите Ollama и официальный драйвер GPU.
- Проверьте, поддерживается ли точная модель видеокарты.
- Закройте процессы, занявшие VRAM, и повторите тест.
- Уменьшите модель или num_ctx и сравните PROCESSOR.
- Изучите server.log на ошибки обнаружения CUDA, ROCm или Vulkan.
Рабочий пример
ollama ps
# Windows:
Get-Content "$env:LOCALAPPDATA\Ollama\server.log" -Tail 150
# NVIDIA:
nvidia-smi
Как проверить результат
Сравните ollama ps до и после уменьшения num_ctx. Если GPU-размещение выросло и задержка снизилась, ограничением была память; если GPU не появляется, проверяйте драйвер и поддержку устройства.
Чего не делать
- Не судите только по проценту GPU в Диспетчере задач.
- Не устанавливайте случайные сборки драйверов.
- Не обещайте полную GPU-загрузку модели, которая не помещается в VRAM.
Применимость и ограничения
Команды проверялись по документации 12 сентября 2026 года. Поддержка зависит от версии Ollama, операционной системы, драйвера и конкретной модели. Перед изменением production-конфигурации сохраните текущие параметры и проведите тест на отдельной машине.
FAQ
Нужен ли интернет после загрузки локальной модели?
Для локальной генерации — нет; интернет нужен для загрузки, обновлений и облачных функций.
Как узнать, где выполняется модель?
Выполните ollama ps и проверьте столбцы PROCESSOR и CONTEXT.
Можно ли использовать инструкцию в production?
После добавления аутентификации, таймаутов, ограничений ресурсов, журналирования и собственных тестов.
Почему команды могут отличаться?
Ollama регулярно обновляется; перед изменением системы сверяйте указанную официальную страницу.
Официальный источник
Читайте также
Как безопасно открыть Ollama API в локальной сети
Практический ответ на запрос «как открыть Ollama API по сети»: точные команды, реальные параметры Ollama, диагностика, ограничения и проверка результата.
Как выгрузить модель Ollama из памяти и настроить keep_alive
Практический ответ на запрос «как выгрузить модель Ollama из памяти»: точные команды, реальные параметры Ollama, диагностика, ограничения и проверка результата.
Как клонировать голос в ElevenLabs законно и безопасно
Практический разбор запроса «как клонировать голос ElevenLabs»: реальные поля ElevenLabs API, рабочий пример, ограничения, диагностика и проверка аудио.
Комментарии
Пока тихо. Скажите первое слово