Обзор · TNWS AI

Что лучше в Ollama: Q4, Q5 или Q8-квантизация модели

2 мин

Практический ответ на запрос «что лучше Q4 Q5 или Q8 Ollama»: точные команды, реальные параметры Ollama, диагностика, ограничения и проверка результата.

Универсального победителя нет: Q4 обычно экономнее по памяти, Q8 ближе к исходной точности, а Q5 часто служит компромиссом. Выбирайте не по названию файла, а по тому, помещается ли модель в GPU и проходит ли ваш фиксированный eval.

Что нужно знать до начала

  • Больше бит обычно означает больший файл и расход памяти.
  • Полная загрузка на GPU часто важнее небольшой разницы между соседними квантизациями.
  • Результат зависит от архитектуры, метода quantization и задачи.
  • Размер GGUF на диске не равен точному пику RAM/VRAM.
  • Тест скорости без проверки качества может выбрать бесполезный вариант.
  • Сравнивать нужно один и тот же базовый checkpoint.

Пошаговая настройка

  1. Скачайте варианты одного checkpoint и одной версии.
  2. Зафиксируйте одинаковые num_ctx, temperature, seed и промпты.
  3. Составьте 50–100 задач из реального сценария.
  4. Запишите качество, загрузку GPU, prompt_eval_duration и eval_duration.
  5. Отдельно измерьте пиковую память и холодный старт.
  6. Выберите самый компактный вариант, проходящий порог качества.

Рабочий пример

ollama ps
# Из JSON /api/generate сохраните:
# prompt_eval_count, prompt_eval_duration,
# eval_count, eval_duration, total_duration
# tokens_per_second = eval_count / (eval_duration / 1e9)

Как проверить результат

Слепо перемешайте ответы Q4/Q5/Q8 при ручной оценке. Если Q8 уходит на CPU и проигрывает по задержке, зафиксируйте это как системный эффект, а не качество модели.

Чего не делать

  • Не сравнивайте разные базовые модели.
  • Не называйте Q8 всегда лучшей.
  • Не публикуйте скорость без контекста, железа и длины ввода.

Применимость и ограничения

Команды проверялись по документации 12 сентября 2026 года. Поддержка зависит от версии Ollama, операционной системы, драйвера и конкретной модели. Перед изменением production-конфигурации сохраните текущие параметры и проведите тест на отдельной машине.

FAQ

Нужен ли интернет после загрузки локальной модели?

Для локальной генерации — нет; интернет нужен для загрузки, обновлений и облачных функций.

Как узнать, где выполняется модель?

Выполните ollama ps и проверьте столбцы PROCESSOR и CONTEXT.

Можно ли использовать инструкцию в production?

После добавления аутентификации, таймаутов, ограничений ресурсов, журналирования и собственных тестов.

Почему команды могут отличаться?

Ollama регулярно обновляется; перед изменением системы сверяйте указанную официальную страницу.

Официальный источник

https://docs.ollama.com/import

Читайте также

Комментарии

Пока тихо. Скажите первое слово