Гайд · TNWS AI

Как сделать семантический поиск через Ollama embeddings локально

5 мин

Локальный поиск по смыслу через Ollama embeddings: чанки, API, cosine similarity и тест релевантности.

Задача и результат

Этот гайд нужен, чтобы построить небольшой локальный семантический поиск по документам без передачи их текста внешнему API. На выходе должен быть воспроизводимый сценарий с сохранёнными настройками, контрольным примером и понятным состоянием ошибки. Если процесс нельзя повторить на том же входе, его рано подключать к рабочему продукту.

Сразу разделите три понятия: запрос принят, запрос выполнен и результат верен. Успешный HTTP-статус обычно подтверждает только первый или второй пункт. Истинность ответа проверяется отдельно по данным, документу или результату доверенной функции.

Что подготовить

Понадобятся установленный Ollama, embedding-модель из актуальной библиотеки, 30–100 текстовых фрагментов и тестовые вопросы. Начинайте с тестовой копии. Удалите персональные данные, ключи, пароли и коммерческие секреты, если обработка не согласована. Для внешних действий используйте учётную запись с минимальными правами.

Создайте таблицу тестов: case_id, вход, ожидаемый статус, ожидаемый результат, фактический результат, время, комментарий. Минимальный набор — нормальный запрос, пустой ввод, отсутствие факта, противоречие и временная ошибка сервиса.

Пошаговая настройка

Разбейте документы на смысловые чанки и сохраните для каждого document_id, heading и позицию. Пустые и почти одинаковые фрагменты удалите. Загрузите модель embeddings командой из её карточки, затем получите векторы через официальный API Ollama.

Используйте одну и ту же модель для документов и запросов. Сохраните вектор рядом с метаданными. Для поиска вычислите cosine similarity и верните несколько лучших кандидатов. Не генерируйте ответ сразу: сначала покажите найденные фрагменты и их score для отладки. Создайте 20 тестовых вопросов с ожидаемым документом и проверьте, попадает ли нужный чанк в top-k. Меняйте размер чанка и k по одному.

После настройки сохраните точную версию кода, имя модели, параметры и дату проверки. Идентификаторы внешних ресурсов связывайте с внутренним case_id. Это позволяет безопасно продолжить процесс после перезапуска и не создавать дубликаты.

Копируемый промпт или шаблон

Разбей документ на смысловые фрагменты по 100250 слов. Не пересказывай. Верни JSONL: chunk_id, heading, text, source. Не разрывай таблицу условий и список исключений.

Замените значения в квадратных скобках. Не добавляйте просьбы «додумать» отсутствующие факты. Для автоматизации заранее определите допустимый JSON и валидируйте его программно до любого действия.

Реалистичный пример

Вход

База знаний имеет разделы о доставке, возврате и гарантии. Запрос: «можно ли вернуть товар без упаковки?»

Ожидаемый результат

В top-k появляется конкретный фрагмент раздела возврата. Если правила об упаковке там нет, приложение сообщает отсутствие факта, а не генерирует типовой ответ.

Теперь измените один элемент: уберите обязательное значение или добавьте конфликт. Система должна показать понятный статус и не продолжить опасную ветку. Если она выдаёт правдоподобный ответ, усилите схему и добавьте серверную проверку.

Проверка результата

Техническая проверка: формат разбирается, ID сохранён, секреты отсутствуют, ошибка имеет отдельное состояние. Смысловая проверка: минимум три утверждения сверены с исходником, включая число, дату и отрицание. Процессная проверка: повтор после таймаута не создаёт второе письмо, платёж, запись или публикацию.

Меняйте один параметр за раз. Если одновременно заменить модель, инструкцию и данные, нельзя понять, что повлияло на качество. Старую рабочую конфигурацию сохраняйте до окончания регрессионной проверки.

Чек-лист перед запуском

  • есть измеримый критерий готовности;
  • определены состояния успеха, ожидания и ошибки;
  • тестовые данные не содержат лишних персональных сведений;
  • ключи хранятся вне кода и промпта;
  • параметры сверены с официальной документацией;
  • обычный, пустой и противоречивый кейсы проверены;
  • отсутствующие данные не заменяются догадкой;
  • повторная обработка защищена от дублей;
  • важные числа и ссылки сверены вручную;
  • есть владелец процесса и журнал изменений.

Как вести журнал качества

Для каждого запуска достаточно хранить case_id, версию инструкции, технический статус, найденный дефект и решение проверяющего. Полный чувствительный текст в обычный журнал не копируйте. После обновления SDK или модели прогоните старый набор целиком.

Разбирайте ошибки по классам: неверный вход, авторизация, ограничение сервиса, временная сеть, неверный формат и смысловая ошибка. Для каждого класса заранее решите: повторить, запросить уточнение, передать человеку или окончательно остановить. Универсальный автоматический retry опасен для операций записи.

Приёмка и безопасный откат

Перед включением для реальных пользователей проведите короткую приёмку вдвоём: исполнитель запускает сценарий по инструкции, а проверяющий видит только журнал и результат. Если проверяющий не может установить, откуда взялось ключевое значение, процесс считается непрозрачным и возвращается на доработку.

Подготовьте откат заранее. Для изменения конфигурации это предыдущая версия файла или промпта; для внешней записи — компенсирующее действие, согласованное владельцем системы. Откат нельзя поручать модели без проверки, потому что он сам может быть необратимым. Зафиксируйте условие выключения: рост ошибок определённого класса, нарушение формата, недоступность источника или подозрение на утечку данных. После выключения сохраните пример сбоя и не включайте процесс снова, пока он не проходит исходный набор тестов.

Отдельно проверьте документацию для выбранного языка программирования: названия объектов SDK могут отличаться, хотя HTTP-схема остаётся той же. Не смешивайте примеры разных версий библиотеки в одном проекте.

Ограничения

Векторная близость показывает сходство смысла, а не истинность. При смене embedding-модели весь индекс нужно построить заново. Любые изменяемые сведения — модели, форматы, тарифы, квоты и доступность — перепроверяйте на официальной странице непосредственно перед использованием.

FAQ

Можно ли сразу использовать рабочие данные?

Сначала нужен тест на обезличенной копии, проверка прав и согласованный режим хранения. Факт технической доступности API не является разрешением передавать ему любые данные.

Нужно ли сохранять ID запросов?

Да. Они связывают внутреннюю задачу с внешней операцией, помогают продолжать после сбоя и защищают от повторного выполнения.

Как поступать при таймауте?

Не повторяйте опасное действие вслепую. Сначала запросите фактический статус предыдущей операции либо проверьте целевую систему.

Как понять, что обновление ничего не сломало?

Повторите одинаковый набор тестов и сравните статусы и содержательные поля. Один удачный новый пример не является регрессионной проверкой.

Первоисточник и дата проверки

Названия функций и общий процесс сверены 12 сентября 2026 года: официальная документация Ollama по embeddings. Цены и численные лимиты не приводятся, поскольку их нужно проверять в момент работы.

Частые вопросы

Можно ли сразу использовать рабочие данные?

Нет, сначала нужен тест на обезличенной копии и проверка правил доступа.

Нужно ли сохранять ID операций?

Да, это помогает продолжать после сбоя и не выполнять действие повторно.

Что делать при таймауте?

Сначала проверить фактический статус предыдущей операции, затем решать о повторе.

Как проверить обновление?

Повторить прежний набор обычных, пустых и ошибочных сценариев.

Читайте также

Комментарии

Пока тихо. Скажите первое слово