Гайд · TNWS AI

Как обработать пакет запросов через OpenAI Batch API и сверить результаты

5 мин

Как подготовить JSONL для Batch API, связать ответы с исходными строками, обработать ошибки и проверить выборку.

Задача и ожидаемый результат

Этот гайд помогает обработать большой список независимых запросов пакетно и не потерять соответствие между входной строкой и ответом. В конце у вас будет не просто демонстрация, а проверяемый процесс: исходные данные, повторяемые шаги, контрольный пример и критерий отказа. Метод особенно полезен, когда результат передаётся другому человеку или используется приложением.

Сначала определите границу задачи. Запишите одним предложением, что должно получиться, и отдельно — что инструмент не должен делать. Например, «извлечь сроки из переданного документа» не означает «добавить типичные сроки из интернета». Такая граница резко упрощает проверку.

Что подготовить

Понадобятся таблицу заданий с уникальными ID, код преобразования в JSONL и небольшой тестовый набор из 5–10 строк. Для первого прогона используйте копию данных. Уберите пароли, токены, персональные сведения и коммерческие секреты, если для их обработки нет отдельного разрешения. Ключ API храните в переменной окружения, а не в исходном коде, скриншоте или тексте запроса.

Создайте рабочую таблицу с колонками: ID примера, вход, ожидаемый результат, фактический результат, источник, статус и комментарий. Даже пять строк дают больше пользы, чем субъективное «вроде работает»: после изменения настройки вы увидите, какой сценарий сломался.

Пошаговая настройка

Сначала создайте тестовый JSONL: одна строка — один JSON-объект запроса с уникальным custom_id, HTTP-методом, URL endpoint и body. Не используйте номер строки как единственный бизнес-идентификатор: после обработки порядок результатов может не совпадать с порядком входа. Проверьте JSON каждой строки локальным парсером.

Загрузите файл с назначением Batch, создайте пакет для нужного endpoint и сохраните ID операции. После завершения скачайте output и error files. Связывайте ответы с исходной таблицей только по custom_id. Повторно отправляйте лишь ошибочные строки, создавая новый идентификатор попытки, чтобы не задублировать успешно обработанные записи. Перед полным объёмом вручную проверьте результаты малого пакета.

После базовой настройки сохраните используемые параметры и дату. Если сервис показывает идентификатор модели, задания, файла или запуска, запишите его рядом с тестом. Скриншот интерфейса полезен как дополнение, но текстовые настройки удобнее повторять и сравнивать.

Готовый промпт или шаблон

Скопируйте заготовку и замените значения в квадратных скобках:

Для каждой записи верни только JSON: record_id, category, short_reason, missing_data. Используй только поле text этой записи. Если данных недостаточно, category=null. Запись: {"record_id":"[ID]","text":"[ТЕКСТ]"}.

Не добавляйте к этому запросу просьбу «будь креативным», если вам нужны факты или структурированные данные. Для рабочего процесса важнее однозначный формат, правило обработки пропусков и ссылка на исходную информацию. Если ответ будет читать программа, сначала валидируйте структуру и только потом бизнес-смысл.

Реалистичный пример

Вход

Три обращения имеют ID ticket-101, ticket-102 и ticket-103. Второе содержит пустой текст, третье — вопрос о возврате.

Ожидаемый результат

Результаты объединяются по custom_id, а не по позиции. Для ticket-102 category равно null и заполнено missing_data; ticket-103 получает категорию возврата только если она следует из текста.

Проверьте не только удачный пример. Сделайте ещё три теста: пустой вход, вход без нужного факта и вход с двумя противоречащими утверждениями. В первом случае процесс должен вернуть понятную ошибку, во втором — честно отметить отсутствие данных, в третьем — показать конфликт, а не самостоятельно выбрать удобную версию.

Как проверить результат

Первый проход — технический. Убедитесь, что команда или запрос завершились без ошибки, получен ожидаемый формат, идентификаторы не потерялись, а секреты не попали в вывод. Второй проход — смысловой: откройте первоисточник и вручную сверьте минимум три элемента, включая число, имя, дату или условие.

Третий проход — проверка устойчивости. Повторите запрос на тех же данных после перезапуска приложения или в чистой сессии. Если ответ меняется там, где требуется детерминированный результат, уточните формат, сократите свободу модели или добавьте программную проверку. Красивый текст не является критерием готовности.

Чек-лист перед использованием

  • задача и запрещённые действия записаны отдельно;
  • использованы только разрешённые входные данные;
  • названия функций и параметры сверены с официальной документацией;
  • ключи и токены не находятся в коде, промпте и журнале;
  • успешный пример проходит от начала до конца;
  • отсутствие данных не превращается в выдуманный факт;
  • числа, даты, имена и ссылки сверены вручную;
  • ошибки дают понятный статус и не запускают опасное действие;
  • сохранены версия настроек, дата и идентификатор теста.

Типичные ошибки и исправления

Самая частая ошибка — менять сразу модель, промпт и входные данные. После такого эксперимента нельзя понять причину улучшения или ухудшения. Меняйте один элемент за итерацию и повторяйте один и тот же набор тестов.

Вторая ошибка — принимать отсутствие технической ошибки за правильный результат. HTTP 200 или зелёный статус означает, что запрос обработан, но не подтверждает факты. Для каждого критичного поля нужен источник или явный статус «не найдено».

Третья ошибка — публиковать внутренние детали. Убирайте stack trace, системные инструкции, локальные пути и названия секретов из пользовательского ответа. Для диагностики используйте закрытый журнал с ограниченным сроком хранения и доступом.

Ограничения

Пакетная обработка не подходит для интерактивного ответа в реальном времени. Учитывайте сроки выполнения, текущие ограничения endpoint и правила хранения входных файлов из официальной документации. Любой изменяемый факт — доступность функции, формат API, список моделей, тариф или лимит — проверяйте непосредственно перед внедрением. Не переносите настройки из старого скриншота или стороннего обзора без сверки.

FAQ

Можно ли использовать результат без ручной проверки?

Для учебного черновика — иногда. Для публикации, отправки клиенту, изменения данных или автоматического действия нужна проверка по исходнику и правилам организации.

Что делать, если функция отсутствует в интерфейсе?

Сначала откройте официальную документацию и проверьте поддержку вашей платформы и аккаунта. Не пытайтесь имитировать отсутствующую функцию неподтверждённым способом.

Как понять, что промпт достаточно точный?

Он проходит обычный, пустой и противоречивый тесты; формат стабилен, а отсутствующие сведения помечаются явно. Один красивый ответ этого не доказывает.

Нужно ли сохранять исходные запросы?

Да, если процесс повторяется. Сохраняйте обезличенный вход, инструкцию, параметры, дату и результат, чтобы находить регрессии после изменений.

Официальный источник и дата проверки

Функции и названия элементов сверены 11 сентября 2026 года: официальное руководство OpenAI Batch API. Цены и численные лимиты здесь намеренно не приводятся: они могут меняться и должны проверяться на официальной странице в момент использования.

Частые вопросы

Можно ли обойтись без ручной проверки?

Для критичных фактов и действий — нет. Сверьте результат с исходником и правилами процесса.

Что делать при отсутствии функции?

Проверьте официальную документацию, поддержку платформы и тип аккаунта; не используйте неподтверждённый обход.

Как тестировать изменение?

Меняйте один параметр и повторяйте одинаковый набор обычных, пустых и противоречивых входов.

Где хранить ключ API?

В менеджере секретов или переменной окружения, но не в коде, промпте и публичном журнале.

Читайте также

Комментарии

Пока тихо. Скажите первое слово