Поиск.
Найдено: 0 моделей и 8 материалов
Материалы
Как настроить parallel requests в LM Studio без переполнения памяти
Как настроить parallel requests в LM Studio без переполнения памяти: точная настройка, пример, критерии проверки и типичные ошибки.
Как отключить parallel tool calls в OpenAI API для последовательных действий
Как отключить parallel tool calls в OpenAI API для последовательных действий: применимость, настройка, пример, метрики и ошибки.
Как считать токены и запросы через Usage в OpenAI Agents SDK
Как получить requests, input_tokens, output_tokens и request_usage_entries в OpenAI Agents SDK, проверить многошаговый run и подготовить корректный журнал потребления.
Как использовать Batch API xAI для большой пачки запросов Grok
Практическое руководство по запросу «как использовать Batch API Grok»: рабочий пример, реальные поля API, ограничения и проверка результата.
Как отправить пакет запросов через Gemini Batch API и сопоставить ответы
Как создать batch job в Gemini API, выбрать inline или JSONL, отслеживать state и сопоставлять ошибки с исходными запросами.
Как отправить пакет запросов через Claude Message Batches API
Как собрать batch-запросы Claude с custom_id, проверить статус, сопоставить результаты и повторить только ошибки.
Почему Cohere API возвращает 429, 498 или 499
Практическое руководство по запросу «почему Cohere API ошибка 429»: реальные параметры Cohere API, рабочий код, ограничения и измеримая проверка результата.
Что лучше для OpenAI API: сокращать токены или использовать меньшую модель
Сравнение способов снизить расходы OpenAI API: входной контекст, длина ответа, кэширование, smaller model и проверка качества на eval.