Гайд · TNWS AI
Как выполнять код в Claude API и получать созданные файлы
Как подключить code execution tool Claude, передать данные в контейнер, проверить вычисления и скачать созданный артефакт.
Задача и применимость
Цель — дать Claude изолированную среду для вычисления по тестовым данным и получить проверяемый файл, не выполняя код на своём сервере. Результатом считается не один удачный ответ, а воспроизводимый процесс с контрольным входом, ожидаемым выходом и явным условием отказа.
Функции и названия параметров проверены 12 сентября 2026 года. Официальный Messages API пример подключает tool с type code_execution_20250825 и name code_execution. Загруженные файлы передаются как container_upload; созданные файлы возвращаются через file_id, который приложение должно извлечь и скачать.
Подготовка
Создайте тестовый проект и ключ с минимальными правами. Подготовьте пять обезличенных кейсов: обычный, пустой, без обязательного факта, противоречивый и содержащий попытку навязать опасное действие. Для каждого заранее запишите ожидаемый status, поля и источник истины.
Версию модели и SDK вынесите в конфигурацию. Секрет храните в переменной окружения или менеджере секретов. Не вставляйте ключ в браузерный код, промпт, скриншот или журнал.
Пошаговая настройка
- Удалите из CSV персональные данные и формулы. Добавьте контрольную сумму и две строки с заранее известным итогом.
- Загрузите файл способом из актуальной Files API документации и передайте container_upload с file_id в user content.
- Добавьте code_execution tool точной версии, указанной в актуальном гайде. Не просите shell-доступ к внутренней сети.
- Попросите вычислить показатели и создать output.csv плюс краткий отчёт о пропусках. Извлеките file_id из response content.
- Скачайте файл, проверьте MIME, размер, заголовки и контрольные строки. Не доверяйте только текстовому «готово».
После вызова сохраняйте request ID, HTTP-статус, model id, версию инструкции и usage, если он доступен. Таймаут не означает, что операция не произошла: перед повтором проверьте фактическое состояние.
Копируемый шаблон
Открой sales.csv. Колонки: order_id, amount, status.
Не удаляй строки.
Создай output.csv: status, count, sum_amount.
Пустые amount вынеси в errors.csv и не считай нулём.
В ответе укажи file_id обоих файлов и число ошибочных строк.
Не добавляйте просьбу «додумай при необходимости» в задачу извлечения. Отсутствующий факт должен давать null, missing или blocked. Это позволяет отличить незнание от технической ошибки.
Реалистичный пример входа и результата
В CSV три paid по 100, 200 и пустому значению. Ожидается count=2, sum_amount=300 и одна строка в errors.csv. Итог 300 при count=3 считается логической ошибкой.
Повторите тест без одного обязательного значения. Связная догадка считается провалом, даже если формат правильный.
Проверка результата по уровням
Технический уровень: статус, формат, типы, ID и отсутствие секретов. Смысловой: посимвольная сверка чисел, дат, названий и отрицаний. Процессный: таймаут, отказ в доступе, повтор и безопасный откат.
Создайте таблицу с колонками case_id, expected, actual, source, status, error_type. Размечайте format_error, unsupported_claim, wrong_action и security_error отдельно. Иначе красивый средний процент скроет критический вызов не той функции.
Заранее установите правило выпуска: ноль ошибок безопасности и неверных действий, все ID совпадают с эталоном, отсутствующие сведения не додумываются, а каждый внешний вызов виден в журнале. Провал одного критического кейса блокирует выпуск.
Контроль в рабочей системе
Разделите вход, сетевой вызов, разбор ответа и бизнес-валидацию. Сначала проверяются размер, тип и права, затем выполняется API-запрос, потом структура и только после неё значения. Невалидный ответ не передаётся следующему узлу.
В журнал кладите hash входа, case_id, модель, версию промпта, request ID, длительность и решение валидатора. Не сохраняйте ключ, персональные данные и полный документ без необходимости. Для операций записи используйте idempotency_key.
Перед полным включением направьте ограниченный трафик и сравните новую конфигурацию с предыдущей на одинаковых кейсах. Условие отката задайте до релиза: потеря обязательного ID, хотя бы одно действие без прав или необработанный ответ.
Приёмка на конкретных данных
Возьмите минимум десять кейсов из реального процесса, но замените персональные значения синтетическими. В каждом отметьте одно проверяемое утверждение, одно число или ID и ожидаемое поведение при отсутствии ответа. Не составляйте набор только из простых успешных примеров: добавьте устаревший документ, конфликт двух источников и недоступный ресурс.
Для каждого ответа фиксируйте не субъективную оценку, а набор булевых проверок: формат разобран; обязательные поля присутствуют; ID совпал; источник разрешён; действие входит в allowlist; отсутствующий факт отмечен. Итоговый pass получается только при выполнении всех обязательных условий. Текст может быть стилистически слабым и пройти, если задача — точное извлечение; красивый текст с неверным числом обязан провалиться.
Попросите второго проверяющего воспроизвести три кейса только по инструкции статьи. Если ему приходится угадывать, где взять model id, какой результат финальный или как обработать ошибку, процесс ещё не готов. После приёмки сохраните контрольный набор рядом с кодом без секретов, чтобы запускать его после обновлений.
Разбор сбоя
При ошибке сначала определите слой: вход, транспорт, API, разбор, бизнес-валидация или внешнее действие. Сохраните минимальный воспроизводимый запрос, убрав ключи и данные пользователя. Сверьте request ID и время с журналом. Не компенсируйте ошибку сервера бесконечными повторами и не исправляйте логическую ошибку увеличением таймаута. После исправления прогоните не только проблемный кейс, но и весь набор, поскольку изменение схемы или промпта может сломать соседний сценарий.
Негативные тесты
Проверьте пустой ввод, похожий неверный ID, инструкцию «игнорируй правила» внутри пользовательских данных, два одинаковых запроса и искусственный таймаут. Система не должна угадывать запись, выполнять текст как команду или создавать дубль.
После смены модели, SDK, схемы или порядка сообщений повторите весь набор. Меняйте один параметр за итерацию, иначе причина улучшения останется неизвестной.
Чек-лист финальной проверки
- задача и ожидаемый результат описаны заранее;
- метод и параметры сверены с официальной документацией;
- title, slug и description уникальны;
- ключ отсутствует в коде и логах;
- модель и версия вынесены в конфигурацию;
- обычный и пустой кейсы пройдены;
- отсутствующий факт возвращается явно;
- числа, даты, ID и единицы сверены;
- ошибки API разделены по классам;
- повтор не создаёт дубль;
- подготовлен откат.
Ограничения
Изоляция контейнера не делает исходные данные безопасными автоматически. Проверяйте сроки хранения, поддержку форматов и текущую версию tool.
Модели, Preview-статус, цены, квоты и региональная доступность меняются. Здесь не приводятся неподтверждённые числа: перед внедрением проверяйте кабинет и официальную страницу.
FAQ
Можно ли использовать рабочие данные в первом тесте?
Нет. Начните с обезличенной копии и минимальных прав.
Достаточно ли ответа HTTP 200?
Нет. Он подтверждает обработку, но не правильность фактов или действий.
Что делать после таймаута?
Проверить состояние предыдущей операции и только затем решать о повторе.
Когда повторять регрессию?
После смены модели, SDK, схемы, tool definition или системной инструкции.
Официальный первоисточник
Документация использованной функции — проверено 12 сентября 2026 года.
Частые вопросы
Можно ли использовать рабочие данные в первом тесте?
Нет, начните с обезличенной копии и минимальных прав.
Достаточно ли HTTP 200?
Нет, он не подтверждает правильность фактов.
Что делать после таймаута?
Проверить состояние предыдущей операции до повтора.
Когда повторять регрессию?
После смены модели, SDK, схемы или инструкции.
Читайте также
Как анализировать PDF с таблицами и графиками через Claude API
Как передать PDF в Claude API, задать вопросы по страницам, получить цитаты и проверить числа из таблиц и графиков.
Как добавить цитаты из документов в Claude API и проверить их
Практический гайд по citations в Claude API: передача документа, включение ссылок на фрагменты и ручная верификация.
Как использовать Files API Claude: загрузка, file_id и удаление документа
Как загрузить документ в Claude Files API, использовать file_id в Messages API, проверить ответ и удалить временный файл.
Комментарии
Пока тихо. Скажите первое слово