Поиск.
Найдено: 0 моделей и 18 материалов
Материалы
Как анализировать аудио в Gemini API: транскрипция, спикеры и таймкоды
Гайд по Audio Understanding в Gemini API: Files API, audio input, транскрипция, diarization, структурированный результат и ручная проверка.
Audio Overview в Gemini: кому полезен аудиопересказ документов
Обзор Audio Overview в Gemini: поддерживаемые источники, сценарии для учёбы и работы, ограничения и отличие от обычной озвучки текста.
Как создать Audio Overview в Gemini из документа или отчёта
Как превратить документ, презентацию или отчёт Deep Research в аудиообзор Gemini, скачать результат и проверить пересказ.
Как настроить Audio Overview в NotebookLM под нужную аудиторию
Как задать фокус аудиообзора NotebookLM, выбрать уровень объяснения и проверить пересказ перед скачиванием или публикацией.
NotebookLM Video Overview или Audio Overview: какой формат выбрать
Сравниваем видео- и аудиообзоры NotebookLM по сценариям: обучение, отчёты, повторение темы, проверка фактов и время просмотра.
Как анализировать PDF в Gemini API: таблицы, диаграммы и структурированный ответ
Практический гайд по Document Understanding Gemini: inline PDF, Files API, document input, таблицы, страницы, JSON-схема и проверка фактов.
Как озвучить русский текст через Gemini TTS и сохранить WAV
Настройка Gemini TTS через Interactions API: response_format audio, speech_config, voice, Base64, параметры WAV и проверка произношения.
Как расшифровать аудио через OpenAI API и проверить имена, числа и таймкоды
Пошаговая транскрибация аудиофайла через OpenAI API: подготовка записи, audio.transcriptions.create, словарь терминов и контроль ошибок.
Что нового умеет Gemini Canvas в 2026 году: документы, приложения и слайды
Актуальный обзор Gemini Canvas на 11 сентября 2026 года: редактирование документов и кода, предпросмотр, консоль, слайды и Audio Overview.
Как анализировать видео в Gemini API с таймкодами и выбором FPS
Практический анализ видео через Gemini Interactions API: загрузка файла, video input, таймкоды, static processing, clipping, FPS и контрольный тест.
Как анализировать изображения в Gemini API: ввод, промпт и проверка OCR
Как передать изображение Gemini API, извлечь видимый текст и объекты, отметить нечитаемые области и проверить результат.
Как генерировать видео через Gemini API и проверять результат по сценарию
Практический гайд по генерации видео в Gemini API: выбор Gemini Omni Flash или Veo, промпт по кадрам, асинхронный результат и чек-лист.
Как настроить Realtime Transcription в OpenAI API для живых субтитров
Настройка сессии транскрибации OpenAI: WebSocket, PCM-аудио, append/commit, delta/completed и сбор реплик по item_id.
Как получить таймкоды слов из ElevenLabs и сделать субтитры
Практический разбор запроса «как получить таймкоды ElevenLabs»: реальные поля ElevenLabs API, рабочий пример, ограничения, диагностика и проверка аудио.
Как расшифровать русское аудио через Voxtral API
Как расшифровать русское аудио через Voxtral API: рабочий сценарий, шаблон, пример и критерии проверки.
Как создать Ephemeral Token для Gemini Live API и не раскрыть основной ключ
Настройка временных токенов Gemini Live API: auth_tokens.create, uses, expire_time, new_session_expire_time, constraints и безопасная выдача клиенту.
Как включить потоковую озвучку ElevenLabs без обрывов
Практический разбор запроса «как включить streaming ElevenLabs»: реальные поля ElevenLabs API, рабочий пример, ограничения, диагностика и проверка аудио.
Как подготовить аудиобриф в NotebookLM: источники, фокус и контроль фактов
Практический гайд по созданию аудиобрифа из документов в NotebookLM с настройкой фокуса и проверкой неточностей.