GPT видео в текст: как расшифровать видео и получить субтитры

В этой статье

Запрос «gpt видео в текст» обычно означает не создание ролика и не разбор каждого кадра. Человеку нужно взять готовое видео, услышать его речь и получить обычный текст: для чтения, поиска, заметок или последующей подготовки субтитров.

Для такой задачи у OpenAI есть понятный маршрут: из видео берут аудиодорожку и отправляют её в Audio Transcriptions API. На выходе получается расшифровка речи. Сам API не превращает картинку в подробное описание происходящего на экране: он работает с аудио, а не с полноценным анализом визуального ряда.

Что именно нужно сделать с видео

Сначала определите, какой результат должен лежать перед вами.

Если это короткий MP4 с одним говорящим, достаточно обычного текста. Для интервью или круглого стола полезны метки говорящих. Если текст нужен монтажёру, важнее не только слова, но и время их появления: тогда пригодятся таймкоды сегментов или слов, а при поддержке выбранной модели — субтитровый формат.

Это похоже на выбор объектива перед съёмкой. Для простой заметки не нужны сложные метаданные: достаточно ровного полотна текста. Для монтажа, наоборот, текст без времени будет выглядеть как кадр без шкалы — содержание есть, а найти нужный момент трудно.

Если вам удобнее работать именно в интерфейсе ChatGPT, сначала проверьте, какие загрузки и функции доступны в вашем текущем аккаунте. Не любой MP4 можно обещать загрузить туда напрямую с одинаковым результатом: возможности интерфейса, ограничения файлов и доступ к функциям могут меняться. Для воспроизводимого технического маршрута лучше ориентироваться на API транскрибации.

Тем, кто находится в России и хочет сначала проверить доступный вариант ChatGPT для работы через интерфейс, можно оформить подписку на карточке ChatGPT в Amber Market. Продавец указывает ручное оформление на аккаунте покупателя и срок 30 дней, но вариант, наличие и итоговую стоимость нужно проверить перед оплатой; оплата проводится через СБП на условиях карточки. Подписка ChatGPT при этом не является пополнением OpenAI API и сама по себе не гарантирует доступ к каждому API-маршруту.

Рабочая схема через OpenAI Audio Transcriptions API

Практический порядок выглядит так:

  1. Подготовьте файл видео или его аудиодорожку. Если ролик находится на YouTube, одна ссылка не является готовым входом API. Нужен законный доступ к самому файлу или к его аудио.
  2. Проверьте размер и формат. В руководстве OpenAI среди поддерживаемых форматов указаны MP4 и WEBM, а ограничение для загружаемого файла — 25 МБ.
  3. Если файл больше лимита, сожмите его или разделите на части. Разрез лучше делать в паузе и не посреди фразы, иначе на стыке можно потерять начало или окончание слова.
  4. Отправьте файл в Audio Transcriptions API с моделью, предназначенной для расшифровки записанной речи. В руководстве OpenAI для исходного языка рекомендуется gpt-transcribe.
  5. Выберите форму ответа под задачу: обычный текст или JSON для чтения, таймкоды для монтажа, формат субтитров при совместимости модели и параметров ответа, а для интервью — результат с сегментами и метками говорящих.

В упрощённом виде запрос к API выглядит так:

curl https://api.openai.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F file=@video.mp4 \
  -F model="gpt-transcribe"

Название модели и доступные значения response_format перед запуском стоит сверить с текущим руководством OpenAI по транскрибации файлов и описанием метода создания транскрибации. Это особенно важно для SRT, VTT, таймкодов и diarized JSON: такие варианты зависят от совместимости конкретной модели, а не выдаются автоматически для любого запроса.

Как получить субтитры, а не просто сплошной текст

Обычная расшифровка отвечает на вопрос «что было сказано». Субтитры должны ответить ещё на два вопроса: когда фраза начинается и заканчивается и как разбить её на удобные для чтения фрагменты.

Поэтому для монтажа выбирайте ответ с таймкодами или готовый субтитровый формат, если его поддерживает выбранная модель. После получения результата всё равно полезно просмотреть файл глазами: длинную реплику может понадобиться разделить, а имя, термин или число — проверить по оригинальной дорожке. Автоматическая расшифровка переносит голос в текст, но не отменяет финальную вычитку.

Для интервью пригодится режим с разделением говорящих. Он помогает увидеть, где один участник сменяет другого, но метка говорящего не заменяет редакторскую проверку имён. Если в записи несколько микрофонов, музыка или разговор поверх разговора, качество результата будет зависеть от того, насколько разборчив сам звук.

Есть и важная граница: если вам нужно перечислить предметы в кадре, описать движение камеры, прочитать надпись на экране или понять, что происходит без речи, одной транскрибации недостаточно. Это уже отдельная задача анализа видео или изображений. Не стоит просить API транскрибации сделать из голосовой дорожки сценарий всего визуального ряда.

Что делать, если на входе только звук

Иногда после извлечения дорожки видео уже не нужно передавать сам ролик. Если у вас остался MP3, WAV или другой аудиофайл, задача становится обычной расшифровкой записи. Подробный маршрут для такого случая разобран в материале как перевести аудиозапись в текст в ChatGPT.

Если же вопрос шире — например, нужно понять, какие сценарии обработки видео вообще доступны в ChatGPT, — полезно отдельно посмотреть материал о работе ChatGPT с видео. Он помогает не смешивать три разных результата: текст речи, описание изображения и генерацию или монтаж самого ролика.

Короткий выбор маршрута

  • Нужен текст из короткого видео с одной речью — отправьте файл в Audio Transcriptions API и запросите обычную транскрибацию.
  • Нужно разобрать интервью — выбирайте режим с метками говорящих и проверьте имена после получения результата.
  • Нужны субтитры для монтажа — заранее убедитесь, что выбранная модель поддерживает нужный формат, и запросите таймкоды или субтитровый ответ.
  • Файл больше 25 МБ — сожмите его или разделите на части по паузам, не обрывая фразы.
  • Нужно описать картинку, надписи или движение в кадре — это уже не задача «видео в текст» через транскрибацию речи.

Так запрос «gpt видео в текст» превращается из расплывчатой формулировки в конкретный выбор. Сначала отделите речь от изображения, затем подберите форму результата под цель: чистый текст для чтения, говорящих для интервью или время для монтажа.

Источники

Есть следующая задача?Ещё по теме «Видео и сценарии» →