Как перевести аудио в текст бесплатно с помощью нейросети

В этой статье

Если у вас уже есть meeting.mp3, не нужно включать диктовку и не обязательно загружать запись на случайный сайт. Для готового файла подойдёт локальный запуск Whisper — открытой модели, которая расшифровывает речь прямо на вашем компьютере.

Сначала уточним одно слово. Вопрос «как перевести аудио в текст» обычно означает «как записать сказанное буквами». Это расшифровка, или транскрипция. Перевод на другой язык — отдельная задача. Если в meeting.mp3 звучит русский, обычный режим должен вернуть русский текст.

Что понадобится

Нужны три вещи:

  • аудиофайл в формате MP3, WAV или другом формате, который прочитает ffmpeg;
  • Python и пакет Whisper;
  • установленный ffmpeg.

Whisper распространяется по лицензии MIT, но слово «бесплатно» здесь не означает «без всяких затрат». Понадобятся время на установку, свободное место и ресурсы вашего компьютера. Сам файл при локальной обработке не нужно отправлять в облако. Инструкция Whisper отдельно указывает на необходимость зависимостей и ffmpeg; список зависимостей также виден в pyproject.toml проекта.

Установите пакет в терминале:

pip install -U openai-whisper

Затем установите ffmpeg способом, который подходит вашей системе. На Linux это обычно пакет из репозитория, на macOS — установка через Homebrew, на Windows — отдельная сборка с добавлением папки bin в PATH. Если команда ffmpeg -version в терминале не находится, Whisper, скорее всего, не сможет открыть аудиофайл.

Расшифровка русского аудио

Положите meeting.mp3 в текущую папку терминала и выполните:

whisper meeting.mp3 --model turbo --language ru --task transcribe --output_format txt

Официальный пример запуска использует ту же основную схему — whisper audio.mp3 --model turbo. Параметры --language ru и --task transcribe здесь добавлены, чтобы не оставлять модели лишнюю неопределённость: речь русская, а результатом должна быть именно запись исходной речи, не перевод. Пример из README Whisper

После обработки рядом с исходником появится текстовый файл, обычно с тем же именем — meeting.txt. Название модели можно изменить, если компьютер не справляется с turbo: модели отличаются скоростью и качеством, а результат зависит от языка, шума, микрофона и разборчивости речи. Поэтому «запустилось» ещё не равно «расшифровало без ошибок».

В примере контрольная фраза может звучать так: «Давайте перенесём встречу на вторник, на десять тридцать». В готовом файле важно увидеть не только знакомые слова, но и точные детали: вторник ли это, 10:30 ли, правильно ли распознаны имена участников и числа. Нейросеть может уверенно написать гладкую, но неверную фразу — особенно там, где запись тихая или собеседники говорят одновременно.

Как проверить текст по аудио

Проверяйте не весь файл одинаково подробно. Сначала найдите места, в которых ошибка особенно дорого обойдётся:

  1. даты и дни недели;
  2. время и длительность;
  3. имена, фамилии и названия компаний;
  4. адреса, номера и суммы;
  5. отрицания: «не отправляем» легко превращается в «отправляем».

Откройте аудио и текст рядом. Переслушайте начало, фрагменты с паузами и все участки, где фраза выглядит странно. Если в записи сказано «переносим встречу», а в тексте получилось «переносим счёт», смысл меняется одной буквой — и именно такие места нельзя исправлять по догадке.

Полезно оставить в рабочей копии отметки вроде [неразборчиво, 01:42], если слово не удаётся уверенно расслышать. Это честнее, чем незаметно подставить вероятный вариант. После проверки можно убрать технические пометки и сохранить чистую версию текста.

Если нужен готовый платный AI-сервис с отдельными пользовательскими условиями, можно посмотреть каталог Amber Market. Это лишь альтернативный маршрут для тех, кому важнее готовый сервис: каталог не делает Whisper бесплатным и не заменяет локальную установку. Условия и доступность конкретных услуг стоит сверять в карточке.

Когда нужен именно перевод на английский

Представим другую сцену. В meeting.mp3 говорят по-русски, а вам нужен английский текст. Тогда речь идёт уже не о простой расшифровке. В Whisper для этого используется режим:

whisper meeting.mp3 --model turbo --language ru --task translate --output_format txt

Разница слышна даже в формулировке результата:

transcribe старается записать: «Давайте перенесём встречу на вторник».
translate старается передать смысл по-английски: «Let’s move the meeting to Tuesday».

Режим translate предназначен для перевода нерусской речи в английский, а не для красивого оформления русского текста. Если вам нужен русский текст из русской записи, оставьте --task transcribe. Для русского и других языков выбирайте многоязычную модель и при необходимости указывайте язык явно. Описание режимов в README Whisper

Короткая проверка перед сохранением

Перед тем как отправить расшифровку кому-то ещё, задайте себе четыре вопроса:

  • исходный язык указан правильно;
  • выбран transcribe, а не translate, если нужен исходный язык;
  • сверены даты, время, имена и числа;
  • не осталось фрагментов, которые модель додумала вместо плохо слышимой речи.

Итак, бесплатный практический маршрут выглядит так: установить локальный Whisper и ffmpeg, запустить meeting.mp3 с многоязычной моделью и языком ru, открыть полученный .txt, а затем проверить важные места по звуку. Нейросеть снимает основную механическую работу, но последний разговор с текстом всё равно ведёт человек.

Источники

Есть следующая задача?Ещё по теме «Голосовой режим» →