В этой статье
Если у вас уже есть meeting.mp3, не нужно включать диктовку и не обязательно загружать запись на случайный сайт. Для готового файла подойдёт локальный запуск Whisper — открытой модели, которая расшифровывает речь прямо на вашем компьютере.
Сначала уточним одно слово. Вопрос «как перевести аудио в текст» обычно означает «как записать сказанное буквами». Это расшифровка, или транскрипция. Перевод на другой язык — отдельная задача. Если в meeting.mp3 звучит русский, обычный режим должен вернуть русский текст.
Что понадобится
Нужны три вещи:
- аудиофайл в формате MP3, WAV или другом формате, который прочитает
ffmpeg; - Python и пакет Whisper;
- установленный
ffmpeg.
Whisper распространяется по лицензии MIT, но слово «бесплатно» здесь не означает «без всяких затрат». Понадобятся время на установку, свободное место и ресурсы вашего компьютера. Сам файл при локальной обработке не нужно отправлять в облако. Инструкция Whisper отдельно указывает на необходимость зависимостей и ffmpeg; список зависимостей также виден в pyproject.toml проекта.
Установите пакет в терминале:
pip install -U openai-whisper
Затем установите ffmpeg способом, который подходит вашей системе. На Linux это обычно пакет из репозитория, на macOS — установка через Homebrew, на Windows — отдельная сборка с добавлением папки bin в PATH. Если команда ffmpeg -version в терминале не находится, Whisper, скорее всего, не сможет открыть аудиофайл.
Расшифровка русского аудио
Положите meeting.mp3 в текущую папку терминала и выполните:
whisper meeting.mp3 --model turbo --language ru --task transcribe --output_format txt
Официальный пример запуска использует ту же основную схему — whisper audio.mp3 --model turbo. Параметры --language ru и --task transcribe здесь добавлены, чтобы не оставлять модели лишнюю неопределённость: речь русская, а результатом должна быть именно запись исходной речи, не перевод. Пример из README Whisper
После обработки рядом с исходником появится текстовый файл, обычно с тем же именем — meeting.txt. Название модели можно изменить, если компьютер не справляется с turbo: модели отличаются скоростью и качеством, а результат зависит от языка, шума, микрофона и разборчивости речи. Поэтому «запустилось» ещё не равно «расшифровало без ошибок».
В примере контрольная фраза может звучать так: «Давайте перенесём встречу на вторник, на десять тридцать». В готовом файле важно увидеть не только знакомые слова, но и точные детали: вторник ли это, 10:30 ли, правильно ли распознаны имена участников и числа. Нейросеть может уверенно написать гладкую, но неверную фразу — особенно там, где запись тихая или собеседники говорят одновременно.
Как проверить текст по аудио
Проверяйте не весь файл одинаково подробно. Сначала найдите места, в которых ошибка особенно дорого обойдётся:
- даты и дни недели;
- время и длительность;
- имена, фамилии и названия компаний;
- адреса, номера и суммы;
- отрицания: «не отправляем» легко превращается в «отправляем».
Откройте аудио и текст рядом. Переслушайте начало, фрагменты с паузами и все участки, где фраза выглядит странно. Если в записи сказано «переносим встречу», а в тексте получилось «переносим счёт», смысл меняется одной буквой — и именно такие места нельзя исправлять по догадке.
Полезно оставить в рабочей копии отметки вроде [неразборчиво, 01:42], если слово не удаётся уверенно расслышать. Это честнее, чем незаметно подставить вероятный вариант. После проверки можно убрать технические пометки и сохранить чистую версию текста.
Если нужен готовый платный AI-сервис с отдельными пользовательскими условиями, можно посмотреть каталог Amber Market. Это лишь альтернативный маршрут для тех, кому важнее готовый сервис: каталог не делает Whisper бесплатным и не заменяет локальную установку. Условия и доступность конкретных услуг стоит сверять в карточке.
Когда нужен именно перевод на английский
Представим другую сцену. В meeting.mp3 говорят по-русски, а вам нужен английский текст. Тогда речь идёт уже не о простой расшифровке. В Whisper для этого используется режим:
whisper meeting.mp3 --model turbo --language ru --task translate --output_format txt
Разница слышна даже в формулировке результата:
transcribeстарается записать: «Давайте перенесём встречу на вторник».translateстарается передать смысл по-английски: «Let’s move the meeting to Tuesday».
Режим translate предназначен для перевода нерусской речи в английский, а не для красивого оформления русского текста. Если вам нужен русский текст из русской записи, оставьте --task transcribe. Для русского и других языков выбирайте многоязычную модель и при необходимости указывайте язык явно. Описание режимов в README Whisper
Короткая проверка перед сохранением
Перед тем как отправить расшифровку кому-то ещё, задайте себе четыре вопроса:
- исходный язык указан правильно;
- выбран
transcribe, а неtranslate, если нужен исходный язык; - сверены даты, время, имена и числа;
- не осталось фрагментов, которые модель додумала вместо плохо слышимой речи.
Итак, бесплатный практический маршрут выглядит так: установить локальный Whisper и ffmpeg, запустить meeting.mp3 с многоязычной моделью и языком ru, открыть полученный .txt, а затем проверить важные места по звуку. Нейросеть снимает основную механическую работу, но последний разговор с текстом всё равно ведёт человек.
Источники
- Whisper READMEOpenAI
- Whisper pyproject.tomlOpenAI
- ChatGPT RecordOpenAI