Расшифровка аудио в текст онлайн
Час интервью с диктофона превращается в связный документ: реплики подписаны «Спикер 1» и «Спикер 2», у каждого фрагмента стоит таймкод, точки и абзацы на месте. Чтобы перевести аудио в текст, ничего ставить не нужно: загрузите файл в браузере, и готовая расшифровка появится в кабинете. Подойдут файлы MP3, M4A, OGG и WAV размером до 2 ГБ, в одном файле около 4 часов звука.
Как перевести аудио в текст онлайн — три шага
Коллеги, начнём. На каком этапе заказ вывески для кофейни?
Макет согласовали, сегодня запускаем в производство.
Отлично, предупрежу клиента и выставлю счёт.
Перетащите в окно запись с диктофона, звонка или голосовое. MP3, WAV, M4A и OGG идут как есть, по одному файлу до 2 ГБ.
Включите деление на спикеров и укажите язык или оставьте автоопределение. Если в записи смешаны языки, выберите основной вручную.
Готовая расшифровка открывается в кабинете: читайте, правьте прямо в браузере и выгружайте в Word, TXT, SRT или JSON.
Что происходит с записью и что из неё достаётся
Речь распознаёт Яндекс SpeechKit: русский для него основной язык. Модель слушает поток звука и восстанавливает по нему слова. Потом сервис расставляет знаки препинания и абзацы, приводит числа и даты к привычному виду и делит реплики по голосам. Достаётся всё, что произнесли вслух. Музыка, шумы и интонации в текст не попадают, слова песни под аккомпанемент выходят обрывками: что получается с музыкой. Извлечь текст из аудио на английском или немецком получится так же: расшифровка вернётся на языке оригинала, а на русский её переведёт вкладка «Перевод». Фамилии, названия и узкие термины модель подбирает по звучанию, их приходится поправить руками.
Что вы получите
Дословный текст
Полная расшифровка записи на час и больше, со всеми повторами и оговорками. Короткая выжимка лежит рядом во вкладке «Саммари», причёсанный вариант текста — во вкладке «Доработать с ИИ».
Пунктуация и абзацы
Точки, запятые и разбивка расставляются по интонации и смыслу, «двадцать пятого марта» становится датой.
Кто что сказал
Реплики делятся по голосам, «Спикер 1» переименовывается в имя одним кликом. Сколько людей говорит, сервис определяет сам.
Таймкоды и плеер
У каждого фрагмента своё время. Полчаса после того, как текст готов, запись можно слушать в кабинете: клик по фразе перематывает к нужной секунде. Потом исходник удаляется, и таймкоды служат оглавлением к вашей копии файла.
Текст можно искать
Внутри расшифровки работает поиск по тексту: нужная цитата находится за секунды, без перемотки записи.
Какие файлы подходят
MP3, WAV, M4A, OGG, AAC, OPUS и звук из видео MP4, MOV, WEBM, MKV. Голосовые Телеграма обычно сохраняются в OGG, а голосовое WhatsApp — в .opus: и то и другое сайт принимает как есть.
15 языков, русский нативно
Распознаём 15 языков. Русский — нативно, на нём лучшее качество; остальные доступны, но точность на них ниже. Язык выбирается вручную или определяется автоматически.
Данные в России
Обработка в России по 152-ФЗ, исходник удаляется через 30 минут после готовности текста. Сама расшифровка остаётся у вас в кабинете.
С чем сюда обычно приходят
«Мне нужно перевести запись в текст»
Преобразовать аудио в текст можно за три шага, описанных выше: загрузили файл, получили текст с пунктуацией и подписями говорящих, выгрузили в Word.
«Интервью или совещание — нужно дословно»
Расшифровка сохраняет повторы, оговорки и перебивания. Так и нужно, когда важна точная формулировка. Как с этим работают в редакциях, мы собрали для журналистов.
«Надиктовал на диктофон, прислали голосовое»
Заметки, замеры, черновики вслух: голос в текст переводится так же, как любая запись. Запись с улицы или из машины распознаётся, правок просто будет больше. Голосовые из чатов быстрее всего переслать боту в Телеграме.
«Архив записей в разных форматах»
MP3 с диктофона, M4A с айфона и WAV из студии загружаются как есть, по одному файлу. Старые .wma и .amr сначала перегоните в MP3 любым конвертером.
Чем переводят аудио в текст и где каждый способ упирается
| Онлайн-сервис (Текстомат) | Расшифровка в мессенджере | Нейросеть общего назначения | |
|---|---|---|---|
| Какую запись возьмёт | Файл до 2 ГБ и около 4 часов звука: диктофон, звонок, встреча, голосовое | Только голосовое в чате. Файл с диктофона или встречи туда не положить | ChatGPT файл с записью не принимает вовсе: аудио нет в списке поддерживаемых |
| Кто что сказал | Реплики делятся по голосам, «Спикер 1» переименовывается в имя | Нет, сплошной текст одним куском | Нет |
| Таймкоды | У каждого фрагмента своё время, клик по фразе перематывает запись | Нет | Нет |
| Что на выходе | Word, TXT, субтитры SRT, JSON и правка текста прямо в браузере | Текст в окне чата, копировать вручную | Текст в окне чата |
| Сколько бесплатно | До 60 минут, банковская карта не нужна | В Телеграме две расшифровки в неделю, в WhatsApp и MAX лимита нет | Готовую запись не расшифрует ни на каком тарифе |
| Куда уходит запись | Серверы в России, 152-ФЗ, исходник удаляется через 30 минут | Серверы мессенджера | Серверы владельца модели, у ChatGPT — зарубежные |
Проверено 13.09.2026 по справкам сервисов. Подробный разбор нейросетей — в статье «Расшифровка нейросетями» в нашем блоге.
Отличный сервис для руководителя! Очень выручает, когда нужно быстро написать пост, статью или поставить рабочую задачу. Главная фишка для меня — транскрибация аудио и видео в текст за 5 минут, это идеально для расшифровки планёрок. Инструмент колоссально экономит время!
Использую Текстомат в работе HR. Удобно переводить видеоинтервью в текст и дальше закидывать для анализа в GPT. Работает быстро, есть разделение на спикеров, высокая точность — есть с чем сравнить. Теперь рекомендую коллегам, оформила подписку Про.
Использовала, чтобы проанализировать звонки менеджеров: расшифровываю здесь, а аналитику по этапам продаж делаю в других ИИ. Сервис работает быстро, не перегружен, всё понятно. Пробовала другие — там были сложности с регистрацией, тут без подводных камней.
Сколько минут вам нужно?
Подвигайте ползунок — подскажем подходящий тариф. Неиспользованные минуты не сгорают.
Калькулятор минут
Сколько часов записей вы обрабатываете в месяц?
Старт
- Спикеры, таймкоды и все форматы экспорта
- Хранение в России
- 5 часов записей в месяц
Про
- Всё из тарифа «Старт»
- Час записи ≈75 ₽
- 20 часов записей в месяц
Бизнес
- Для больших потоков записей
- ≈67 часов записей в месяц
- Больше 4000 минут — индивидуальный расчёт
Частые вопросы о расшифровке аудио
До 60 минут бесплатно: 30 минут после подтверждения почты и ещё 30 за подписку на наш Телеграм-канал (бот начисляет их на тот же аккаунт после привязки Телеграма в профиле). Банковская карта не нужна. Этого хватает, чтобы проверить качество на своей записи: что входит в бесплатный лимит.
Откройте сайт в браузере, загрузите файл и дождитесь расшифровки, программы ставить не нужно. Пробные минуты появляются на счёте после подтверждения почты. Для пробы удобно взять фрагмент на 10–20 минут: по нему сразу видно, сколько будет правок.
Да, это одна задача: речь из записи становится текстом на том же языке. Стенограмма — оформленный документ на основе такой расшифровки, с регламентом и подписями.
Текст вернётся на языке оригинала; во вкладке «Перевод» у готовой расшифровки его можно перевести на русский одной кнопкой — подписи говорящих и таймкоды остаются, оригинал лежит во вкладке «Дословно». Саму аудиодорожку не переводим и не озвучиваем.
Запись с диктофона загружается в браузере телефона, приложение ставить не нужно. Голосовое удобнее переслать боту @tekstomat_app_bot: сначала подключите Телеграм в профиле на сайте, дальше текст придёт ответом в тот же чат. Через бота проходят файлы до 20 МБ.
Загрузите файл звонка или беседы и оставьте деление на спикеров: реплики разойдутся по «Спикер 1» и «Спикер 2», подписи потом меняются на имена. Голос с громкой связи или с дальнего микрофона распознаётся хуже, чем речь у самого телефона, так что правок будет больше. Если приложение записи звонков сохраняет файлы в .amr, перегоните их в MP3 или M4A.
С готовым файлом нет: аудио не входит в список форматов, которые ChatGPT принимает в чат. Открытую модель Whisper от OpenAI можно поставить на свой компьютер, но это настройка через командную строку, и реплики по голосам она сама не делит.
Распознавание берёт речь и пропускает то, что словами не записывается: гул, музыку, шаги. Сильный шум и дальний микрофон всё же съедают часть слов, и в таких местах текст выходит с пропусками. Кнопки шумоподавления в сервисе нет, поэтому лучше записывать ближе к говорящему, а спорные места переслушать по таймкоду.
Модель ставит их по интонации и по смыслу фразы, примерно как человек, записывающий под диктовку. Поэтому в спокойной речи пунктуация выходит точнее, чем в сбивчивой.
На чистой записи с диктофона хватит вычитки и имён спикеров. Больше правок дают перебивания и слова, которых модель не знает: фамилии, названия, узкие термины. Их удобно найти поиском по тексту и поправить прямо в кабинете.
Если файл в MP3, WAV, M4A или OGG, то нет: лишний перегон качество не улучшит. Конвертировать стоит только то, чего нет в списке сайта, например .wma со старого диктофона.
Из большинства распространённых. Сайт принимает файлы MP3, M4A, WAV, OGG, MP4, MOV, WEBM, AAC, OPUS и MKV до 2 ГБ. Файлы .wma и .amr сначала перегоните в MP3 или M4A либо отправьте через Телеграм-бот (до 20 МБ). Перевести звук в текст можно и из видеофайла: звуковая дорожка достаётся автоматически, подробнее на странице видео в текст.
Да, три часа помещаются в один файл целиком. Файл до 2 ГБ и около 4 часов звука в одном файле; запись длиннее разделите на части или загрузите только звуковую дорожку. Час в MP3 или M4A занимает десятки мегабайт, так что в 2 ГБ упирается разве что несжатый WAV.
Расшифровка — весь текст слово в слово. Саммари — 2–4 предложения и тезисы, для встреч ещё решения и задачи. Оно лежит во вкладке «Саммари» готовой расшифровки и копируется кнопкой, дословный вариант при этом остаётся.
Обычно за минуты, время зависит от длины записи и очереди. Когда загрузка закончилась, вкладку можно закрыть: результат сохранится в кабинете.
До 60 минут бесплатно, без карты. Дальше подписка от 490 ₽ за 300 минут, минута обходится от 1,05 до 1,63 ₽ и не сгорает. Минуты списываются по длине записи и только за успешную расшифровку, формат файла на цену не влияет. Оплата картой российского банка или через СБП. Записи обрабатываются в России по 152-ФЗ, исходник удаляется через 30 минут после готовности текста.
Рядом по теме
расшифровка видео в текст
Файл или ссылка на ролик — текст, субтитры SRT или саммари.
расшифровать файл MP3
Самый ходовой аудиоформат — в текст без конвертации.
Расшифровка с диктофона
Запись с телефона или диктофона — в текст.
интервью в текст
Точные цитаты с таймкодами — вопрос и ответ раздельно.
расшифровка иностранной записи
Французский, испанский, итальянский, турецкий и ещё несколько.
форматы файлов и экспорта
Какие файлы принимаем и в каком виде отдаём результат.
Попробуйте Текстомат — до 60 минут бесплатно
Без карты и установки. Загрузите запись прямо сейчас и получите готовый текст.