🎁 30 минут расшифровки бесплатно при регистрации — без банковской карты
Большой разбор11 сентября 202619 мин чтения

Расшифровка нейросетями: что умеют ChatGPT, Whisper, Алиса и GigaChat — и чего не умеют

Запрос звучит одинаково у студента, секретаря и юриста: есть запись, нужен текст, нейросеть же есть. А дальше у всех по-разному. Кто-то тянет mp3 в окно ChatGPT и получает отказ. Кто-то ставит Whisper и через час выясняет, что тот не различает, кто говорит. Кто-то просит Алису расшифровать голосовое, и Алиса не понимает, о чём речь. Мы прошли по каждому инструменту с одним вопросом: что он реально делает с готовой записью, на каких условиях и во что это обходится. Не по чужим обзорам, а по справкам производителей, документации и открытым тестам, везде стоят ссылки. Дата проверки: 11 сентября 2026 года.

Коротко
  • ChatGPT файл с записью не расшифровывает. По справке OpenAI он принимает документы, таблицы и картинки, аудио в списке нет. Есть режим записи Record: только на Mac, только на платных тарифах, только новая запись с микрофона, до 4 часов.
  • API OpenAI (whisper-1, gpt-4o-transcribe, модель со спикерами) стоит $0,003–0,006 за минуту, файл до 25 МБ, это примерно 26 минут mp3. Из России только через посредников, у нас вышло 1,55 ₽ за минуту.
  • Whisper на своём компьютере бесплатен, но час записи занимает от 5 минут на видеокарте до нескольких часов на процессоре. Говорящих не различает. На живой русской речи ошибается примерно в каждом пятом слове.
  • Алиса файлы не берёт. Яндекс Браузер пересказывает видео с YouTube, VK и Rutube длиной от 40 секунд до 4 часов, но тезисами с таймкодами, не дословно. Речевая модель Яндекса, SpeechKit, доступна только программам: 0,606 ₽ за минуту.
  • GigaChat принимает аудио и делит по говорящим, лимиты Сбер не публикует. Открытая модель GigaAM по тестам самого Сбера точнее Whisper на русском в два с половиной раза: 8,3 % ошибок против 21,0 %.
  • Мессенджеры расшифровывают голосовые внутри чата, но не файлы. Telegram бесплатно даёт два сообщения в неделю, WhatsApp и MAX без лимита.
  • По нашей базе из 244 реальных записей каждая третья длиннее 15 минут и каждый третий файл больше 25 МБ. За этой границей чат-режимы не работают вовсе, а API требует нарезки. Для встречи, интервью или лекции со спикерами нужна речевая модель без лимита на длину: API со спикерами через посредника или сервис на такой модели. У нас первые 30 минут бесплатны.

«Загрузить в ГПТ»: почему это работает не так, как ждёшь

Нейросетей, о которых идёт речь, два вида, и путаница между ними порождает почти все разочарования. Чат-модели вроде ChatGPT, GigaChat, Алисы AI или DeepSeek работают с текстом: читают его и пишут. Речевые модели, а это Whisper, Яндекс SpeechKit, GigaAM у Сбера, слушают. Они превращают звуковую волну в слова. Когда чат «понимает голос», за кулисами всегда работает вторая, речевая модель. Отдельная программа со своими лимитами на размер файла, длину записи и язык.

Аналогия из офиса. Переводчик может блестяще пересказать письмо, но стенографировать совещание не умеет, для этого зовут стенографистку. Спросите у переводчика «а ты можешь записать, что говорили на встрече?», и он ответит по памяти, что-то додумав. Именно так ведёт себя чат-модель, если подсунуть ей звук без речевой модели под капотом: отказывается или пересказывает.

Отсюда правило на всю статью. Вопрос «умеет ли ChatGPT расшифровывать» поставлен неправильно. Правильный звучит так: какая речевая модель стоит под капотом, на каких условиях к ней пускают и что она делает с длиной записи, спикерами и русским языком. Ниже ровно это, по каждому инструменту.

ChatGPT: что на самом деле происходит с аудиофайлом

Самый частый сценарий: человек перетаскивает mp3 в окно чата и ждёт текст. По справке OpenAI на сентябрь 2026 ChatGPT принимает документы, таблицы, презентации и изображения, то есть DOCX, PDF, XLSX, PPTX. Аудио и видео в списке поддерживаемых файлов нет.

ИсточникOpenAI Help Center, «What types of files are supported?»

Что происходит на практике, описано на форуме самой OpenAI. В октябре 2024 владелец платной подписки Plus пожаловался, что загрузил mp3 и получил ошибку «требуемый модуль для транскрибации недоступен в текущем окружении». Чат попытался запустить внутри себя программу распознавания и не смог. Модератор ответил прямо: «ChatGPT, бесплатный или Plus, напрямую расшифровку аудио не поддерживает», и посоветовал отдельный платный API. В июле 2026 другой пользователь попросил добавить полноценную загрузку mp3 и mp4. Поддержка OpenAI приняла это как пожелание «для будущей разработки». За два года ничего не изменилось.

Нас удивило другое. В англоязычных обзорах гуляет утверждение «с 2024 года в ChatGPT можно загрузить mp3 до 25 МБ». Цифра 25 МБ существует, это лимит API для программистов, о нём в следующем разделе. На чат её перенесли по ошибке, и ошибка разошлась по десяткам статей. Если у вас загрузка звука в чат однажды сработала, это эксперимент, которого нет в справке, и он может исчезнуть в любой день.

Что ChatGPT умеет с голосом на самом деле. Три вещи, и ни одна не про готовый файл.

  1. Голосовой режим. Расшифровывает то, что вы говорите в микрофон прямо сейчас, и отвечает. Запись встречи сюда не подсунуть, только свою живую речь.
  2. Режим записи Record. Кнопка в приложении для macOS на тарифах Plus, Pro, Business, Enterprise и Edu. Пишет встречу или голосовую заметку с микрофона и системного звука, расшифровывает на лету, различает говорящих (когда не знает имени, пишет «Speaker 1»), на выходе даёт конспект и расшифровку. Потолок 4 часа на одну сессию. В браузере и на Windows кнопки нет. По словам OpenAI, режим «лучше всего работает на английском, для других языков точность варьируется». Аудио удаляется после расшифровки, а вот текст расшифровки у пользователей Free, Plus и Pro может пойти в обучение моделей, если не выключить в настройках пункт «Улучшать модель для всех».
  3. API. Платный доступ для программ, где и живут речевые модели OpenAI. Ему посвящён следующий раздел.

Отдельно про Россию. Сайт и приложения ChatGPT официально здесь не работают: нужен VPN, а подписку Plus нельзя оплатить картой российского банка. Для личных заметок это неудобство. Для рабочих записей с чужими голосами ещё и вопрос закона, к нему вернёмся в конце.

Итог по ChatGPT: файл с записью встречи в чат не загрузить. Если у вас Mac и платный тариф, можно записать встречу заново через Record. Старую запись с телефона он не возьмёт.

ИсточникOpenAI Help Center, «ChatGPT Record», проверено 11.09.2026

Тот же OpenAI, но через API: Whisper-1, gpt-4o-transcribe и модель со спикерами

API это служебный вход для программ: вы или сервис за вас отправляете файл на сервер OpenAI и получаете обратно текст. Здесь пять речевых моделей, у каждой свой характер.

Цены по документации OpenAI на 11.09.2026, без НДС и без комиссии посредников. Для моделей с ценой за токены минута оценена по курсу аудиотокенов, который приводит OpenAI.
МодельЧто умеетЦена по прайсу OpenAI
whisper-1Таймкоды по фразам и по словам, перевод речи на английский, субтитры. OpenAI называет её устаревшей, но таймкоды есть только у неё$0,006 за минуту
gpt-transcribeРекомендуемая сейчас: принимает подсказки с терминами и списком языков, работает в потоке$0,0045 за минуту
gpt-4o-transcribeТочнее Whisper по словам OpenAI, без таймкодов$2,5 за миллион аудиотокенов, это около $0,006 за минуту
gpt-4o-mini-transcribeДешёвая версия той же модели$1,25 за миллион аудиотокенов, около $0,003 за минуту
gpt-4o-transcribe-diarizeЕдинственная, которая делит речь по говорящим. Можно дать до четырёх образцов голоса по 2–10 секунд, чтобы она подписала спикеров именами. Подсказки не принимаетУ российских посредников около 1,5 ₽ за минуту

Общие условия для всех пяти: файл не больше 25 МБ, форматы mp3, mp4, mpeg, mpga, m4a, wav и webm. Отдельного лимита на длительность нет, ограничивает размер. Переведём 25 МБ в минуты. Mp3 с битрейтом 128 кбит/с даёт около 26 минут, 64 кбит/с около 52 минут, несжатый wav всего две с половиной минуты. Часовую встречу придётся резать на куски, отправлять по одному и склеивать текст, следя, чтобы разрез не пришёлся на середину слова.

Таймкоды есть только у whisper-1 (параметр timestamp_granularities и формат ответа verbose_json). Спикеры только у gpt-4o-transcribe-diarize, причём для записей длиннее 30 секунд документация требует включить автоматическую нарезку, chunking_strategy = auto. Остальные модели отдают сплошной текст.

Из России оплатить API напрямую нельзя по той же причине, что и подписку. Работают посредники: они продают доступ к тем же моделям за рубли и без VPN, добавляя свою наценку. Мы проверяли такой доступ сами. 17 июля 2026 года прогнали десятиминутный фрагмент через gpt-4o-transcribe-diarize у одного из посредников. Ответ шёл около четырёх минут, на монологе модель насчитала одного говорящего, то есть лишних не придумала, а стоимость вышла 1,55 ₽ за минуту. Себестоимость той же минуты в Яндекс SpeechKit, на котором работает наш сервис, 0,606 ₽.

И главное, о чём посредники пишут мелким шрифтом: файл при этом уходит на серверы OpenAI за пределы России. Для записи с голосами клиентов, пациентов или сотрудников это не техническая деталь, а вопрос 152-ФЗ.

ИсточникOpenAI, документация «Speech to text» и страница модели gpt-transcribe

Whisper у себя на компьютере: скорость, железо и русский язык

Whisper это открытая речевая модель OpenAI, выпущенная в 2022 году под лицензией MIT. Скачал, запустил, платишь только электричеством. Тот самый «бесплатный ChatGPT для аудио», который ищут в поиске. Только бесплатность здесь со своими условиями, и начинаются они с железа.

Данные из репозитория openai/whisper. Turbo, по формулировке OpenAI, это облегчённая версия large-v3 «с минимальной потерей точности».
МодельПараметровНужно видеопамятиСкорость относительно large
tiny39 млноколо 1 ГБпримерно в 10 раз быстрее
base74 млноколо 1 ГБв 7 раз быстрее
small244 млноколо 2 ГБв 4 раза быстрее
medium769 млноколо 5 ГБв 2 раза быстрее
large (v3)1,55 млрдоколо 10 ГБ1×, эталон
turbo809 млноколо 6 ГБв 8 раз быстрее

Сколько это по времени, замерил проект faster-whisper, ускоренная реализация той же модели, которую используют почти все оболочки. Запись на 13 минут, модель large-v2: оригинальный Whisper на видеокарте считает 2 минуты 23 секунды, faster-whisper 1 минуту 3 секунды, а с пакетной обработкой 17 секунд. На процессоре без видеокарты, модель small: 6 минут 58 секунд у оригинала против 2 минут 37 секунд у ускоренной версии.

Переведём в час записи. На видеокарте с 8–10 ГБ памяти самая точная модель обрабатывает час примерно за 5 минут, в пакетном режиме за полторы. На обычном ноутбуке без видеокарты модель small справится с часом за 12 минут, а large будет считать часами. На практике на процессоре ставят small или base и получают заметно больше ошибок.

Теперь про русский, и это самая важная цифра в статье. Точность речевых моделей меряют показателем WER, долей неправильно распознанных слов; что это и как посчитать на своей записи, мы разбирали отдельно. По открытому сравнению, которое Сбер опубликовал вместе со своей моделью GigaAM, Whisper даёт на десяти русскоязычных наборах данных средний WER 21,0 %. На чистой начитанной речи из Common Voice 5,5 %, на краудсорсинговых записях Golos 19,0 %, на звонках в колл-центр 23,1 %, на телефонных разговорах 27,4 %. Проще говоря, на живой русской речи Whisper ошибается примерно в каждом пятом слове. Модель Сбера на тех же данных даёт 8,3 %.

Чего в Whisper нет, и что с этим делают.

  • Разделения по говорящим. Whisper выдаёт сплошной текст. Чтобы понять, кто что сказал, ставят надстройку WhisperX или библиотеку pyannote: отдельная установка, видеокарта и ещё один слой ошибок.
  • Устойчивости к тишине. На паузах, музыке и шуме модель галлюцинирует, то есть дописывает фразы, которых не было. Русскоязычный интернет знает это по знаменитому «Субтитры сделал DimaTorzok», которое Whisper вставляет в тишину. Наследие обучения на субтитрах к видео.
  • Длинного окна. Модель слушает кусками по 30 секунд и режет запись сама, на стыках иногда теряет слово.
  • Единообразия в цифрах. Даты и суммы выходят то словами, то цифрами, для протокола это придётся править руками.
  • Кнопки. Whisper это командная строка. Оболочки с окном есть (whisper.cpp, Buzz, MacWhisper, Subtitle Edit), но установка Python, ffmpeg и драйверов видеокарты остаётся на вас.

Стоимость владения без прикрас: если видеокарты нет, «бесплатный» Whisper превращается либо в покупку железа, либо в ожидание. Плюс вечер на установку и отсутствие поддержки. Когда что-то отвалится после обновления, спросить будет не у кого. Зато есть четыре ситуации, где локальный Whisper единственно верный выбор: закрытые данные, которые нельзя выпускать с компьютера; работа без интернета; десятки часов записей в месяц при уже имеющейся видеокарте; английская речь, на которой Whisper силён.

ИсточникРепозитории openai/whisper и SYSTRAN/faster-whisper на GitHub; сравнение по русскому в evaluation.md проекта GigaAM

Алиса, Яндекс Браузер и SpeechKit: что из Яндекса даёт текст

Алиса как ассистент, в колонке, в приложении, в браузере, файлы не принимает. Она слушает вас, а не запись. Команда «Алиса, расшифруй голосовое» упирается в ту же стену, что и mp3 в ChatGPT. Голос в текст Алиса переводит только ваш собственный и только пока вы говорите.

Другое дело Яндекс Браузер с Алисой AI. У него есть «Пересказ» для видео: работает на dzen.ru, vkvideo.ru, vk.com, youtube.com и rutube.ru, видео должно быть длиной от 40 секунд до 4 часов, основные языки русский плюс английский, остальные он тоже пробует. На выходе основные тезисы с таймкодами в двух вариантах, «кратко» и «подробно», плюс автоматические субтитры и перевод слов по клику. Удобно, когда надо понять, стоит ли смотреть часовую лекцию.

Но это не расшифровка. Пересказ выбрасывает большую часть сказанного, дословных цитат в нём нет, локальный файл с диктофона в браузер не загрузить. И, как честно пишет справка, «нейросеть не перескажет видео, если в нём никто не говорит или нет субтитров». Для конспекта лекции по ссылке годится. Для протокола совещания или интервью нет.

Телемост, где проходит половина корпоративных созвонов, записывает встречу на Яндекс Диск, а расшифровку даёт в бизнес-тарифе Яндекс 360. Этот маршрут вместе с тем, что умеет Алиса на самом деле, мы разобрали в отдельной статье о транскрибации в Яндексе.

Настоящая речевая модель Яндекса называется SpeechKit. Для обычного человека у неё нет кнопки, это облачный сервис для программ. По прайсу на 11 сентября 2026 асинхронное распознавание файла стоит 0,1515 ₽ за 15 секунд, то есть 0,606 ₽ за минуту, а отложенный режим, когда результат не нужен сразу, 0,0381 ₽ за 15 секунд, или 0,152 ₽ за минуту, всё с НДС. На SpeechKit работают сервисы расшифровки, в том числе наш, отсюда и наша себестоимость минуты. Сильные стороны: родной русский и серверы в России. Слабая одна: без программиста к нему не подойти.

ИсточникСправка Яндекс Браузера, раздел «Пересказ»; правила тарификации SpeechKit

GigaChat и GigaAM: самое сильное на русском

GigaChat один из немногих больших чатов, который принимает аудио напрямую и при этом работает из России: в веб-версии giga.chat, в Telegram-боте и в мессенджере MAX. В справке Сбер описывает, как учил модель слышать. Распознавание диалогов с разбиением по спикерам, метки говорящего, форматирование расшифровки, при желании маскирование мата и пометка слов-паразитов. Чего в справке нет: лимитов на длину и размер файла и обещания дословности. Наш совет: пробовать на записи до 15–20 минут и проверять, не пересказал ли чат вместо того, чтобы расшифровать. Чат-модель по природе тянется к пересказу, и на длинной записи это заметнее всего.

Куда интереснее то, что Сбер выложил в открытый доступ: речевую модель GigaAM под той же лицензией MIT, что и Whisper. Версия v3 обучена на 700 тысячах часов русской речи, и вместе с ней опубликована таблица сравнения с Whisper на десяти наборах данных. Ниже пять строк из неё, WER в процентах, меньше значит лучше.

Источник: evaluation.md репозитория GigaAM, модель GigaAM-v3 RNNT. Сравнение проводили сами разработчики Сбера, независимого прогона мы не нашли. Но разрыв в два с половиной раза одной методикой не объяснить.
Набор данныхGigaAM-v3Whisper
Common Voice 19, чистая начитанная речь0,9 %5,5 %
Golos Crowd, краудсорсинговые записи2,4 %19,0 %
Звонки в колл-центр9,5 %23,1 %
Телефонные разговоры (OpenSTT)17,4 %27,4 %
Видео с YouTube (OpenSTT)10,6 %17,8 %
Среднее по десяти наборам8,3 %21,0 %

Оговорки. GigaAM это модель распознавания, не диаризации: говорящих она не различает. Готовой программы с кнопкой нет, нужен Python не ниже 3.10, ffmpeg и команда pip install. На процессоре работает, но медленно, видеокарта желательна. То есть это инструмент для разработчика, который хочет собрать себе локальную расшифровку русского без зарубежных моделей. В той же таблице Сбера есть ещё одна российская открытая модель, T-One от Т-Банка, со средним WER 16,3 %: хуже GigaAM, но лучше Whisper.

ИсточникРепозиторий salute-developers/GigaAM и его evaluation.md

Голосовые в мессенджерах: Telegram, VK, WhatsApp, MAX

Самая частая расшифровка в жизни не встреча, а голосовое от коллеги на три минуты. Тут нейросети встроены прямо в мессенджеры, и у каждого свои правила.

По справкам и анонсам мессенджеров на 11.09.2026. Точность у всех сопоставима: короткое чистое голосовое читается нормально, диктовка на ходу с улицы выходит с пропусками.
МессенджерЧто расшифровываетЛимитГде обрабатывается
TelegramГолосовые и видеосообщения в чате, кнопка «→A» у сообщенияБесплатно два сообщения в неделю, с Premium без ограниченийНа серверах Telegram
VKГолосовые в мобильном приложении, кнопка у сообщения; текст можно править в течение сутокРассчитана на короткие сообщенияНа серверах VK
WhatsAppГолосовые; русский поддерживается, включается в настройках чатовБез лимитаНа самом телефоне, звук никуда не отправляется
MAXГолосовые и видеосообщения, кнопка «Т» у сообщения; работает с 5 мая 2026Без лимитаНа серверах MAX

Общее ограничение у всех четырёх одно: расшифровывают только сообщения внутри чата. Файл с диктофона, запись созвона, лекцию мессенджер не возьмёт, а если переслать себе mp3, кнопки расшифровки рядом с ним не появится. Для голосовых длиннее пары минут и для аудиофайлов из чатов удобнее бот или сервис, который принимает запись как файл.

ИсточникEngadget о расшифровке голосовых в Telegram для всех; блог WhatsApp «Introducing Voice Message Transcripts»

Gemini, DeepSeek и остальные чаты

Gemini от Google аудио принимает, но с разными лимитами для людей и для программ: в приложении до 10 файлов общей длиной не больше 10 минут, через API до 9,5 часов звука в одном запросе. Из России и то и другое через VPN и с зарубежной картой. DeepSeek работает с текстом и документами, звук не принимает вовсе. Если появится новый чат, который «умеет аудио», проверьте три вещи до того, как отправлять ему часовую запись: лимит длины, есть ли разделение по говорящим и дословно ли он расшифровывает или пересказывает.

ИсточникGoogle, «Audio understanding», документация Gemini API

Сводная таблица: четырнадцать инструментов по шести признакам

Проверено по справкам производителей 11.09.2026. «Через посредника» значит оплату в рублях стороннему сервису, который перепродаёт доступ к API.
ИнструментФайл с записьюДлинаСпикерыТаймкодыИз России без VPNЦена
ChatGPT, чатнетнетподписка
ChatGPT Record (Mac)нет, только запись вживуюдо 4 часовданет, конспектнетPlus и выше
OpenAI API, whisper-1да, до 25 МБпо размеру файланетдачерез посредника$0,006 за минуту
OpenAI API, diarizeда, до 25 МБпо размеру файладанетчерез посредникаоколо 1,5 ₽ за минуту
Whisper на компьютередалюбаянет, нужен WhisperXдадавидеокарта и время
Яндекс Браузер, пересказнет, видео по ссылке40 с – 4 чнетда, у тезисовдабесплатно
Яндекс SpeechKit, APIдалюбаядадада0,606 ₽ за минуту
GigaChatдане опубликованаданетдабесплатно
GigaAM на компьютередалюбаянетнет из коробкидавидеокарта и время
Telegramтолько голосовыенетнетда2 в неделю или Premium
WhatsAppтолько голосовыенетнетдабесплатно
MAXтолько голосовыенетнетдабесплатно
Gemini, приложениедадо 10 минутнетнетнетподписка
Текстоматда, до 2 ГБлюбаядадада30 минут бесплатно, дальше от 490 ₽ в месяц

Что мы намерили сами

Мы делаем сервис расшифровки на Яндекс SpeechKit, поэтому у нас есть цифры, которых в справках нет: своя экономика и свои прогоны.

Себестоимость это то, что платим движку мы или платили бы вы напрямую. Цена минуты для клиента у нас на тарифах от 1,05 до 1,63 ₽: в неё входят ещё эквайринг, налоги, серверы и поддержка.
СпособСебестоимость минутыЧто в неё входит
Яндекс SpeechKit, асинхронно0,606 ₽Распознавание, спикеры, таймкоды, серверы в России
Яндекс SpeechKit, отложенный режим0,152 ₽То же, но результат не сразу, зато в четыре раза дешевле
OpenAI diarize через посредника1,55 ₽Распознавание со спикерами; данные за рубежом; наш замер 17.07.2026
Whisper на своём компьютере0 ₽Плюс видеокарта, электричество и ваше время на установку и ожидание

Замер OpenAI мы уже описали: десять минут монолога, около четырёх минут ожидания, один говорящий без выдуманных лишних, 1,55 ₽ за минуту. Он же показал, почему мы не переключили движок. Текст на выходе был рабочий, но цена выше в два с половиной раза, и запись уезжает за границу.

Второй набор цифр из нашей базы. 11 сентября 2026 мы посчитали все 244 записи, которые клиенты расшифровали с середины июня: 100 человек, 61,5 часа звука, только средние, без имён и файлов. Вот как выглядит реальная запись, а не та, что в примерах из справок.

Наша база, все завершённые расшифровки с 17.06 по 11.09.2026. Мелкие файлы до 5 минут, а их 37 %, это в основном голосовые и пробы на бесплатных минутах.
ПоказательЗначениеЧто это значит для нейросетей из статьи
Медианная длина записи9 минутПоловина записей короче, их возьмёт почти любой инструмент
Записей длиннее 15 минут36 %Каждая третья не помещается в чат-режимы и требует нарезки для API
Файлов больше 25 МБ36 %Каждый третий файл не пройдёт лимит API OpenAI как есть
Файлов больше 100 МБ22 %Видео и несжатый звук, это уже не «отправить в чат»
Записей длиннее часа2 %Редкость, но самая длинная у нас 3 часа 39 минут
Каждая десятая записьдлиннее 33 минутЛекция, интервью, планёрка: основной рабочий формат

Вывод из таблицы простой. Пока запись короткая, нейросети взаимозаменяемы, берите любую бесплатную. Граница проходит по пятнадцати минутам и по 25 мегабайтам. За ней каждая третья запись в чат-режимы не помещается вовсе, а в API OpenAI пролезает только нарезкой на куски. Вот где на самом деле разница между «поиграть с нейросетью» и «работать с записями»: в длине и размере файла, а не в точности.

И про нас без прикрас: стопроцентной точности нет и у нас. На именах, узких терминах и записи из дальнего угла переговорной мы ошибаемся, как и все. Где именно и что с этим делать, написано отдельно, а проверить на своей записи можно на бесплатных 30 минутах.

Как выбрать: шесть ситуаций

  1. Голосовое на сорок секунд от коллеги. Кнопка в мессенджере: WhatsApp и MAX бесплатно и без лимита, Telegram два в неделю. Ничего лучше не нужно.
  2. Свои мысли на ходу. Голосовой режим любого чата или диктовка в телефоне: вы говорите, текст появляется. Это голос в текст без файла, и здесь ChatGPT действительно хорош.
  3. Один файл до 15 минут, один голос, и вы дружите с командной строкой. Whisper или GigaAM на своём компьютере либо API OpenAI через посредника. Дёшево и под контролем.
  4. Лекция на полтора часа для конспекта. Если она лежит на YouTube или VK и нужны только тезисы, хватит пересказа в Яндекс Браузере. Если нужен текст, по которому можно искать и цитировать, берите сервис с таймкодами, а дальше конспект из него.
  5. Планёрка вчетвером, где важно, кто что обещал. Только модель с разделением по говорящим: gpt-4o-transcribe-diarize через посредника с нарезкой файла или сервис, который делает это одним файлом, как устроены спикеры у нас.
  6. Записи пациентов, клиентов, переговоры по договору, материалы для суда. Либо локальная модель, либо обработка в России. Зарубежные API исключены не из-за качества, а из-за закона, подробнее о конфиденциальности.

Что делать с текстом после нейросети: пять промптов и чек-лист вычитки

Расшифровка это сырьё. Превращать её в документ чат-модель умеет отлично, любая: ChatGPT, GigaChat, Алиса, наш ИИ-слой на YandexGPT. Условие одно: просить правильно и проверять в правильных местах. Промпты ниже мы обкатали на своих записях, копируйте как есть.

  1. Причесать: «Ниже дословная расшифровка. Убери слова-паразиты и повторы, исправь опечатки распознавания, расставь абзацы. Смысл и порядок реплик не меняй, ничего не сокращай».
  2. Саммари: «Составь выжимку: пять главных тезисов, принятые решения, открытые вопросы. У каждого пункта укажи, кто это сказал, если в тексте есть имена. Не добавляй ничего, чего нет в тексте».
  3. Протокол: «Оформи как протокол совещания: участники, повестка, решения, поручения (кому, что, срок). Если срок или исполнитель не названы, пиши „не определено“, не придумывай».
  4. Цитаты: «Найди пять самых сильных дословных цитат и приведи их без изменений, с указанием говорящего».
  5. Термины: «Выпиши списком все имена, названия компаний, термины и цифры, я проверю их по записи».

Теперь где чат-модель врёт. Не потому что плохая. Её учили писать связно, а связность проще всего достигается додумыванием. Она придумывает решения: «давайте подумаем до пятницы» превращается в «договорились сделать к пятнице». Путает, кто что обещал, особенно если спикеры подписаны номерами, а не именами. Округляет цифры: в расшифровке 1 490, в саммари «около полутора тысяч», в протоколе так нельзя. Сглаживает возражения, и спор на десять минут становится «участники согласились». А если запись оборвалась на полуслове, закончит фразу за говорящего.

Отсюда чек-лист вычитки любого текста, который нейросеть сделала из расшифровки. Сверить каждую цифру и дату с дословным текстом. Проверить имена и должности. Каждое «решили» и «поручили» найти в расшифровке дословно. Отдельно перечитать отрицания: «не будем» и «будем» модель путает чаще, чем кажется. Всё, что стоит в кавычках, проверить на дословность. Последний абзац прочитать с вопросом «а это точно было сказано». Тем же грешит и наш ИИ-слой, поэтому у нас дословная вкладка всегда лежит рядом с причёсанной и с саммари. Проверять есть по чему.

Куда уходит запись: данные и закон

Последний признак, по которому инструменты различаются сильнее всего, в таблицах обычно не пишут. Запись встречи это голоса всех, кто на ней был, то есть персональные данные третьих лиц. По 152-ФЗ у их обработки должны быть основания, а у передачи за границу тем более. Плюс само право на запись: о ней предупреждают, а в ряде случаев берут согласие.

По справкам производителей на 11.09.2026.
ИнструментГде обрабатывается звукЧто остаётся у производителя
ChatGPT, API OpenAI, GeminiСерверы за пределами РоссииRecord удаляет аудио после расшифровки, но текст у Free, Plus и Pro может использоваться для обучения, пока это не выключено в настройках
Whisper и GigaAM на своём компьютереНигде, всё на вашей машинеНичего
Яндекс SpeechKit, Яндекс Браузер, GigaChatСерверы в РоссииПо условиям каждого сервиса
Telegram, VK, MAXСерверы мессенджераПо условиям мессенджера
WhatsAppНа телефонеНичего, расшифровка не покидает устройство

И наш расклад без рекламных формулировок. Текстомат обрабатывает звук в Яндекс SpeechKit, на серверах в России. Но это значит, что фраза «данные никуда не уходят» про нас неправда: они уходят Яндексу. Исходный файл удаляется автоматически через 30 минут после того, как текст готов (предельный срок по оферте 7 дней), а сам текст хранится у вас, пока вы его не удалите. Если для вашей задачи важно, чтобы запись вообще не покидала компьютер, это случай для Whisper или GigaAM, и мы об этом сказали выше.

Александр СинельниковСоздатель Текстомата. Сервис работает на движке Яндекс SpeechKit; замеры, цены и прогоны в статье наши, факты о чужих инструментах взяты из их справок на 11.09.2026.

Попробуйте Текстомат на своей записи

Загрузите аудио или видео и получите готовый текст со спикерами и таймкодами. Первые 30 минут — бесплатно, без карты.

Расшифровать запись бесплатно

Частые вопросы

Нет. По справке OpenAI на сентябрь 2026 ChatGPT принимает документы, таблицы, презентации и изображения; аудио и видео в списке поддерживаемых файлов нет. Модератор форума OpenAI прямо писал, что расшифровку аудио чат не поддерживает, а запрос на загрузку mp3 в июле 2026 приняли как пожелание на будущее.

Да, но только новую запись с микрофона, только в приложении для macOS и только на платных тарифах Plus, Pro, Business, Enterprise и Edu. Потолок 4 часа на сессию. Готовый файл, который уже лежит на телефоне, в Record не загрузить. Лучше всего работает на английском.

Нет. Алиса как ассистент слушает только вас в момент разговора. У Яндекс Браузера есть «Пересказ» видео с YouTube, VK, Rutube и Дзена длиной от 40 секунд до 4 часов, но это тезисы с таймкодами, а не дословная расшифровка, и локальный файл туда не загрузить.

Модель да, она открыта под лицензией MIT. Платите вы железом и временем: для точной модели нужна видеокарта с 8–10 ГБ памяти, без неё час записи считается часами. Говорящих Whisper не различает, а на живой русской речи ошибается примерно в каждом пятом слове по тестам Сбера.

По открытому сравнению, которое опубликовал Сбер, его модель GigaAM-v3 даёт в среднем 8,3 % ошибок по словам против 21,0 % у Whisper на десяти русскоязычных наборах данных. Яндекс SpeechKit в этих тестах не участвовал. Сравнение сделали сами разработчики GigaAM, независимого прогона мы не нашли.

По прайсу OpenAI от $0,003 до $0,006 за минуту в зависимости от модели. Из России напрямую не оплатить; у посредников, которые продают доступ за рубли, у нас вышло 1,55 ₽ за минуту с разделением по говорящим. Минута в Яндекс SpeechKit стоит 0,606 ₽, в отложенном режиме 0,152 ₽.

Только специальные. У OpenAI это одна модель, gpt-4o-transcribe-diarize; умеют режим Record, GigaChat и сервисы на SpeechKit. Whisper и GigaAM отдают сплошной текст, для спикеров к ним ставят отдельную надстройку.

Через API OpenAI резать на куски по 25 МБ и склеивать текст. Локальный Whisper возьмёт любую длину, но считать будет долго. Пересказ в Яндекс Браузере берёт видео до 4 часов, но только по ссылке и только тезисами. Сервис расшифровки принимает одним файлом до 2 ГБ и отдаёт текст со спикерами и таймкодами.

Всем локальным, это Whisper и GigaAM; всем российским, это Яндекс Браузер, SpeechKit, GigaChat и сервисы на них; мессенджерами. ChatGPT и Gemini требуют VPN и зарубежную карту, API OpenAI доступен через посредников за рубли.

В ChatGPT, API OpenAI и Gemini на серверы за пределами России. В Whisper и GigaAM на своём компьютере никуда. В Яндекс и Сбер на серверы в России. Текстомат обрабатывает звук в Яндекс SpeechKit и удаляет исходный файл через 30 минут после готовности текста; текст остаётся у вас.

Источники

  1. OpenAI Help Center — What types of files are supported?
  2. OpenAI Help Center — ChatGPT Record
  3. OpenAI Developer Community — Unable to generate transcript from MP3 (10.10.2024)
  4. OpenAI Developer Community — New ChatGPT .mp3 and .mp4 file support (13.07.2026)
  5. OpenAI — документация Speech to text
  6. OpenAI — страница модели gpt-transcribe с ценой
  7. openai/whisper — репозиторий с таблицей моделей
  8. SYSTRAN/faster-whisper — замеры скорости
  9. salute-developers/GigaAM — evaluation.md, сравнение с Whisper на русском
  10. GigaChat — «Как мы научили GigaChat слышать»
  11. Справка Яндекс Браузера — Пересказ
  12. Yandex AI Studio — правила тарификации SpeechKit
  13. Engadget — Telegram now offers all users limited transcriptions of voice messages
  14. WhatsApp Blog — Introducing Voice Message Transcripts
  15. Google — Audio understanding, Gemini API
🎁 30 минут бесплатноБез карты · отмена в один клик
Забрать