Расшифровка нейросетями: что умеют ChatGPT, Whisper, Алиса и GigaChat — и чего не умеют
Запрос звучит одинаково у студента, секретаря и юриста: есть запись, нужен текст, нейросеть же есть. А дальше у всех по-разному. Кто-то тянет mp3 в окно ChatGPT и получает отказ. Кто-то ставит Whisper и через час выясняет, что тот не различает, кто говорит. Кто-то просит Алису расшифровать голосовое, и Алиса не понимает, о чём речь. Мы прошли по каждому инструменту с одним вопросом: что он реально делает с готовой записью, на каких условиях и во что это обходится. Не по чужим обзорам, а по справкам производителей, документации и открытым тестам, везде стоят ссылки. Дата проверки: 11 сентября 2026 года.
- ChatGPT файл с записью не расшифровывает. По справке OpenAI он принимает документы, таблицы и картинки, аудио в списке нет. Есть режим записи Record: только на Mac, только на платных тарифах, только новая запись с микрофона, до 4 часов.
- API OpenAI (whisper-1, gpt-4o-transcribe, модель со спикерами) стоит $0,003–0,006 за минуту, файл до 25 МБ, это примерно 26 минут mp3. Из России только через посредников, у нас вышло 1,55 ₽ за минуту.
- Whisper на своём компьютере бесплатен, но час записи занимает от 5 минут на видеокарте до нескольких часов на процессоре. Говорящих не различает. На живой русской речи ошибается примерно в каждом пятом слове.
- Алиса файлы не берёт. Яндекс Браузер пересказывает видео с YouTube, VK и Rutube длиной от 40 секунд до 4 часов, но тезисами с таймкодами, не дословно. Речевая модель Яндекса, SpeechKit, доступна только программам: 0,606 ₽ за минуту.
- GigaChat принимает аудио и делит по говорящим, лимиты Сбер не публикует. Открытая модель GigaAM по тестам самого Сбера точнее Whisper на русском в два с половиной раза: 8,3 % ошибок против 21,0 %.
- Мессенджеры расшифровывают голосовые внутри чата, но не файлы. Telegram бесплатно даёт два сообщения в неделю, WhatsApp и MAX без лимита.
- По нашей базе из 244 реальных записей каждая третья длиннее 15 минут и каждый третий файл больше 25 МБ. За этой границей чат-режимы не работают вовсе, а API требует нарезки. Для встречи, интервью или лекции со спикерами нужна речевая модель без лимита на длину: API со спикерами через посредника или сервис на такой модели. У нас первые 30 минут бесплатны.
«Загрузить в ГПТ»: почему это работает не так, как ждёшь
Нейросетей, о которых идёт речь, два вида, и путаница между ними порождает почти все разочарования. Чат-модели вроде ChatGPT, GigaChat, Алисы AI или DeepSeek работают с текстом: читают его и пишут. Речевые модели, а это Whisper, Яндекс SpeechKit, GigaAM у Сбера, слушают. Они превращают звуковую волну в слова. Когда чат «понимает голос», за кулисами всегда работает вторая, речевая модель. Отдельная программа со своими лимитами на размер файла, длину записи и язык.
Аналогия из офиса. Переводчик может блестяще пересказать письмо, но стенографировать совещание не умеет, для этого зовут стенографистку. Спросите у переводчика «а ты можешь записать, что говорили на встрече?», и он ответит по памяти, что-то додумав. Именно так ведёт себя чат-модель, если подсунуть ей звук без речевой модели под капотом: отказывается или пересказывает.
Отсюда правило на всю статью. Вопрос «умеет ли ChatGPT расшифровывать» поставлен неправильно. Правильный звучит так: какая речевая модель стоит под капотом, на каких условиях к ней пускают и что она делает с длиной записи, спикерами и русским языком. Ниже ровно это, по каждому инструменту.
ChatGPT: что на самом деле происходит с аудиофайлом
Самый частый сценарий: человек перетаскивает mp3 в окно чата и ждёт текст. По справке OpenAI на сентябрь 2026 ChatGPT принимает документы, таблицы, презентации и изображения, то есть DOCX, PDF, XLSX, PPTX. Аудио и видео в списке поддерживаемых файлов нет.
ИсточникOpenAI Help Center, «What types of files are supported?»
Что происходит на практике, описано на форуме самой OpenAI. В октябре 2024 владелец платной подписки Plus пожаловался, что загрузил mp3 и получил ошибку «требуемый модуль для транскрибации недоступен в текущем окружении». Чат попытался запустить внутри себя программу распознавания и не смог. Модератор ответил прямо: «ChatGPT, бесплатный или Plus, напрямую расшифровку аудио не поддерживает», и посоветовал отдельный платный API. В июле 2026 другой пользователь попросил добавить полноценную загрузку mp3 и mp4. Поддержка OpenAI приняла это как пожелание «для будущей разработки». За два года ничего не изменилось.
Нас удивило другое. В англоязычных обзорах гуляет утверждение «с 2024 года в ChatGPT можно загрузить mp3 до 25 МБ». Цифра 25 МБ существует, это лимит API для программистов, о нём в следующем разделе. На чат её перенесли по ошибке, и ошибка разошлась по десяткам статей. Если у вас загрузка звука в чат однажды сработала, это эксперимент, которого нет в справке, и он может исчезнуть в любой день.
Что ChatGPT умеет с голосом на самом деле. Три вещи, и ни одна не про готовый файл.
- Голосовой режим. Расшифровывает то, что вы говорите в микрофон прямо сейчас, и отвечает. Запись встречи сюда не подсунуть, только свою живую речь.
- Режим записи Record. Кнопка в приложении для macOS на тарифах Plus, Pro, Business, Enterprise и Edu. Пишет встречу или голосовую заметку с микрофона и системного звука, расшифровывает на лету, различает говорящих (когда не знает имени, пишет «Speaker 1»), на выходе даёт конспект и расшифровку. Потолок 4 часа на одну сессию. В браузере и на Windows кнопки нет. По словам OpenAI, режим «лучше всего работает на английском, для других языков точность варьируется». Аудио удаляется после расшифровки, а вот текст расшифровки у пользователей Free, Plus и Pro может пойти в обучение моделей, если не выключить в настройках пункт «Улучшать модель для всех».
- API. Платный доступ для программ, где и живут речевые модели OpenAI. Ему посвящён следующий раздел.
Отдельно про Россию. Сайт и приложения ChatGPT официально здесь не работают: нужен VPN, а подписку Plus нельзя оплатить картой российского банка. Для личных заметок это неудобство. Для рабочих записей с чужими голосами ещё и вопрос закона, к нему вернёмся в конце.
Итог по ChatGPT: файл с записью встречи в чат не загрузить. Если у вас Mac и платный тариф, можно записать встречу заново через Record. Старую запись с телефона он не возьмёт.
ИсточникOpenAI Help Center, «ChatGPT Record», проверено 11.09.2026
Тот же OpenAI, но через API: Whisper-1, gpt-4o-transcribe и модель со спикерами
API это служебный вход для программ: вы или сервис за вас отправляете файл на сервер OpenAI и получаете обратно текст. Здесь пять речевых моделей, у каждой свой характер.
| Модель | Что умеет | Цена по прайсу OpenAI |
|---|---|---|
| whisper-1 | Таймкоды по фразам и по словам, перевод речи на английский, субтитры. OpenAI называет её устаревшей, но таймкоды есть только у неё | $0,006 за минуту |
| gpt-transcribe | Рекомендуемая сейчас: принимает подсказки с терминами и списком языков, работает в потоке | $0,0045 за минуту |
| gpt-4o-transcribe | Точнее Whisper по словам OpenAI, без таймкодов | $2,5 за миллион аудиотокенов, это около $0,006 за минуту |
| gpt-4o-mini-transcribe | Дешёвая версия той же модели | $1,25 за миллион аудиотокенов, около $0,003 за минуту |
| gpt-4o-transcribe-diarize | Единственная, которая делит речь по говорящим. Можно дать до четырёх образцов голоса по 2–10 секунд, чтобы она подписала спикеров именами. Подсказки не принимает | У российских посредников около 1,5 ₽ за минуту |
Общие условия для всех пяти: файл не больше 25 МБ, форматы mp3, mp4, mpeg, mpga, m4a, wav и webm. Отдельного лимита на длительность нет, ограничивает размер. Переведём 25 МБ в минуты. Mp3 с битрейтом 128 кбит/с даёт около 26 минут, 64 кбит/с около 52 минут, несжатый wav всего две с половиной минуты. Часовую встречу придётся резать на куски, отправлять по одному и склеивать текст, следя, чтобы разрез не пришёлся на середину слова.
Таймкоды есть только у whisper-1 (параметр timestamp_granularities и формат ответа verbose_json). Спикеры только у gpt-4o-transcribe-diarize, причём для записей длиннее 30 секунд документация требует включить автоматическую нарезку, chunking_strategy = auto. Остальные модели отдают сплошной текст.
Из России оплатить API напрямую нельзя по той же причине, что и подписку. Работают посредники: они продают доступ к тем же моделям за рубли и без VPN, добавляя свою наценку. Мы проверяли такой доступ сами. 17 июля 2026 года прогнали десятиминутный фрагмент через gpt-4o-transcribe-diarize у одного из посредников. Ответ шёл около четырёх минут, на монологе модель насчитала одного говорящего, то есть лишних не придумала, а стоимость вышла 1,55 ₽ за минуту. Себестоимость той же минуты в Яндекс SpeechKit, на котором работает наш сервис, 0,606 ₽.
И главное, о чём посредники пишут мелким шрифтом: файл при этом уходит на серверы OpenAI за пределы России. Для записи с голосами клиентов, пациентов или сотрудников это не техническая деталь, а вопрос 152-ФЗ.
ИсточникOpenAI, документация «Speech to text» и страница модели gpt-transcribe
Whisper у себя на компьютере: скорость, железо и русский язык
Whisper это открытая речевая модель OpenAI, выпущенная в 2022 году под лицензией MIT. Скачал, запустил, платишь только электричеством. Тот самый «бесплатный ChatGPT для аудио», который ищут в поиске. Только бесплатность здесь со своими условиями, и начинаются они с железа.
| Модель | Параметров | Нужно видеопамяти | Скорость относительно large |
|---|---|---|---|
| tiny | 39 млн | около 1 ГБ | примерно в 10 раз быстрее |
| base | 74 млн | около 1 ГБ | в 7 раз быстрее |
| small | 244 млн | около 2 ГБ | в 4 раза быстрее |
| medium | 769 млн | около 5 ГБ | в 2 раза быстрее |
| large (v3) | 1,55 млрд | около 10 ГБ | 1×, эталон |
| turbo | 809 млн | около 6 ГБ | в 8 раз быстрее |
Сколько это по времени, замерил проект faster-whisper, ускоренная реализация той же модели, которую используют почти все оболочки. Запись на 13 минут, модель large-v2: оригинальный Whisper на видеокарте считает 2 минуты 23 секунды, faster-whisper 1 минуту 3 секунды, а с пакетной обработкой 17 секунд. На процессоре без видеокарты, модель small: 6 минут 58 секунд у оригинала против 2 минут 37 секунд у ускоренной версии.
Переведём в час записи. На видеокарте с 8–10 ГБ памяти самая точная модель обрабатывает час примерно за 5 минут, в пакетном режиме за полторы. На обычном ноутбуке без видеокарты модель small справится с часом за 12 минут, а large будет считать часами. На практике на процессоре ставят small или base и получают заметно больше ошибок.
Теперь про русский, и это самая важная цифра в статье. Точность речевых моделей меряют показателем WER, долей неправильно распознанных слов; что это и как посчитать на своей записи, мы разбирали отдельно. По открытому сравнению, которое Сбер опубликовал вместе со своей моделью GigaAM, Whisper даёт на десяти русскоязычных наборах данных средний WER 21,0 %. На чистой начитанной речи из Common Voice 5,5 %, на краудсорсинговых записях Golos 19,0 %, на звонках в колл-центр 23,1 %, на телефонных разговорах 27,4 %. Проще говоря, на живой русской речи Whisper ошибается примерно в каждом пятом слове. Модель Сбера на тех же данных даёт 8,3 %.
Чего в Whisper нет, и что с этим делают.
- Разделения по говорящим. Whisper выдаёт сплошной текст. Чтобы понять, кто что сказал, ставят надстройку WhisperX или библиотеку pyannote: отдельная установка, видеокарта и ещё один слой ошибок.
- Устойчивости к тишине. На паузах, музыке и шуме модель галлюцинирует, то есть дописывает фразы, которых не было. Русскоязычный интернет знает это по знаменитому «Субтитры сделал DimaTorzok», которое Whisper вставляет в тишину. Наследие обучения на субтитрах к видео.
- Длинного окна. Модель слушает кусками по 30 секунд и режет запись сама, на стыках иногда теряет слово.
- Единообразия в цифрах. Даты и суммы выходят то словами, то цифрами, для протокола это придётся править руками.
- Кнопки. Whisper это командная строка. Оболочки с окном есть (whisper.cpp, Buzz, MacWhisper, Subtitle Edit), но установка Python, ffmpeg и драйверов видеокарты остаётся на вас.
Стоимость владения без прикрас: если видеокарты нет, «бесплатный» Whisper превращается либо в покупку железа, либо в ожидание. Плюс вечер на установку и отсутствие поддержки. Когда что-то отвалится после обновления, спросить будет не у кого. Зато есть четыре ситуации, где локальный Whisper единственно верный выбор: закрытые данные, которые нельзя выпускать с компьютера; работа без интернета; десятки часов записей в месяц при уже имеющейся видеокарте; английская речь, на которой Whisper силён.
Алиса, Яндекс Браузер и SpeechKit: что из Яндекса даёт текст
Алиса как ассистент, в колонке, в приложении, в браузере, файлы не принимает. Она слушает вас, а не запись. Команда «Алиса, расшифруй голосовое» упирается в ту же стену, что и mp3 в ChatGPT. Голос в текст Алиса переводит только ваш собственный и только пока вы говорите.
Другое дело Яндекс Браузер с Алисой AI. У него есть «Пересказ» для видео: работает на dzen.ru, vkvideo.ru, vk.com, youtube.com и rutube.ru, видео должно быть длиной от 40 секунд до 4 часов, основные языки русский плюс английский, остальные он тоже пробует. На выходе основные тезисы с таймкодами в двух вариантах, «кратко» и «подробно», плюс автоматические субтитры и перевод слов по клику. Удобно, когда надо понять, стоит ли смотреть часовую лекцию.
Но это не расшифровка. Пересказ выбрасывает большую часть сказанного, дословных цитат в нём нет, локальный файл с диктофона в браузер не загрузить. И, как честно пишет справка, «нейросеть не перескажет видео, если в нём никто не говорит или нет субтитров». Для конспекта лекции по ссылке годится. Для протокола совещания или интервью нет.
Телемост, где проходит половина корпоративных созвонов, записывает встречу на Яндекс Диск, а расшифровку даёт в бизнес-тарифе Яндекс 360. Этот маршрут вместе с тем, что умеет Алиса на самом деле, мы разобрали в отдельной статье о транскрибации в Яндексе.
Настоящая речевая модель Яндекса называется SpeechKit. Для обычного человека у неё нет кнопки, это облачный сервис для программ. По прайсу на 11 сентября 2026 асинхронное распознавание файла стоит 0,1515 ₽ за 15 секунд, то есть 0,606 ₽ за минуту, а отложенный режим, когда результат не нужен сразу, 0,0381 ₽ за 15 секунд, или 0,152 ₽ за минуту, всё с НДС. На SpeechKit работают сервисы расшифровки, в том числе наш, отсюда и наша себестоимость минуты. Сильные стороны: родной русский и серверы в России. Слабая одна: без программиста к нему не подойти.
ИсточникСправка Яндекс Браузера, раздел «Пересказ»; правила тарификации SpeechKit
GigaChat и GigaAM: самое сильное на русском
GigaChat один из немногих больших чатов, который принимает аудио напрямую и при этом работает из России: в веб-версии giga.chat, в Telegram-боте и в мессенджере MAX. В справке Сбер описывает, как учил модель слышать. Распознавание диалогов с разбиением по спикерам, метки говорящего, форматирование расшифровки, при желании маскирование мата и пометка слов-паразитов. Чего в справке нет: лимитов на длину и размер файла и обещания дословности. Наш совет: пробовать на записи до 15–20 минут и проверять, не пересказал ли чат вместо того, чтобы расшифровать. Чат-модель по природе тянется к пересказу, и на длинной записи это заметнее всего.
Куда интереснее то, что Сбер выложил в открытый доступ: речевую модель GigaAM под той же лицензией MIT, что и Whisper. Версия v3 обучена на 700 тысячах часов русской речи, и вместе с ней опубликована таблица сравнения с Whisper на десяти наборах данных. Ниже пять строк из неё, WER в процентах, меньше значит лучше.
| Набор данных | GigaAM-v3 | Whisper |
|---|---|---|
| Common Voice 19, чистая начитанная речь | 0,9 % | 5,5 % |
| Golos Crowd, краудсорсинговые записи | 2,4 % | 19,0 % |
| Звонки в колл-центр | 9,5 % | 23,1 % |
| Телефонные разговоры (OpenSTT) | 17,4 % | 27,4 % |
| Видео с YouTube (OpenSTT) | 10,6 % | 17,8 % |
| Среднее по десяти наборам | 8,3 % | 21,0 % |
Оговорки. GigaAM это модель распознавания, не диаризации: говорящих она не различает. Готовой программы с кнопкой нет, нужен Python не ниже 3.10, ffmpeg и команда pip install. На процессоре работает, но медленно, видеокарта желательна. То есть это инструмент для разработчика, который хочет собрать себе локальную расшифровку русского без зарубежных моделей. В той же таблице Сбера есть ещё одна российская открытая модель, T-One от Т-Банка, со средним WER 16,3 %: хуже GigaAM, но лучше Whisper.
ИсточникРепозиторий salute-developers/GigaAM и его evaluation.md
Голосовые в мессенджерах: Telegram, VK, WhatsApp, MAX
Самая частая расшифровка в жизни не встреча, а голосовое от коллеги на три минуты. Тут нейросети встроены прямо в мессенджеры, и у каждого свои правила.
| Мессенджер | Что расшифровывает | Лимит | Где обрабатывается |
|---|---|---|---|
| Telegram | Голосовые и видеосообщения в чате, кнопка «→A» у сообщения | Бесплатно два сообщения в неделю, с Premium без ограничений | На серверах Telegram |
| VK | Голосовые в мобильном приложении, кнопка у сообщения; текст можно править в течение суток | Рассчитана на короткие сообщения | На серверах VK |
| Голосовые; русский поддерживается, включается в настройках чатов | Без лимита | На самом телефоне, звук никуда не отправляется | |
| MAX | Голосовые и видеосообщения, кнопка «Т» у сообщения; работает с 5 мая 2026 | Без лимита | На серверах MAX |
Общее ограничение у всех четырёх одно: расшифровывают только сообщения внутри чата. Файл с диктофона, запись созвона, лекцию мессенджер не возьмёт, а если переслать себе mp3, кнопки расшифровки рядом с ним не появится. Для голосовых длиннее пары минут и для аудиофайлов из чатов удобнее бот или сервис, который принимает запись как файл.
Gemini, DeepSeek и остальные чаты
Gemini от Google аудио принимает, но с разными лимитами для людей и для программ: в приложении до 10 файлов общей длиной не больше 10 минут, через API до 9,5 часов звука в одном запросе. Из России и то и другое через VPN и с зарубежной картой. DeepSeek работает с текстом и документами, звук не принимает вовсе. Если появится новый чат, который «умеет аудио», проверьте три вещи до того, как отправлять ему часовую запись: лимит длины, есть ли разделение по говорящим и дословно ли он расшифровывает или пересказывает.
ИсточникGoogle, «Audio understanding», документация Gemini API
Сводная таблица: четырнадцать инструментов по шести признакам
| Инструмент | Файл с записью | Длина | Спикеры | Таймкоды | Из России без VPN | Цена |
|---|---|---|---|---|---|---|
| ChatGPT, чат | нет | — | — | — | нет | подписка |
| ChatGPT Record (Mac) | нет, только запись вживую | до 4 часов | да | нет, конспект | нет | Plus и выше |
| OpenAI API, whisper-1 | да, до 25 МБ | по размеру файла | нет | да | через посредника | $0,006 за минуту |
| OpenAI API, diarize | да, до 25 МБ | по размеру файла | да | нет | через посредника | около 1,5 ₽ за минуту |
| Whisper на компьютере | да | любая | нет, нужен WhisperX | да | да | видеокарта и время |
| Яндекс Браузер, пересказ | нет, видео по ссылке | 40 с – 4 ч | нет | да, у тезисов | да | бесплатно |
| Яндекс SpeechKit, API | да | любая | да | да | да | 0,606 ₽ за минуту |
| GigaChat | да | не опубликована | да | нет | да | бесплатно |
| GigaAM на компьютере | да | любая | нет | нет из коробки | да | видеокарта и время |
| Telegram | только голосовые | — | нет | нет | да | 2 в неделю или Premium |
| только голосовые | — | нет | нет | да | бесплатно | |
| MAX | только голосовые | — | нет | нет | да | бесплатно |
| Gemini, приложение | да | до 10 минут | нет | нет | нет | подписка |
| Текстомат | да, до 2 ГБ | любая | да | да | да | 30 минут бесплатно, дальше от 490 ₽ в месяц |
Что мы намерили сами
Мы делаем сервис расшифровки на Яндекс SpeechKit, поэтому у нас есть цифры, которых в справках нет: своя экономика и свои прогоны.
| Способ | Себестоимость минуты | Что в неё входит |
|---|---|---|
| Яндекс SpeechKit, асинхронно | 0,606 ₽ | Распознавание, спикеры, таймкоды, серверы в России |
| Яндекс SpeechKit, отложенный режим | 0,152 ₽ | То же, но результат не сразу, зато в четыре раза дешевле |
| OpenAI diarize через посредника | 1,55 ₽ | Распознавание со спикерами; данные за рубежом; наш замер 17.07.2026 |
| Whisper на своём компьютере | 0 ₽ | Плюс видеокарта, электричество и ваше время на установку и ожидание |
Замер OpenAI мы уже описали: десять минут монолога, около четырёх минут ожидания, один говорящий без выдуманных лишних, 1,55 ₽ за минуту. Он же показал, почему мы не переключили движок. Текст на выходе был рабочий, но цена выше в два с половиной раза, и запись уезжает за границу.
Второй набор цифр из нашей базы. 11 сентября 2026 мы посчитали все 244 записи, которые клиенты расшифровали с середины июня: 100 человек, 61,5 часа звука, только средние, без имён и файлов. Вот как выглядит реальная запись, а не та, что в примерах из справок.
| Показатель | Значение | Что это значит для нейросетей из статьи |
|---|---|---|
| Медианная длина записи | 9 минут | Половина записей короче, их возьмёт почти любой инструмент |
| Записей длиннее 15 минут | 36 % | Каждая третья не помещается в чат-режимы и требует нарезки для API |
| Файлов больше 25 МБ | 36 % | Каждый третий файл не пройдёт лимит API OpenAI как есть |
| Файлов больше 100 МБ | 22 % | Видео и несжатый звук, это уже не «отправить в чат» |
| Записей длиннее часа | 2 % | Редкость, но самая длинная у нас 3 часа 39 минут |
| Каждая десятая запись | длиннее 33 минут | Лекция, интервью, планёрка: основной рабочий формат |
Вывод из таблицы простой. Пока запись короткая, нейросети взаимозаменяемы, берите любую бесплатную. Граница проходит по пятнадцати минутам и по 25 мегабайтам. За ней каждая третья запись в чат-режимы не помещается вовсе, а в API OpenAI пролезает только нарезкой на куски. Вот где на самом деле разница между «поиграть с нейросетью» и «работать с записями»: в длине и размере файла, а не в точности.
И про нас без прикрас: стопроцентной точности нет и у нас. На именах, узких терминах и записи из дальнего угла переговорной мы ошибаемся, как и все. Где именно и что с этим делать, написано отдельно, а проверить на своей записи можно на бесплатных 30 минутах.
Как выбрать: шесть ситуаций
- Голосовое на сорок секунд от коллеги. Кнопка в мессенджере: WhatsApp и MAX бесплатно и без лимита, Telegram два в неделю. Ничего лучше не нужно.
- Свои мысли на ходу. Голосовой режим любого чата или диктовка в телефоне: вы говорите, текст появляется. Это голос в текст без файла, и здесь ChatGPT действительно хорош.
- Один файл до 15 минут, один голос, и вы дружите с командной строкой. Whisper или GigaAM на своём компьютере либо API OpenAI через посредника. Дёшево и под контролем.
- Лекция на полтора часа для конспекта. Если она лежит на YouTube или VK и нужны только тезисы, хватит пересказа в Яндекс Браузере. Если нужен текст, по которому можно искать и цитировать, берите сервис с таймкодами, а дальше конспект из него.
- Планёрка вчетвером, где важно, кто что обещал. Только модель с разделением по говорящим: gpt-4o-transcribe-diarize через посредника с нарезкой файла или сервис, который делает это одним файлом, как устроены спикеры у нас.
- Записи пациентов, клиентов, переговоры по договору, материалы для суда. Либо локальная модель, либо обработка в России. Зарубежные API исключены не из-за качества, а из-за закона, подробнее о конфиденциальности.
Что делать с текстом после нейросети: пять промптов и чек-лист вычитки
Расшифровка это сырьё. Превращать её в документ чат-модель умеет отлично, любая: ChatGPT, GigaChat, Алиса, наш ИИ-слой на YandexGPT. Условие одно: просить правильно и проверять в правильных местах. Промпты ниже мы обкатали на своих записях, копируйте как есть.
- Причесать: «Ниже дословная расшифровка. Убери слова-паразиты и повторы, исправь опечатки распознавания, расставь абзацы. Смысл и порядок реплик не меняй, ничего не сокращай».
- Саммари: «Составь выжимку: пять главных тезисов, принятые решения, открытые вопросы. У каждого пункта укажи, кто это сказал, если в тексте есть имена. Не добавляй ничего, чего нет в тексте».
- Протокол: «Оформи как протокол совещания: участники, повестка, решения, поручения (кому, что, срок). Если срок или исполнитель не названы, пиши „не определено“, не придумывай».
- Цитаты: «Найди пять самых сильных дословных цитат и приведи их без изменений, с указанием говорящего».
- Термины: «Выпиши списком все имена, названия компаний, термины и цифры, я проверю их по записи».
Теперь где чат-модель врёт. Не потому что плохая. Её учили писать связно, а связность проще всего достигается додумыванием. Она придумывает решения: «давайте подумаем до пятницы» превращается в «договорились сделать к пятнице». Путает, кто что обещал, особенно если спикеры подписаны номерами, а не именами. Округляет цифры: в расшифровке 1 490, в саммари «около полутора тысяч», в протоколе так нельзя. Сглаживает возражения, и спор на десять минут становится «участники согласились». А если запись оборвалась на полуслове, закончит фразу за говорящего.
Отсюда чек-лист вычитки любого текста, который нейросеть сделала из расшифровки. Сверить каждую цифру и дату с дословным текстом. Проверить имена и должности. Каждое «решили» и «поручили» найти в расшифровке дословно. Отдельно перечитать отрицания: «не будем» и «будем» модель путает чаще, чем кажется. Всё, что стоит в кавычках, проверить на дословность. Последний абзац прочитать с вопросом «а это точно было сказано». Тем же грешит и наш ИИ-слой, поэтому у нас дословная вкладка всегда лежит рядом с причёсанной и с саммари. Проверять есть по чему.
Куда уходит запись: данные и закон
Последний признак, по которому инструменты различаются сильнее всего, в таблицах обычно не пишут. Запись встречи это голоса всех, кто на ней был, то есть персональные данные третьих лиц. По 152-ФЗ у их обработки должны быть основания, а у передачи за границу тем более. Плюс само право на запись: о ней предупреждают, а в ряде случаев берут согласие.
| Инструмент | Где обрабатывается звук | Что остаётся у производителя |
|---|---|---|
| ChatGPT, API OpenAI, Gemini | Серверы за пределами России | Record удаляет аудио после расшифровки, но текст у Free, Plus и Pro может использоваться для обучения, пока это не выключено в настройках |
| Whisper и GigaAM на своём компьютере | Нигде, всё на вашей машине | Ничего |
| Яндекс SpeechKit, Яндекс Браузер, GigaChat | Серверы в России | По условиям каждого сервиса |
| Telegram, VK, MAX | Серверы мессенджера | По условиям мессенджера |
| На телефоне | Ничего, расшифровка не покидает устройство |
И наш расклад без рекламных формулировок. Текстомат обрабатывает звук в Яндекс SpeechKit, на серверах в России. Но это значит, что фраза «данные никуда не уходят» про нас неправда: они уходят Яндексу. Исходный файл удаляется автоматически через 30 минут после того, как текст готов (предельный срок по оферте 7 дней), а сам текст хранится у вас, пока вы его не удалите. Если для вашей задачи важно, чтобы запись вообще не покидала компьютер, это случай для Whisper или GigaAM, и мы об этом сказали выше.
Попробуйте Текстомат на своей записи
Загрузите аудио или видео и получите готовый текст со спикерами и таймкодами. Первые 30 минут — бесплатно, без карты.
Расшифровать запись бесплатноЧастые вопросы
Нет. По справке OpenAI на сентябрь 2026 ChatGPT принимает документы, таблицы, презентации и изображения; аудио и видео в списке поддерживаемых файлов нет. Модератор форума OpenAI прямо писал, что расшифровку аудио чат не поддерживает, а запрос на загрузку mp3 в июле 2026 приняли как пожелание на будущее.
Да, но только новую запись с микрофона, только в приложении для macOS и только на платных тарифах Plus, Pro, Business, Enterprise и Edu. Потолок 4 часа на сессию. Готовый файл, который уже лежит на телефоне, в Record не загрузить. Лучше всего работает на английском.
Нет. Алиса как ассистент слушает только вас в момент разговора. У Яндекс Браузера есть «Пересказ» видео с YouTube, VK, Rutube и Дзена длиной от 40 секунд до 4 часов, но это тезисы с таймкодами, а не дословная расшифровка, и локальный файл туда не загрузить.
Модель да, она открыта под лицензией MIT. Платите вы железом и временем: для точной модели нужна видеокарта с 8–10 ГБ памяти, без неё час записи считается часами. Говорящих Whisper не различает, а на живой русской речи ошибается примерно в каждом пятом слове по тестам Сбера.
По открытому сравнению, которое опубликовал Сбер, его модель GigaAM-v3 даёт в среднем 8,3 % ошибок по словам против 21,0 % у Whisper на десяти русскоязычных наборах данных. Яндекс SpeechKit в этих тестах не участвовал. Сравнение сделали сами разработчики GigaAM, независимого прогона мы не нашли.
По прайсу OpenAI от $0,003 до $0,006 за минуту в зависимости от модели. Из России напрямую не оплатить; у посредников, которые продают доступ за рубли, у нас вышло 1,55 ₽ за минуту с разделением по говорящим. Минута в Яндекс SpeechKit стоит 0,606 ₽, в отложенном режиме 0,152 ₽.
Только специальные. У OpenAI это одна модель, gpt-4o-transcribe-diarize; умеют режим Record, GigaChat и сервисы на SpeechKit. Whisper и GigaAM отдают сплошной текст, для спикеров к ним ставят отдельную надстройку.
Через API OpenAI резать на куски по 25 МБ и склеивать текст. Локальный Whisper возьмёт любую длину, но считать будет долго. Пересказ в Яндекс Браузере берёт видео до 4 часов, но только по ссылке и только тезисами. Сервис расшифровки принимает одним файлом до 2 ГБ и отдаёт текст со спикерами и таймкодами.
Всем локальным, это Whisper и GigaAM; всем российским, это Яндекс Браузер, SpeechKit, GigaChat и сервисы на них; мессенджерами. ChatGPT и Gemini требуют VPN и зарубежную карту, API OpenAI доступен через посредников за рубли.
В ChatGPT, API OpenAI и Gemini на серверы за пределами России. В Whisper и GigaAM на своём компьютере никуда. В Яндекс и Сбер на серверы в России. Текстомат обрабатывает звук в Яндекс SpeechKit и удаляет исходный файл через 30 минут после готовности текста; текст остаётся у вас.
Источники
- OpenAI Help Center — What types of files are supported?
- OpenAI Help Center — ChatGPT Record
- OpenAI Developer Community — Unable to generate transcript from MP3 (10.10.2024)
- OpenAI Developer Community — New ChatGPT .mp3 and .mp4 file support (13.07.2026)
- OpenAI — документация Speech to text
- OpenAI — страница модели gpt-transcribe с ценой
- openai/whisper — репозиторий с таблицей моделей
- SYSTRAN/faster-whisper — замеры скорости
- salute-developers/GigaAM — evaluation.md, сравнение с Whisper на русском
- GigaChat — «Как мы научили GigaChat слышать»
- Справка Яндекс Браузера — Пересказ
- Yandex AI Studio — правила тарификации SpeechKit
- Engadget — Telegram now offers all users limited transcriptions of voice messages
- WhatsApp Blog — Introducing Voice Message Transcripts
- Google — Audio understanding, Gemini API