Транскрибация WAV в текст

Формат без потерь даёт лучший результат распознавания — загрузите запись как есть.

Файлы и ссылки: YouTube, VK Video, Rutube, OK, Дзен. До 2 ГБ.

Загрузить файл

Перетащите или выберите с компьютера

По ссылке

Вставьте URL: YouTube, VK, Rutube, OK, Дзен

✓ MP3, WAV, FLAC, AAC, Opus✓ MP4, MOV, AVI, MKV✓ YouTube, VK, Rutube, OK✓ до 2 ГБ✓ 99 языков
95–99%
точность на записях хорошего качества
10–15%
от длительности — время обработки
4 формата
TXT · DOCX · PDF · SRT
99
языков, включая языки СНГ

Три шага

От файла до готового текста

Без настроек и конвертаций — сервис сам достаёт звук и разбирается с форматом.

Загрузите файл или ссылку

Аудио, видео или открытая публикация с YouTube, VK, Rutube, OK или Дзена. До 2 ГБ.

Выберите язык и режим

Русский, английский и языки СНГ. Быстрый режим — для чистых записей, «Качество» — для сложного звука.

Заберите результат

Текст с таймкодами и спикерами, AI-сводка и выгрузка в нужном формате.

WAV хранит звук в исходном виде, без сжатия с потерями. Для распознавания речи это лучший из возможных исходников: модель получает всю звуковую картину целиком, включая тихие реплики и окончания слов, которые кодеки вроде MP3 частично отбрасывают. Разница особенно заметна на записях с несколькими собеседниками и заметным фоновым шумом.

Обратная сторона формата — вес. Час стереозаписи в 44,1 кГц занимает около 600 МБ, поэтому длинные совещания в WAV легко упираются в лимит загрузки. Если файл не проходит, его достаточно один раз сохранить в MP3 с битрейтом 128 кбит/с и выше: на итоговой точности это почти не скажется, а размер уменьшится в несколько раз.

Посчитать вес заранее несложно, потому что в несжатом звуке он линеен. Речевой стандарт — 16 кГц, 16 бит, моно — даёт около 1,9 МБ на минуту, то есть примерно 115 МБ в час. Студийные 44,1 кГц в стерео тяжелее почти в шесть раз. Отсюда простое правило: если запись длиннее двух часов и сделана в студийных параметрах, проверьте размер до загрузки.

В WAV пишут профессиональные полевые рекордеры, аудиоинтерфейсы и программы монтажа звука — Audacity, Reaper, Adobe Audition. Именно поэтому формат чаще всего встречается там, где к записи изначально относились серьёзно: интервью для эфира, студийные подкасты, полевые исследования. На таких файлах распознавание показывает лучший результат, какой вообще возможен.

Пара технических нюансов, о которых стоит знать. Некоторые рекордеры пишут в 32-битном формате с плавающей точкой — это удобно при монтаже, но для распознавания избыточно, и такой файл лучше пересохранить в обычные 16 бит. Изредка попадаются WAV со сжатием ADPCM внутри: формально это тот же контейнер, но звук в нём уже с потерями, и преимущества перед MP3 у него нет.

Если запись многодорожечная — например, каждый участник интервью писался на отдельный канал, — имеет смысл свести дорожки в одну перед загрузкой. Разделение по спикерам работает и так, но чистые раздельные каналы, сведённые в моно, дают более предсказуемый результат, чем стереофайл, где голоса разнесены по сторонам.

Что вы получаете

Любой формат — без конвертации

Сервис сам разбирается с контейнером и достаёт из него звук.

Интервью_с_архитекторомmp3 · 42:10 · качество
00:12
Интервьюер

Расскажите, с чего начался проект?

02:31
Архитектор

Всё началось с двух реконструкций старых домов в центре города…

05:04
Интервьюер

А как решали вопрос с шумоизоляцией?

AI-сводка

  • Проект вырос из двух реконструкций старых домов.
  • Ключевое решение — собственная сборка перекрытий.

Формат определяется сам

Расширение файла не нужно указывать вручную — сервис распознаёт контейнер автоматически.

Звук из видео

Аудиодорожка извлекается из видеофайла автоматически, изображение при расшифровке не используется.

До 2 ГБ на файл

Лимит покрывает большинство записей. Более длинные нужно разбить на части — до четырёх часов каждая.

Точность не зависит от формата

На результат влияет качество записи, а не расширение. Разница между WAV и хорошим MP3 минимальна.

Разделение по спикерам

Работает одинаково для всех форматов — реплики группируются по говорящим.

Выгрузка в TXT, DOCX, PDF и SRT

Один раз расшифровали — забираете в любом формате, в том числе в нескольких сразу.

Частые вопросы

Коротко и по делу

Почему WAV распознаётся точнее, чем MP3?+

MP3 отбрасывает часть звуковой информации ради экономии места, и первыми страдают тихие звуки — концы слов, шёпот, реплики удалённого от микрофона собеседника. В WAV этих потерь нет, поэтому модели проще восстановить речь целиком.

WAV-файл слишком большой для загрузки, что делать?+

Максимальный размер файла — 2 ГБ. Пересохраните запись в MP3 с битрейтом от 128 кбит/с: качество распознавания практически не изменится, а объём сократится примерно в десять раз.

Какие частота дискретизации и разрядность подойдут?+

Достаточно 16 кГц и 16 бит — это стандарт для речи. Более высокие значения не дадут прироста точности, но увеличат размер файла.

Обрабатывается ли моно-запись хуже стерео?+

Нет. Для распознавания речи моно вполне достаточно, а для диктофонных записей оно даже предпочтительнее — файл получается вдвое легче при том же результате.

Попробуйте сами

150 минут — всего за 99 ₽

Расшифруйте первый файл и посмотрите, как это работает. Подписок и скрытых списаний нет.