Транскрибация WAV в текст
Формат без потерь даёт лучший результат распознавания — загрузите запись как есть.
Файлы и ссылки: YouTube, VK Video, Rutube, OK, Дзен. До 2 ГБ.
Загрузить файл
Перетащите или выберите с компьютера
По ссылке
Вставьте URL: YouTube, VK, Rutube, OK, Дзен
Три шага
От файла до готового текста
Без настроек и конвертаций — сервис сам достаёт звук и разбирается с форматом.
Загрузите файл или ссылку
Аудио, видео или открытая публикация с YouTube, VK, Rutube, OK или Дзена. До 2 ГБ.
Выберите язык и режим
Русский, английский и языки СНГ. Быстрый режим — для чистых записей, «Качество» — для сложного звука.
Заберите результат
Текст с таймкодами и спикерами, AI-сводка и выгрузка в нужном формате.
WAV хранит звук в исходном виде, без сжатия с потерями. Для распознавания речи это лучший из возможных исходников: модель получает всю звуковую картину целиком, включая тихие реплики и окончания слов, которые кодеки вроде MP3 частично отбрасывают. Разница особенно заметна на записях с несколькими собеседниками и заметным фоновым шумом.
Обратная сторона формата — вес. Час стереозаписи в 44,1 кГц занимает около 600 МБ, поэтому длинные совещания в WAV легко упираются в лимит загрузки. Если файл не проходит, его достаточно один раз сохранить в MP3 с битрейтом 128 кбит/с и выше: на итоговой точности это почти не скажется, а размер уменьшится в несколько раз.
Посчитать вес заранее несложно, потому что в несжатом звуке он линеен. Речевой стандарт — 16 кГц, 16 бит, моно — даёт около 1,9 МБ на минуту, то есть примерно 115 МБ в час. Студийные 44,1 кГц в стерео тяжелее почти в шесть раз. Отсюда простое правило: если запись длиннее двух часов и сделана в студийных параметрах, проверьте размер до загрузки.
В WAV пишут профессиональные полевые рекордеры, аудиоинтерфейсы и программы монтажа звука — Audacity, Reaper, Adobe Audition. Именно поэтому формат чаще всего встречается там, где к записи изначально относились серьёзно: интервью для эфира, студийные подкасты, полевые исследования. На таких файлах распознавание показывает лучший результат, какой вообще возможен.
Пара технических нюансов, о которых стоит знать. Некоторые рекордеры пишут в 32-битном формате с плавающей точкой — это удобно при монтаже, но для распознавания избыточно, и такой файл лучше пересохранить в обычные 16 бит. Изредка попадаются WAV со сжатием ADPCM внутри: формально это тот же контейнер, но звук в нём уже с потерями, и преимущества перед MP3 у него нет.
Если запись многодорожечная — например, каждый участник интервью писался на отдельный канал, — имеет смысл свести дорожки в одну перед загрузкой. Разделение по спикерам работает и так, но чистые раздельные каналы, сведённые в моно, дают более предсказуемый результат, чем стереофайл, где голоса разнесены по сторонам.
Что вы получаете
Любой формат — без конвертации
Сервис сам разбирается с контейнером и достаёт из него звук.
Расскажите, с чего начался проект?
Всё началось с двух реконструкций старых домов в центре города…
А как решали вопрос с шумоизоляцией?
AI-сводка
- Проект вырос из двух реконструкций старых домов.
- Ключевое решение — собственная сборка перекрытий.
Формат определяется сам
Расширение файла не нужно указывать вручную — сервис распознаёт контейнер автоматически.
Звук из видео
Аудиодорожка извлекается из видеофайла автоматически, изображение при расшифровке не используется.
До 2 ГБ на файл
Лимит покрывает большинство записей. Более длинные нужно разбить на части — до четырёх часов каждая.
Точность не зависит от формата
На результат влияет качество записи, а не расширение. Разница между WAV и хорошим MP3 минимальна.
Разделение по спикерам
Работает одинаково для всех форматов — реплики группируются по говорящим.
Выгрузка в TXT, DOCX, PDF и SRT
Один раз расшифровали — забираете в любом формате, в том числе в нескольких сразу.
Частые вопросы
Коротко и по делу
Почему WAV распознаётся точнее, чем MP3?+
MP3 отбрасывает часть звуковой информации ради экономии места, и первыми страдают тихие звуки — концы слов, шёпот, реплики удалённого от микрофона собеседника. В WAV этих потерь нет, поэтому модели проще восстановить речь целиком.
WAV-файл слишком большой для загрузки, что делать?+
Максимальный размер файла — 2 ГБ. Пересохраните запись в MP3 с битрейтом от 128 кбит/с: качество распознавания практически не изменится, а объём сократится примерно в десять раз.
Какие частота дискретизации и разрядность подойдут?+
Достаточно 16 кГц и 16 бит — это стандарт для речи. Более высокие значения не дадут прироста точности, но увеличат размер файла.
Обрабатывается ли моно-запись хуже стерео?+
Нет. Для распознавания речи моно вполне достаточно, а для диктофонных записей оно даже предпочтительнее — файл получается вдвое легче при том же результате.
Другие форматы файлов
Все форматыЗагрузите видео напрямую — извлекать аудиодорожку вручную не нужно.
Видео с iPhone, iPad и Mac — загружайте в исходном формате QuickTime.
Формат голосовых сообщений — переслушивать длинные аудио больше не нужно.
Кодек голосовых сообщений и записей звонков — загружайте файл как есть.
Попробуйте сами
150 минут — всего за 99 ₽
Расшифруйте первый файл и посмотрите, как это работает. Подписок и скрытых списаний нет.