Я замерил точность на двух полюсах: аудиокнига и двухчасовой подкаст. Разница — 92,6% против 74%. Числа, имена и латиница ломаются предсказуемо, а самое опасное — гладкий текст, в котором модель дописала факт, которого в записи не было.
Есть один разговор, который я хотел бы показать целиком, но придётся пересказать.
Двое ведущих киношного подкаста обсуждают кассовые сборы. Один говорит: в первый уик-энд собрал 260 миллионов, во второй 213, суммарно уже 630, и добавляет непечатное слово, потому что доволен. Речь про Россию и, естественно, про рубли. Валюту в разговоре не называют ни разу: зачем, если оба и так понимают, о чём речь.
Я прогнал эту запись через расшифровку и попросил краткую сводку. Сводка получилась аккуратная, деловая, с фактами. Один из пунктов звучал так:
«Богемская рапсодия» собрала в России 630 млн долларов.
Страна угадана. Число угадано. Валюта — придумана. Ошибка примерно в шестьдесят раз, поданная тем же ровным тоном, что и остальные четыре пункта, которые были абсолютно верны. Именно поэтому я её чуть не пропустил.
Дальше — о том, где именно ломаются эти инструменты и почему заметить это сложнее, чем кажется.
Откуда берутся 99%
Загляните на сайт любого сервиса расшифровки: там будет процент. 95%, 98%, «до 99%». Формально никто не врёт. Вопрос в том, на чём эти проценты измерены.
Считают их на специальных наборах записей с эталонной расшифровкой. Крупнейший русский открытый корпус — сберовский Golos, 1240 часов ручной разметки. Есть Common Voice от Mozilla, есть ещё несколько. Что внутри? В Golos люди читают вслух подсказки с экрана и разговаривают с умной колонкой. В Common Voice читают вслух отдельные предложения. Ключевое слово везде одно: читают.
Ваш файл — это не читают. Это двое перебивают друг друга, третий отходит от микрофона, кто-то смеётся посреди слова, и все говорят «ну», «типа» и «вот это самое» примерно каждые семь секунд.
Мне стало интересно, насколько велика разница. Я взял две записи с противоположных полюсов и померил.
Полюс чистоты — аудиокнига. Точнее, пьеса: Чехов, «Предложение» в озвучке волонтёров. Тридцать одна минута, четыре голоса. Эталон идеальный: это текст Чехова, он лежит в открытом доступе, и отличаться от записи он не может по определению.
Полюс реальности — тот самый подкаст. Два часа, двое ведущих, живой трёп про кино. Повезло, что авторы выкладывают человеческие расшифровки выпусков: с именами говорящих, с матом, со словами-паразитами, почти дословно. Дальше была скучная часть: выравнивание текстов по словам и подсчёт совпадений.
Что получилось
На Чехове — 92,6% слов дословно. Близко к тому, что обещают на сайтах.
На живом разговоре — 74%.
Одна и та же система, один и тот же движок, один и тот же день. Разница только в том, что в первом случае люди читают по очереди с листа, а во втором разговаривают.
Считал я жёстко: слово засчитывается, только если оно совпало дословно и встало по порядку, без скидок на «ну» и «типа». Восемнадцать пунктов звучат несерьёзно, пока не переведёшь в штуки: на двухчасовой записи это четыре тысячи слов, которые в эталоне есть, а в расшифровке их не нашлось. Примерно две страницы.
Ломается не «в среднем», а в конкретных местах
Средний процент — плохой способ думать об ошибках: они распределены не равномерно. Я посчитал отдельно по типам того, что в тексте вообще имеет ценность.
Числа держатся лучше всех — 90%. Логично: цифра звучит отчётливо, спутать «двести» с «тремястами» трудно.
Но именно с числами вышел главный конфуз. Я гонял записи в двух режимах — быстром и подороже, — и быстрый расшифровал то самое «630 лямов» как 630000000000. Шестьсот тридцать миллиардов. Разговорное «лям» она приняла за множитель и щедро отсыпала три лишних порядка. В тексте это выглядит абсолютно нормально: просто число, просто длинное.
Имена — 75%. Каждое четвёртое имя собственное в живом разговоре не доезжает. И вот тут начинается цирк, ради которого стоило всё затевать:
- «Тимур Бекмамбетов» превратился в «Тимуры бить Магетова»
- «Кэмерон Диаз» — в «Каберон Диас»
- «Эдди Мёрфи» — в «эти Мерфи»
- «Приключения Паддингтона» — в «приключения Падтингтона»
Отдельно нежно люблю тот факт, что фамилия одного из двух ведущих не была распознана правильно ни разу за два часа. Человек говорит половину эфира, его имя звучит регулярно, и всё равно мимо.
При этом имена, прозвучавшие два раза и больше, выживают в 86% случаев против 75% у всех подряд. То есть чем реже прозвучало имя, тем вероятнее оно пропадёт. Запомните это, когда будете расшифровывать интервью, где фамилию подрядчика назвали ровно один раз.
Латиница — 20%. Вот это провал. Из двух сотен упомянутых брендов, названий и ников на латинице уцелела пятая часть. Deadpool распался на «Dead» и «Pool». Появились загадочные «delforball», «Televity» и «Grouptor». Я так и не понял, чем они были при жизни.
На Чехове, для сравнения, все проверенные имена — Чубуков, Ломов, Наталья Степановна, Воловьи Лужки, собаки Угадай и Откатай — уцелели до единого. Потому что читают по бумажке, чётко, в микрофон.
Ещё про «кто говорит». В подкасте два человека, а быстрый режим нашёл трёх: двух настоящих и призрака, которому досталось два обрывка. В пьесе четыре голоса, а быстрый нашёл шесть. Режим помедленнее в обоих случаях посчитал верно. Это, кстати, отдельная задача — разделение по спикерам ломается ровно там же, где и всё остальное: на плохом звуке и на перебиваниях.
Неожиданная хорошая новость
Всё это выглядит как приговор. А теперь смотрите.
Я попросил краткую сводку по тому самому двухчасовому выпуску, где потерялись четыре тысячи слов, развалились имена и умерла латиница. Сводка перечислила темы. Все темы были названы верно. Ни одной выдуманной.
То же на Чехове: пересказ сюжета корректный, вплоть до спора про Воловьи Лужки и собак.
Это оказалось для меня главным открытием. Ошибки уровня слов почти не доходят до уровня смысла. Модель, которая пишет сводку, видит текст целиком, и одна покорёженная фамилия тонет в контексте: вокруг неё сотня слов, распознанных верно, и по ним всё понятно.
То есть на вопрос «о чём вообще был этот разговор» расшифровка отвечает надёжно даже когда выглядит плохо. Так что сводка по расшифровке — это не украшение, а самый устойчивый её слой.
И ровно поэтому — плохая
Держится тема. Не держится отдельный факт.
Чтобы правильно назвать тему, модели нужно, чтобы вокруг было много верных слов, и они есть. Чтобы правильно назвать сумму, ей нужно одно конкретное слово в одном конкретном месте, а оно как раз и ломается чаще всего. Устойчивость целого и хрупкость детали здесь не противоречат друг другу, а вытекают одно из другого.
Та же сводка, которая безупречно назвала все темы выпуска, сообщила мне про 630 миллионов долларов.
Смотрите, что произошло. Число распозналось верно. Тема — верно. Страна — верно. А потом модель, собирая гладкий пункт списка, дописала недостающее. В разговоре валюты не было, потому что двум людям она была очевидна. Модели не была, и она подставила ту, которая чаще встречается рядом со словами «фильм» и «сборы».
Это не сбой распознавания. Это то, как работает пересказ: он обязан быть связным, а связность требует деталей, и если детали нет, она появляется.
И вот в чём подстава. Ошибку распознавания вы увидите: «Тимуры бить Магетова» невозможно не заметить, глаз спотыкается. А «собрала в России 630 млн долларов» выглядит как нормальный факт из нормального отчёта. Ровная формулировка, круглое число, всё на месте.
Проверять надо не там, где текст кривой. Проверять надо там, где он гладкий.
Я попробовал это починить
Первая мысль была простая: инструкция для сводки кривая, поправлю. Она и правда была кривая: просила выдавать «решения, цифры, договорённости» и ни словом не запрещала достраивать недостающее. Я переписал её так, чтобы модель не додумывала единицы, валюты и даты, а неразборчивое просто выбрасывала, и прогнал один и тот же кусок расшифровки через обе версии несколько раз подряд.
Старая версия написала: «Первый уикенд — 260 млн рублей. Суммарные сборы — 630 млн рублей».
Рубли. Правильно. Та же модель, тот же кусок текста, а в прогоне, с которого началась эта статья, были доллары.
Понимаете, да? Она не читает валюту, её в тексте нет. Она её выводит. Иногда верно, иногда нет, и по виду пункта эти два случая не различить. Проблема, как выяснилось, не в том, что модель ошибается, а в том, что вы не отличите её догадку от прочитанного факта.
Новая версия на том же куске написала: «Первый уикенд собрал 260 миллионов, второй — 213. Суммарные сборы уже 630 миллионов». Без единицы. Так, как было сказано.
До конца это не лечится: пересказ по своей природе достраивает, иначе он не пересказ. Инструкциями догадку не убить, можно только сделать её молчаливее. Но разница между «модель молчит, когда не знает» и «модель уверенно дописывает» — это разница между текстом, который можно проверить, и текстом, который надо перепроверять целиком.
Что с этим делать в понедельник
Не выбрасывать инструмент: сэкономленные часы никуда не делись. Просто перестать относиться к расшифровке как к протоколу.
Доверяйте смысл. О чём говорили, какие темы поднимали, к чему пришли, где в записи искать нужный момент: здесь всё работает даже на плохом звуке. Таймкоды — вообще самая недооценённая часть выдачи: расшифровка с таймкодами позволяет не верить тексту на слово, а за десять секунд проверить спорное место по исходнику.
Не доверяйте факты. Числа, суммы, валюты, даты, фамилии, названия компаний ломаются чаще всего и заметны хуже всего. Их вычитывают руками, по таймкоду, слушая исходник.
Считайте, сколько раз прозвучало. Фамилия, названная один раз, — кандидат на потерю. Если она важна, переспросите её на записи вслух ещё раз: вы делаете это не для собеседника, а для машины.
Пишите ближе к людям. Разница между 92% и 74% — это в основном разница между «читают в микрофон» и «говорят через стол». Отдельная дорожка на каждого, гарнитура, запись из самого созвона вместо диктофона у ноутбука дают больше, чем выбор сервиса.
И последнее. Не верьте процентам на сайтах сервисов расшифровки, в том числе на этом. Здесь написано «95–99% на записях хорошего качества». Это правда, и заметьте, сколько работы делает вторая половина фразы. На пьесе Чехова, зачитанной в микрофон, у меня вышло 92,6%. На двухчасовом разговоре двух живых людей — 74%. Оба числа честные, просто из разных миров. Ваш файл, скорее всего, живёт во втором.
Оба замера я гонял через Polotno — это мой сервис, поэтому оговорка обязательна. Распознавание на этой полке у всех работает примерно одинаково: всё, что выше, — про технологию, а не про вывеску. На другой сервис эти числа переносятся почти без изменений, и выбирать по ним между нами и соседями смысла нет. Разница между сервисами не в этих процентах, а в том, что вы получаете вокруг текста.
Источники, если захотите повторить
Замер воспроизводим: обе записи открытые, методика — выравнивание по словам и подсчёт дословных совпадений. Читка: Чехов, «Предложение», волонтёрская озвучка LibriVox, 31 минута; эталон — текст пьесы на Викитеке. Живой разговор: выпуск подкаста «Лазер-шоу „Три дебила“», запись и авторская расшифровка. Корпуса, о которых речь в начале: Golos, Common Voice. Важная оговорка, которая в подсчёт не попала: доля ошибок у обоих режимов завышена, потому что считалась к отредактированному эталону, а не к сырому тексту. Поэтому выше везде «машина узнала», а не «точность сервиса составляет».
Частые вопросы
Почему на сайте написано 99% точности, а на моей записи вышло хуже?
Потому что проценты считают на специальных наборах записей с эталонной расшифровкой. В них люди читают вслух подготовленный текст или говорят с умной колонкой — то есть дикция чистая, а речь литературная. На такой записи результат честно доходит до 95–99%. Живой разговор двух человек, где перебивают, отходят от микрофона и говорят словами-паразитами, даёт заметно меньше: в замере на двухчасовом подкасте вышло 74% дословных совпадений против 92,6% на чтении вслух. Формулировка «95–99% на записях хорошего качества» верна целиком, включая вторую половину.
Что нейросеть расшифровывает хуже всего?
В замере хуже всего держалась латиница — уцелела примерно пятая часть названий и ников, написанных латинскими буквами. Имена собственные — около 75%, причём имя, прозвучавшее один раз, теряется заметно чаще, чем то, что повторялось. Числа распознаются лучше остального (около 90%), но именно с ними опаснее всего: разговорное «лям» один из режимов превратил в 630000000000, а единица измерения может появиться там, где в записи её не называли.
Можно ли доверять автоматической сводке по расшифровке?
Темы — да, отдельные факты — нет. В замере сводка верно назвала все темы двухчасового выпуска, хотя в тексте потерялось около четырёх тысяч слов. Но она же сообщила, что фильм собрал в России 630 млн долларов, тогда как в разговоре говорили про рубли: валюту в записи не называли, и модель её дописала. Правило простое: смысл и темы читайте по сводке, числа, суммы, даты и фамилии сверяйте с исходником.
Почему ошибку в сумме или валюте так легко пропустить?
Потому что кривой текст видно, а гладкий — нет. «Тимуры бить Магетова» глаз спотыкается сразу, а «собрала в России 630 млн долларов» выглядит как аккуратный факт из отчёта: ровная формулировка, круглое число, всё на месте. Ошибка распознавания оставляет след в виде странного слова, а ошибка, дописанная при пересказе, следа не оставляет вовсе. Проверять надо не там, где текст выглядит плохо, а там, где он выглядит гладко.
От чего зависит точность на моей записи?
Больше всего — от качества записи, а не от выбора сервиса. Разница между 92,6% и 74% в замере объясняется в основном тем, что в одном случае читали в микрофон по бумажке, а в другом разговаривали через стол. Практически это значит: отдельная дорожка на каждого участника, гарнитура или петличка, запись из самого созвона вместо диктофона у ноутбука. Всё это даёт больше, чем смена сервиса, потому что распознавание у большинства сервисов работает примерно одинаково.
Как проверить точность расшифровки на своей записи?
Возьмите фрагмент на 2–3 минуты, где говорят обычным образом, и вычитайте его вручную. Считайте не все слова, а то, что имеет ценность: имена, числа, суммы, названия. Практическое правило из замера — проверяйте в первую очередь неразборчивые места и всё, что звучит гладко и уверенно: числа без единицы измерения, круглые суммы, незнакомые названия. По таймкодам это делается быстро: открываете спорный фрагмент и слушаете исходник.
Проверьте на своей записи
150 минут за 99 ₽ на пробный период.
Через 7 дней — Базовый за 598 ₽/мес, отмена в личном кабинете.