Как работают голосовые заметки: объяснение

Что происходит между сказанным словом и поисковой расшифровкой: запись, распознавание речи, доля ошибок и почему часть слов возвращается неверно.

Сказанная вслух заметка превращается в Reloggly в текст с поиском

Голосовая заметка выглядит как одно действие, а на деле состоит из четырёх: микрофон записывает, файл сохраняется, модель распознавания превращает звук в текст, и что-то индексирует этот текст, чтобы его можно было найти потом. Понимание того, где проходят швы, объясняет почти всё, что удивляет людей, — почему расшифровка спотыкается на именах, почему точность рушится в кафе и почему приложение, которое расшифровывает, не обязательно приложение, в котором вы потом что-то найдёте.

Шаг первый: что на самом деле записывается

Телефон замеряет давление воздуха у микрофона тысячи раз в секунду и сохраняет эти числа. Распознавание речи обычно работает со звуком, приведённым к 16 000 отсчётов в секунду в одном канале, потому что почти вся информация, различающая звуки речи, лежит ниже 8 кГц. Музыку пишут с частотой 44 100 и выше; речи это не нужно.

Отсюда и небольшой размер файлов голосовых заметок, и то, что расположение микрофона важнее его качества. Телефон в кармане записывает в основном ткань, и никакая модель дальше по цепочке не восстановит то, чего микрофон не получил.

Шаг второй: из звука в текст

Современное распознавание речи переводит звук прямо в текст с помощью нейросетевой модели, обученной на очень больших объёмах расшифрованной речи; она заменила прежнюю схему из отдельных акустической, произносительной и языковой моделей. Практическое следствие в том, что модель угадывает правдоподобное предложение, а не расшифровывает звуки по одному.

Поэтому ошибки выглядят именно так. Распознаватели редко выдают бессмыслицу — они выдают гладкие, но неверные слова: фамилия коллеги превращается в похожее по звучанию нарицательное, название продукта — в обычную фразу. На выходе всегда предложение, которое выглядит целым, и это делает ошибки менее заметными, чем были бы шум или тишина.

Как измеряют точность и чего от неё ждать

Стандартная метрика — доля ошибочных слов, word error rate: вставки, пропуски и замены, делённые на число реально произнесённых слов. WER в 5 % означает, что неверно каждое двадцатое слово: обычно это приемлемо для поиска и иногда фатально для числа или имени.

Приблизительные ожидания, которые сильно зависят от системы и условий:

  • Чёткая речь, тихая комната, распространённый акцент: единицы процентов ошибок на общей лексике.
  • Фоновый шум, несколько говорящих или расстояние до микрофона: доля ошибок резко растёт, часто в несколько раз.
  • Имена собственные, термины и фразы со смешением языков: самое слабое место с большим отрывом, потому что редкие слова плохо представлены в обучающих данных.
  • Числа, даты и написание по буквам: форматируются по соглашению, поэтому «полторы тысячи» может вернуться как 1500 или словами — в зависимости от системы.

Шаг третий: сделать расшифровку находимой

Расшифровка и поиск — разные задачи, и множество приложений решают только первую. Если текст хранится при каждой записи и ищется по точному совпадению слов, найти его можно, лишь вспомнив слово, которое вы действительно произнесли, — а именно это через несколько месяцев и забывается.

Поиск по смыслу меняет требование: заметка, где вы сказали «поставщик снова срывает сроки», находится по запросу «проблема с надёжностью подрядчика». Это и есть разница между диктофоном и архивом с поиском, и в списках функций она не видна, потому что расшифровку обещают оба.

Почему для захвата речь выигрывает у набора

Разрыв чисто механический. Речь в разговоре идёт со скоростью примерно 130–150 слов в минуту; набор на телефоне у большинства — примерно 35–40. Девяносто секунд пути до машины вмещают законченную мысль, которая не пережила бы набора одним пальцем.

Плата за это — точность. Устные заметки растекаются, начинаются заново и оставляют предмет разговора подразумеваемым: «он сказал, что это не сработает» понятно вам примерно сутки. Дешёвое лекарство — одна завершающая фраза, где названы человек, тема и причина, по которой вы вообще записываете.

Чего голосовые заметки не сделают

Они не исправят себя сами. Неверное имя в расшифровке останется неверным, пока что-то не отметит неуверенность или пока вы не заметите сами, — а гладкость текста активно отбивает желание проверять. Единственное настоящее средство — хранить исходный звук рядом с текстом: запись и есть свидетельство, а расшифровка — лишь её истолкование.

Они также не решают случай, когда контекст вы вслух не произнесли. И если язык, на котором вы говорите, слабо представлен в обучающих данных модели, ждите на нём заметно худшего результата, чем на английском, что бы ни обещал маркетинг.

Практический вывод

Относитесь к расшифровке как к поисковому указателю, а к звуку — как к первоисточнику. Проверьте любое приложение для голосовых заметок одной неудобной записью — фоновый шум, два имени, число — и попробуйте найти её через неделю словами, которых вы не произносили.

Reloggly

Сделайте свою память доступной для поиска.

Сохраняйте текст, голос и фото. Reloggly удержит контекст и поможет найти его снова.

Скачать Reloggly