Jak działają notatki głosowe: proste wyjaśnienie

Co dzieje się między mową a przeszukiwalną transkrypcją: nagranie, rozpoznawanie mowy, wskaźnik błędów i dlaczego część słów wraca błędnie.

Wypowiedziana notatka zamieniona w przeszukiwalny tekst w Reloggly

Notatka głosowa wygląda na jedną czynność, a w rzeczywistości składa się z czterech: mikrofon nagrywa, plik zostaje zapisany, model rozpoznawania mowy zamienia dźwięk w tekst, a coś indeksuje ten tekst, żeby dało się go później znaleźć. Wiedza o tym, gdzie biegną szwy, tłumaczy większość rzeczy, które ludzi zaskakują — dlaczego transkrypcje przekręcają nazwiska, dlaczego dokładność załamuje się w kawiarni i dlaczego aplikacja, która transkrybuje, nie musi być aplikacją, w której cokolwiek potem znajdziesz.

Krok pierwszy: co naprawdę rejestruje nagranie

Telefon mierzy ciśnienie powietrza przy mikrofonie tysiące razy na sekundę i zapisuje te liczby. Rozpoznawanie mowy pracuje zwykle na dźwięku sprowadzonym do 16 000 próbek na sekundę w jednym kanale, ponieważ niemal cała informacja odróżniająca głoski mieści się poniżej 8 kHz. Muzykę nagrywa się z częstotliwością 44 100 i wyższą; mowa tego nie potrzebuje.

Dlatego pliki notatek głosowych są małe i dlatego ustawienie mikrofonu znaczy więcej niż jego jakość. Telefon w kieszeni nagrywa głównie tkaninę, a żaden dalszy model nie odtworzy tego, czego mikrofon nigdy nie odebrał.

Krok drugi: z dźwięku na tekst

Współczesne rozpoznawanie mowy odwzorowuje dźwięk wprost na tekst za pomocą modelu neuronowego wytrenowanego na ogromnych ilościach transkrybowanej mowy; zastąpiło ono dawny łańcuch osobnych modeli akustycznego, wymowy i języka. Praktyczny wniosek jest taki, że model zgaduje prawdopodobne zdanie, a nie dekoduje głosek jedna po drugiej.

Stąd taki, a nie inny wygląd błędów. Systemy rzadko produkują bełkot; produkują płynne, ale nietrafione słowa — nazwisko współpracownika zamienia się w podobnie brzmiący rzeczownik pospolity, nazwa produktu w zwykłe wyrażenie. Na wyjściu zawsze jest zdanie wyglądające na kompletne, przez co pomyłki trudniej zauważyć niż szum czy ciszę.

Jak mierzy się dokładność i czego oczekiwać

Standardową miarą jest wskaźnik błędów słów: wstawienia, pominięcia i podmiany podzielone przez liczbę faktycznie wypowiedzianych słów. Wskaźnik 5 % oznacza, że błędne jest co dwudzieste słowo — zwykle do przyjęcia przy wyszukiwaniu, czasem zabójcze przy liczbie albo nazwisku.

Ogólne oczekiwania, mocno zależne od systemu i warunków:

  • Wyraźna mowa, cichy pokój, powszechny akcent: kilkuprocentowy poziom błędów na słownictwie ogólnym.
  • Hałas w tle, kilku mówiących albo odległość od mikrofonu: poziom błędów rośnie gwałtownie, często kilkukrotnie.
  • Nazwy własne, terminy techniczne i zdania mieszające języki: zdecydowanie najsłabszy punkt, bo rzadkie słowa są słabo reprezentowane w danych treningowych.
  • Liczby, daty i literowanie: formatowane umownie, więc „tysiąc pięćset” może wrócić jako 1500 albo słowami, zależnie od systemu.

Krok trzeci: sprawić, by transkrypcja dała się znaleźć

Transkrypcja i odnajdywanie to osobne problemy, a wiele aplikacji rozwiązuje tylko pierwszy. Jeśli tekst leży przy pojedynczym nagraniu i przeszukuje się go po dokładnym słowie, znajdziesz go wyłącznie pamiętając słowo, które naprawdę padło — a po miesiącach to właśnie ono ulatuje.

Wyszukiwanie po znaczeniu zmienia wymaganie: notatka, w której powiedziałeś „dostawca ciągle przesuwa terminy”, jest osiągalna z zapytania „problem z rzetelnością kontrahenta”. To różnica między dyktafonem a przeszukiwalnym archiwum i nie widać jej na liście funkcji, bo transkrypcję obiecują obie strony.

Dlaczego przy zapisie mówienie wygrywa z pisaniem

Różnica jest czysto mechaniczna. Mowa w rozmowie biegnie z prędkością mniej więcej 130-150 słów na minutę; pisanie na telefonie u większości ludzi około 35-40. Dziewięćdziesiąt sekund drogi do samochodu mieści skończoną myśl, która nie przetrwałaby wystukiwania jednym kciukiem.

Ceną jest precyzja. Notatki mówione dryfują, zaczynają się od nowa i zostawiają temat domyślny: „powiedział, że to nie zadziała” jest dla ciebie zrozumiałe mniej więcej przez dobę. Tania naprawa to jedno zdanie na koniec, w którym padnie osoba, temat i powód, dla którego w ogóle nagrywasz.

Czego notatki głosowe nie zrobią

Nie poprawią się same. Źle rozpoznane nazwisko zostanie błędne, dopóki coś nie oznaczy niepewności albo sam tego nie wychwycisz — a płynność tekstu skutecznie zniechęca do sprawdzania. Jedynym prawdziwym środkiem zaradczym jest trzymanie oryginalnego dźwięku obok tekstu: nagranie jest zapisem, a transkrypcja tylko jego interpretacją.

Nie rozwiążą też przypadku, w którym kontekstu nigdy nie wypowiedziałeś na głos. A jeśli język, którym mówisz, jest słabo reprezentowany w danych treningowych modelu, spodziewaj się w nim wyraźnie gorszych wyników niż po angielsku, cokolwiek twierdzi marketing.

Praktyczny wniosek

Traktuj transkrypcję jak indeks do wyszukiwania, a dźwięk jak źródło prawdy. Przetestuj dowolną aplikację do notatek głosowych jednym trudnym nagraniem — hałas w tle, dwa nazwiska, liczba — i poszukaj go tydzień później słowami, których nie wypowiedziałeś.

Reloggly

Spraw, by Twoja pamięć była przeszukiwalna.

Zapisuj tekst, głos i zdjęcia. Reloggly zachowa kontekst i pomoże odnaleźć informacje.

Pobierz Reloggly