Como funcionam as notas de voz: explicação

O que acontece entre falar e uma transcrição pesquisável: gravação, reconhecimento de fala, taxa de erro e por que algumas palavras voltam erradas.

Uma nota falada virando texto pesquisável no Reloggly

Uma nota de voz parece uma única ação e na verdade são quatro: o microfone grava, o arquivo é armazenado, um modelo de reconhecimento de fala converte o áudio em texto e algo indexa esse texto para que ele possa ser encontrado depois. Saber onde ficam as costuras explica quase tudo o que surpreende as pessoas: por que as transcrições erram nomes, por que a precisão desaba num café e por que um aplicativo que transcreve não é necessariamente um aplicativo em que você encontra alguma coisa depois.

Passo um: o que a gravação realmente captura

O celular mede a pressão do ar no microfone milhares de vezes por segundo e guarda esses números. O reconhecimento de fala costuma trabalhar com áudio reduzido a 16.000 amostras por segundo em um único canal, porque quase toda a informação que distingue os sons da fala está abaixo de 8 kHz. Música se grava a 44.100 e acima; a fala não precisa disso.

É por isso que os arquivos de notas de voz são pequenos e por isso a posição do microfone pesa mais do que a qualidade dele. Um celular no bolso grava principalmente tecido, e nenhum modelo mais adiante recupera o que o microfone nunca recebeu.

Passo dois: do áudio ao texto

O reconhecimento de fala moderno mapeia o áudio direto para texto com um modelo neural treinado em quantidades muito grandes de fala transcrita, substituindo a antiga cadeia de modelos acústico, de pronúncia e de linguagem separados. A consequência prática é que o modelo adivinha uma frase plausível, em vez de decodificar os sons um a um.

É por isso que os erros têm essa cara. Os reconhecedores raramente produzem algo sem sentido; produzem palavras fluentes e erradas — o sobrenome de um colega vira um substantivo comum de som parecido, o nome de um produto vira uma expressão qualquer. A saída é sempre uma frase que parece completa, o que torna os erros mais difíceis de perceber do que seriam um chiado ou um silêncio.

Como a precisão é medida e o que esperar

A métrica padrão é a taxa de erro por palavra: inserções, omissões e substituições divididas pelo número de palavras realmente ditas. Uma taxa de 5 % significa que uma palavra em cada vinte está errada: em geral aceitável para busca, às vezes fatal para um número ou um nome.

Expectativas amplas, que variam muito conforme o sistema e as condições:

  • Fala clara, sala silenciosa, sotaque comum: taxas de erro de poucos por cento no vocabulário geral.
  • Ruído de fundo, várias pessoas falando ou distância do microfone: a taxa de erro sobe com força, muitas vezes vários múltiplos.
  • Nomes próprios, termos técnicos e frases que misturam idiomas: de longe o ponto mais fraco, porque palavras raras aparecem pouco nos dados de treinamento.
  • Números, datas e soletrações: são formatados por convenção, então «mil e quinhentos» pode voltar como 1500 ou por extenso, dependendo do sistema.

Passo três: tornar uma transcrição localizável

Transcrever e recuperar são problemas separados, e muitos aplicativos resolvem só o primeiro. Se a transcrição fica presa a cada gravação e é buscada por palavra exata, você só a encontra lembrando de uma palavra que realmente disse — que é justamente o que, meses depois, você esqueceu.

A busca por significado muda a exigência: um recado em que você disse «o fornecedor vive estourando os prazos» é alcançável a partir de «problema de confiabilidade do parceiro». Essa é a diferença entre um gravador e um arquivo com busca, e ela é invisível em listas de recursos, porque ambos prometem transcrição.

Por que falar vence digitar na hora de capturar

A diferença é mecânica. A fala em conversa corre a cerca de 130 a 150 palavras por minuto; digitar no celular fica em torno de 35 a 40 para a maioria das pessoas. Noventa segundos de caminhada até o carro seguram um pensamento inteiro que não sobreviveria a ser digitado com um polegar.

O preço é a precisão. Notas faladas divagam, recomeçam e deixam o assunto implícito: «ele disse que não ia funcionar» fica claro para você por cerca de um dia. O conserto barato é uma única frase final que nomeie a pessoa, o tema e o motivo de você estar gravando.

O que as notas de voz não vão fazer

Elas não se corrigem sozinhas. Um nome errado numa transcrição continua errado até que algo sinalize a incerteza ou você perceba — e a fluência do texto desestimula ativamente a conferência. Manter o áudio original ao lado do texto é o único remédio de verdade: a gravação é o registro, e a transcrição é uma interpretação dela.

Elas também não resolvem o caso em que você nunca falou o contexto em voz alta. E se um idioma que você fala aparece pouco nos dados de treinamento de um modelo, espere resultados bem piores nesse idioma do que em inglês, diga o que disser o marketing.

Conclusão prática

Trate a transcrição como um índice de busca e o áudio como fonte da verdade. Teste qualquer aplicativo de notas de voz com uma gravação difícil — ruído de fundo, dois nomes, um número — e procure por ela uma semana depois usando palavras que você não disse.

Reloggly

Torne sua memória pesquisável.

Capture texto, voz e fotos. O Reloggly preserva o contexto e ajuda você a encontrá-lo novamente.

Baixar o Reloggly