Locução com IA é a produção de áudio de URA, mensagem de espera e campanha de voz com voz sintética natural em português, sem estúdio. Você manda o texto, nós ajustamos a pronúncia da sua marca, geramos o áudio no formato da sua central e conferimos de ouvido antes de instalar. Serve para empresas que usam telefonia e querem trocar áudio rápido. Sob proposta.
Em resumo
- Áudio de URA, espera, saudação de discadora e campanha, gerado a partir de texto.
- A pronúncia da marca e das siglas é escrita do jeito que se fala e conferida de ouvido.
- Uma trava bloqueia áudio com nome de pessoa ou com a marca errada.
- Os 7 primeiros segundos decidem: o "aperte 1" vem por volta dos 13 s.
Que problema a locução com IA resolve?
Trocar um áudio de telefonia costuma levar dias: agendar locutor, gravar, converter, subir. Por isso a URA da maioria das empresas fala um horário antigo, uma promoção vencida ou um nome de quem já saiu. Com voz sintética, o áudio novo sai em minutos. O difícil deixa de ser gravar e passa a ser acertar a pronúncia e o tempo, que é onde a gente trabalha.
Como funciona a produção do áudio?
- Você manda o texto, ou nós escrevemos o roteiro com você.
- Ajustamos a grafia falada: marca, sigla e termo técnico são escritos do jeito que devem soar.
- Geramos o áudio numa voz neural em português do Brasil, já no formato de telefonia (8 kHz, mono).
- Medimos a duração e transcrevemos automaticamente o que saiu, para conferir o texto.
- Alguém ouve o áudio inteiro. A aprovação final é do ouvido, não da transcrição.
- Instalamos em todos os lugares onde ele toca e guardamos a versão anterior com data.
Onde a locução com IA entra
- Menu de URA de atendimento e mensagem fora do expediente.
- Áudio de espera e mensagens entre as músicas.
- Saudação neutra de discadora, enquanto o ramal do vendedor toca.
- Pitch de URA reversa e torpedo de voz.
- Áudio institucional curto para enviar no WhatsApp.
O que aprendemos rodando isso
Na nossa operação, um áudio de 17 s perdeu o ouvinte aos 7 s, e um de 29,6 s foi ouvido por 29 s em média. Só cerca de 24 a 26% chegam ao fim do áudio. Por isso escrevemos o roteiro para pedir o "aperte 1" por volta dos 13 s e de novo no fim, e miramos em até 19 s quando a ligação tem corte de 30 s.
Duas lições custaram caro. A primeira: uma voz sintética passou na transcrição automática sem erro nenhum e, ouvida, soava estrangeira. Transcrição limpa não prova que o áudio soa natural. Trocamos de voz e a aprovação passou a ser de ouvido. A segunda vai no sentido contrário: o mesmo arquivo, com a mesma marca, foi transcrito certo numa frase curta e errado numa longa. Transcrição também não prova que a pronúncia está errada.
Por isso a checagem virou trava em código, em dois pontos. Na geração, o texto é recusado se tiver nome de pessoa ou marca que não é a sua, antes de gastar síntese. No ar, todo dia de manhã, os áudios instalados são transcritos e conferidos de novo, porque o texto guardado pode estar certo e o arquivo que toca ser outro.
Áudio de espera costuma ser uma cópia em outra pasta. Trocar o arquivo principal e esquecer a cópia deixa o cliente ouvindo o áudio antigo, sem erro e sem aviso. Depois de trocar, ligue e ouça.
Para quem serve?
- Empresas com URA de atendimento ou 0800 que querem mudar áudio sem estúdio.
- Operações de campanha de voz que testam roteiros com frequência.
- Equipes de venda com discadora que precisam de saudação neutra.
Antes de gravar o pitch, vale ler como escrever um roteiro de URA reversa e o que medimos em teste A/B de pitch: três roteiros bem diferentes levaram os mesmos 20–25% até o "aperte 1".
Como contratar
A locução avulsa é sob proposta, conforme o número de áudios e onde eles serão instalados. Quem usa a URA reversa self-service já pode subir áudio próprio ou gerar voz sintética na própria campanha, pagando só R$ 0,16 por ligação atendida, sem mensalidade. Para PABX e 0800, a instalação pode ser feita junto com a NuvoFone.
Mande o texto que quer ouvir e devolvemos o áudio pronto para a sua central.
Perguntas frequentes
A voz sintética parece robô?
As vozes neurais atuais soam naturais em português, mas nem todas. Por isso a aprovação é feita de ouvido, não por transcrição.
E se a IA pronunciar errado o nome da minha marca?
Escrevemos a marca do jeito que se fala e ouvimos o resultado. Se ainda soar errado, ajustamos a grafia até acertar.
Posso usar o nome de um atendente no áudio?
Nossa regra é a marca falar em primeira pessoa, sem nome de pessoa. A trava recusa o texto com nome próprio.
Qual a duração ideal?
Para campanha, até 19 s quando a ligação tem corte de 30 s, com o pedido de ação por volta dos 13 s.
Esta solução faz parte do catálogo de soluções da NuvoMarketing.
