
Corrigir a transcrição de números: um guia sistemático (2026)
Summarize this article with:
Os erros de números na transcrição por IA se encaixam em um pequeno conjunto de padrões repetíveis: formas faladas confundíveis ("quinze" vs "cinquenta"), inconsistência de formato (dígitos vs palavras) e atribuição errada de unidade. A correção é em camadas: primeiro ative a formatação inteligente na sua ferramenta, depois aplique localizar e substituir para erros específicos do domínio e, por fim, faça uma revisão manual direcionada apenas para os números que envolvem riscos reais. O pós-processamento com LLM cuida das inconsistências de formato restantes que a formatação inteligente não pega.
Erros de números na transcrição podem ser corrigidos, mas a solução depende de qual das três causas raiz você está enfrentando. O modelo ouviu o número errado (um erro de escuta). O modelo ouviu certo, mas renderizou errado (um erro de formatação). Ou a formatação está inconsistente ao longo da transcrição (um erro de estilo). Cada um tem uma solução diferente, e confundi-los desperdiça tempo.
Este guia percorre cada causa e sua correção, na ordem do que tentar primeiro.
Por que os números falham de forma diferente das outras palavras
Números são a categoria em que a transcrição por IA comete seus erros mais custosos. Os erros são específicos e repetíveis.
"Quinze" vs. "cinquenta" é a confusão entre números mais comum de todas. O mesmo padrão se repete entre os números de onze a dezenove e as dezenas redondas: treze/trinta, quatorze/quarenta, dezesseis/sessenta, dezessete/setenta. Na fala rápida ou com qualquer sotaque, esses pares compartilham características acústicas suficientes para que o modelo escolha entre eles com base no contexto, não apenas no som. Se a frase ao redor não favorecer claramente um número, o modelo chuta e às vezes chuta errado.
Sequências de números criam um segundo modo de falha. "Dois cinco sete nove" dito como número de referência vira "2.579" como quantidade. "Cento e cinquenta e dois" pode virar "152" ou "cento e, 52". O modelo tenta agrupar dígitos em um número com significado, e nem sempre sabe se você quer um fragmento de telefone, uma quantidade ou um identificador.
A atribuição de unidade falha de uma terceira maneira específica. "Cinco dólares e cinquenta" pode virar "$5,50", "cinco-cinquenta" ou "5 dólares, 50 centavos", dependendo da ferramenta e de a formatação inteligente estar ativada. O número recebe os dígitos certos, mas o formato sai errado, ou a vírgula decimal se desloca.
A interpretação de datas e decimais forma o último grande grupo. "Quinze de maio de dois mil e vinte e seis" pode virar "15 de maio de 2026", "15/05/26" ou "15 de maio", dependendo do formato padrão do modelo. "Vírgula cinco" pode virar ",5", "0,5" ou "cinco décimos".
Correção 1: Ativar a formatação inteligente
A maioria dos erros de renderização de números desaparece quando você ativa a formatação inteligente. Esta é a primeira correção a tentar e, para muitos usuários, resolve 80% do problema.
Veja o que cada ferramenta principal realmente oferece, conforme a documentação atual dos fornecedores (verificada em julho de 2026):
| Ferramenta | Parâmetro | Padrão | O que trata |
|---|---|---|---|
| Deepgram | smart_format=true | Desativado | Numerais, moeda, datas, horários, números de telefone, e-mails (inglês; alguns outros idiomas) |
| AWS Transcribe | Automático (nenhum parâmetro necessário) | Ativado para idiomas compatíveis | Números, moeda, datas, horários, endereços |
| AssemblyAI | format_text=true | Ativado | Formatação de texto, incluindo renderização de números |
| OpenAI Whisper API | Sem parâmetro dedicado | Misto | Sem formatador de números integrado; use prompt ou pós-processamento |
O smart_format=true da Deepgram é o mais explícito: passar o parâmetro em uma requisição em lote ou em streaming converte números falados em suas formas de dígitos para inglês, incluindo símbolos de moeda, horários AM/PM e datas ordinais. O AWS Transcribe aplica isso automaticamente para idiomas compatíveis, sem necessidade de configuração. O format_text da AssemblyAI vem ativado por padrão, então, se você está recebendo saída bruta da AssemblyAI, verifique se ele não foi desativado.
O OpenAI Whisper é a exceção. Não existe parâmetro smart_format. Sua saída, por padrão, mistura dígitos e palavras escritas por extenso dependendo do contexto, e a documentação recomenda usar o parâmetro prompt para orientar o estilo ou recorrer ao pós-processamento para corrigir a consistência. Se você precisa de renderização consistente de números no Whisper, trate isso à parte.

Uma nuance que vale a pena saber: a formatação inteligente resolve a renderização, não os erros de escuta. Se o modelo ouviu "quinze" quando o orador disse "cinquenta", o smart_format=true vai renderizar o número errado, limpinho, como "15". O erro de escuta continua lá.
Correção 2: Localizar e substituir para erros específicos do domínio
Se você transcreve regularmente conteúdo do mesmo domínio, verá os mesmos erros de números se repetirem. Um podcast financeiro em que o apresentador sempre diz "cinquenta pontos-base" produzirá o mesmo erro de "15 pontos-base" em todos os episódios. Monte uma lista de substituições.
Padrões comuns que valem a pena entrar na lista:
fifteen basis points → 50 basis points [verify against audio first]
thirteen percent → 13%
two zero two five → 2025
seventy-five thousand → 75,000
A limitação é real: o localizar e substituir não distingue contexto. "Vinte" é a renderização certa para "vinte pessoas", e "20" costuma ser o certo para "20 dólares" em um contexto financeiro. Uma substituição indiscriminada de todas as ocorrências de "vinte" por "20" vai quebrar casos válidos. Use esta correção para erros tão específicos de um termo do domínio que substituições falsas positivas sejam improváveis.
Correção 3: Pós-processamento com LLM para consistência de formato
Para inconsistência de formato ao longo de uma transcrição longa (datas em três formatos diferentes, alguns números como palavras e outros como dígitos sem lógica consistente), uma passada de pós-processamento com LLM limpa tudo sem exigir que você verifique o áudio.
Um prompt que funciona:
Read this transcript and fix number formatting for consistency.
Convert quantities to digits ($50, 25%, 1,500, 8:30 AM).
Write out numbers that start a sentence.
Fix obvious impossible numbers if context makes the correction clear.
Do not change any number you are uncertain about.
Transcript:
[paste here]
GPT-4o e Claude fazem isso de forma confiável para tarefas de formatação. A limitação importante: o LLM vê apenas texto. Se a transcrição tem um erro de escuta, o LLM vai corrigir a formatação em torno do número errado, não vai consertar o erro de escuta. Use isto para estilo, não para checagem de fatos.
Correção 4: Verificação manual direcionada para conteúdo crítico
Para conteúdo em que um número errado tem consequências reais, uma passada direcionada de escuta e verificação é a única correção confiável.
O fluxo de trabalho:
- Rode a transcrição com a formatação inteligente ativada.
- Procure todos os números na transcrição: varra em busca de dígitos, símbolos de moeda, porcentagens e datas.
- Para cada número que importa, vá até o timestamp correspondente no áudio e verifique.
- Corrija os que estiverem errados.
Para uma reunião de 30 minutos com 10 a 15 menções numéricas, isso leva de 5 a 10 minutos. É a única abordagem que captura erros de escuta que a formatação inteligente não consegue corrigir.
Para o conteúdo mais crítico, como contratos jurídicos, dosagens médicas ou dados financeiros publicados, vale a pena ter uma segunda pessoa fazendo a mesma verificação de forma independente.
Categorias de números e seus modos de falha específicos
Categorias diferentes falham de maneiras diferentes. Saber com qual categoria você está lidando aponta para a correção certa.
Dinheiro e moeda
Erros comuns: magnitude errada (15 vs 50), falta do símbolo da moeda, deslocamento de vírgula ("cinco e cinquenta" interpretado como 5,50 em vez de 550).
Correção: formatação inteligente primeiro. Para qualquer conteúdo financeiro cujos valores serão citados ou publicados, verificação manual.
Porcentagens
Erros comuns: ordem de grandeza errada (3% vs 30%, o que inverte o significado de uma tendência). Um aumento de 30% renderizado como 3% não é uma imprecisão pequena.
Correção: formatação inteligente. Varra manualmente qualquer porcentagem que descreva uma mudança ou uma taxa, já que são elas que trazem o maior risco de alteração de sentido.
Datas
Erros comuns: ano errado (2025 vs 2026), formato inconsistente dentro da mesma transcrição (15 de maio em um parágrafo, 15/05 em outro), ordinal vs cardinal ("15º de maio" vs "15 de maio").
Correção: a formatação inteligente resolve a maioria dos casos. Para qualquer data em contexto jurídico ou contratual, verifique manualmente.
Números de telefone e de identificação
Erros comuns: dígitos trocados, dígitos faltando, agrupamento errado (555-12-34 em vez de 555-1234).
Correção: verificação manual obrigatória. Números de telefone e identificadores são específicos demais para que qualquer correção automática seja confiável. Além disso, não dá para conferi-los pelo contexto.
Quantidades e medidas
Erros comuns: magnitude errada ("2 gramas" vs "20 gramas"), unidade errada ligada ao número certo ("50 metros" quando o orador disse "50 milímetros").
Correção: a formatação inteligente ajuda na renderização. Para conteúdo técnico (médico, científico, engenharia), trate todas as medidas como dados financeiros críticos: escute e verifique.
Proporções e intervalos
Erros comuns: extremos do intervalo trocados, direção da proporção invertida ("dois para um" vs "um para dois").
Correção: confira cada proporção e intervalo contra o áudio. São semanticamente reversíveis, e o contexto nem sempre elimina a ambiguidade.
Horários
Erros comuns: formato de 12 horas vs 24 horas, AM/PM ausente, "em ponto" omitido.
Correção: a formatação inteligente resolve a maioria. Em transcrições de reuniões em que horários exatos correspondem a itens de pauta, verifique os que importam.
Um fluxo de trabalho para conteúdo rico em números
Para quem transcreve regularmente relatórios financeiros, aulas técnicas, calls de resultados ou gravações clínicas:
- Use uma ferramenta com formatação inteligente ativada por padrão ou com um parâmetro explícito para ativá-la.
- Depois da transcrição, faça uma passada só de números: procure dígitos e verifique os que carregam significado.
- Mantenha uma lista de substituições específica do domínio para os erros que se repetem no seu conteúdo.
- Para conteúdo publicado ou jurídico, inclua uma etapa de verificação por uma segunda pessoa para qualquer valor que será citado.
Isso captura o que a automação pura deixa passar, sem exigir que você reverifique palavra por palavra.
Quando escalar para transcrição humana
Alguns conteúdos têm números que simplesmente não podem estar errados: registros regulatórios, dados de ensaios clínicos, depoimentos jurídicos, contratos imobiliários.
Para esses casos, a pilha prática é: transcrição por IA como primeira passada, revisão manual cuidadosa de todos os números contra o áudio e, opcionalmente, transcrição humana via um serviço especializado para as passagens mais críticas. O post IA vs transcrição humana aborda quando essa escalada faz sentido econômico.
Se você também enfrenta problemas de precisão mais amplos além dos números, o post sobre como corrigir a baixa precisão da transcrição cobre o quadro completo. Números são um subproblema específico; as correções gerais de precisão são outra história.
Se você só precisa de uma transcrição limpa de primeira passada, sem bot de reunião ou criação de conta, o ConvertAudioToText aplica formatação inteligente por padrão e funciona diretamente a partir de um upload ou URL, o que é útil para trabalhos pontuais de verificação.
FAQ
Por que minha transcrição diz "quinze" quando o orador disse "cinquenta"?
As duas palavras compartilham características acústicas, especialmente em fala rápida ou com sotaque: a sílaba tônica muda de lugar, mas ambas têm ataque /f/ e vogal parecida. Os modelos de IA escolhem entre elas com base na probabilidade acústica e no contexto ao redor. Se o contexto não favorecer claramente um número em vez do outro, o modelo vai errar em uma certa taxa. Ativar a formatação inteligente e fazer uma passada direcionada de escuta e verificação em todo número que importa são as correções práticas.
Ativar a formatação inteligente corrige todos os erros de números?
Não. A formatação inteligente cuida da consistência de renderização: ela converte "cinquenta mil dólares" em "$50.000" de forma confiável quando o modelo ouviu as palavras certas. Ela não consegue corrigir um erro de escuta. Se o modelo ouviu "quinze" quando o orador disse "cinquenta", a formatação inteligente vai renderizar o número errado de forma arrumada. Você ainda precisa de uma checagem manual para valores críticos.
Quando devo usar pós-processamento com LLM vs. correção manual para números?
Use o pós-processamento com LLM para problemas de consistência de formato ao longo de uma transcrição longa: formatos de data inconsistentes, renderização mista de dígitos/palavras, números impossíveis que o contexto torna óbvios. Use a correção manual quando o valor exato importa e um erro teria consequências reais, como dados financeiros, dosagens, valores jurídicos ou especificações técnicas. Os LLMs trabalham apenas a partir do texto da transcrição, não do áudio, então não conseguem resolver um erro de escuta.
Quais ferramentas de transcrição tratam números melhor por padrão?
A Deepgram com smart_format=true é a mais forte para inglês: ela trata numerais, moeda, datas, números de telefone e horários em uma única configuração. O AWS Transcribe aplica normalização de números automaticamente para idiomas compatíveis, sem parâmetro extra. A AssemblyAI tem format_text=true ativado por padrão e lida bem com a renderização de números. O OpenAI Whisper não tem parâmetro dedicado de formatação de números; sua saída, por padrão, mistura dígitos e palavras dependendo do contexto, e o pós-processamento é a correção recomendada para consistência.
Fontes
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.