
Corrija a pontuação ausente na sua transcrição (Guia 2026)
Summarize this article with:
De onde vem a pontuação
A correção mais rápida é uma única mudança de configuração: ativar a pontuação na sua chamada de API. Se a transcrição já foi gerada, cole-a no GPT-4o ou no Claude com um prompt pedindo para adicionar pontuação sem alterar as palavras. Se o problema se repete em todo trabalho, troque para uma ferramenta que tenha a pontuação ativada por padrão.
A pontuação em uma transcrição não vem do áudio. Ela vem de uma camada que o motor de transcrição adiciona sobre o reconhecimento de fala bruto. Os motores modernos passam a sequência bruta de palavras por um modelo de linguagem que prevê onde devem ficar pontos, vírgulas e interrogações com base na sintaxe e na prosódia. Alguns motores executam essa camada por padrão. Outros exigem uma flag. Alguns poucos simplesmente a ignoram.
Entender qual camada está faltando diz exatamente onde intervir.
A camada de pós-processamento por modelo de linguagem
O reconhecimento de fala bruto produz uma sequência de palavras com marcações de tempo aproximadas. Um modelo separado, às vezes chamado de modelo de restauração de pontuação ou normalizador de texto, recebe essa sequência e insere a pontuação com base na gramática, nas pistas de entonação presentes nos dados de tempo e em padrões estatísticos extraídos de grandes corpora de texto.
Quando essa camada roda, você recebe um documento legível. Quando ela não roda, você recebe uma parede de texto.
Essa camada pode falhar por três motivos: foi desativada por uma flag de configuração, está ausente em uma implantação auto-hospedada ou existe, mas roda em um modelo pequeno demais para lidar com o domínio ou o idioma.
Por que sua transcrição não tem pontuação
Três configurações explicam quase toda transcrição sem pontuação em 2026.
Deepgram com a pontuação não ativada
A Deepgram vem de fábrica com o parâmetro punctuate e o mais amplo smart_format definidos como false. Se você chamar a API sem nenhuma das duas flags, recebe uma saída palavra por palavra, sem pontuação.
Definir smart_format=true ativa pontuação, quebras de parágrafo e normalização de texto (datas, moedas, números de telefone) em uma única flag. Se você quer apenas a pontuação e nada mais, punctuate=true é a opção direcionada. Segundo a documentação da Deepgram (verificada em julho de 2026), você não precisa das duas: smart_format=true ativa a pontuação automaticamente.
Whisper auto-hospedado sem pós-processamento
O modelo Whisper da OpenAI até produz alguma pontuação, mas de forma inconsistente. O modelo processa o áudio em blocos independentes de 30 segundos, e a pontuação se degrada nos limites entre os blocos. Pontos ausentes no fim das frases, vírgulas fora de lugar e a falha em incluir aspas em falas diretas são problemas documentados e recorrentes em implantações auto-hospedadas.
O Whisper hospedado (o endpoint gpt-4o-transcribe da OpenAI) se sai melhor, mas implantações auto-hospedadas sem uma camada de pós-processamento frequentemente produzem saídas que, tecnicamente, têm pontuação em alguns trechos, mas não de forma confiável ao longo de uma transcrição completa.
Web Speech API no navegador
Ferramentas baseadas em navegador construídas sobre a Web Speech API têm suporte limitado à pontuação. A especificação inclui um atributo continuous, mas a inserção de pontuação depende do motor de fala subjacente do navegador. Na prática, muitas ferramentas de navegador retornam texto sem pontuação ou com pontuação mínima e dependem de pós-processamento no lado do cliente para adicioná-la de volta.
Como cada grande motor lida com a pontuação por padrão
| Motor | Pontuação por padrão | Observações (conforme documentação dos fornecedores, julho de 2026) |
|---|---|---|
| AssemblyAI | Ativada por padrão | punctuate e format_text têm ambos o padrão true; desative com false explícito |
| AWS Transcribe | Ativada por padrão | Automática para todos os idiomas suportados; nenhuma flag necessária |
| Deepgram Nova-3 | Desativada por padrão | Requer punctuate=true ou smart_format=true |
| OpenAI Whisper API | Incluída, mas variável | Degradação nos limites dos blocos em arquivos longos; endpoint hospedado mais confiável |
| Whisper auto-hospedado | Variável, geralmente fraca | Depende da camada de pós-processamento; degrada nos limites dos blocos de 30 segundos |
| Web Speech API | Mínima ou ausente | Depende do navegador e do sistema operacional; não confiável para transcrição em produção |

A correção imediata: restauração da pontuação após a transcrição
Se você já tem uma transcrição sem pontuação e precisa corrigi-la agora, duas abordagens funcionam de forma confiável.
Restauração de pontuação baseada em LLM
Passe o texto sem pontuação para o GPT-4o ou o Claude com uma instrução clara:
Add punctuation and paragraph breaks to the following transcript.
Do not change any words. Use periods, commas, and question marks
where natural. Insert paragraph breaks when the topic shifts or
when the speaker changes.
Transcript:
[paste here]
Isso funciona para qualquer idioma que o modelo suporte bem. O resultado é um documento utilizável em segundos. O custo de uma transcrição de uma hora pela API da OpenAI é pequeno o suficiente para ser desprezível em uso ocasional.
Restauração de pontuação open source para processamento em lote
Para processamento em alto volume, a biblioteca Python deepmultilingualpunctuation executa um modelo dedicado de pontuação localmente, sem uma chamada de LLM por documento:
from deepmultilingualpunctuation import PunctuationModel
model = PunctuationModel()
result = model.restore_punctuation(unpunctuated_text)
A biblioteca trata inglês, alemão, francês e italiano. Ela foi treinada com discursos parlamentares, então pode haver desvio de domínio em áudios técnicos ou conversacionais. Teste em uma amostra antes de adotá-la em produção.
Se você precisar de um idioma fora desses quatro, a abordagem com LLM generaliza melhor.
A correção permanente: ative a pontuação na sua configuração
Para transcrições contínuas, a resposta certa é uma única mudança de configuração, não uma etapa de restauração em cada trabalho.
Usuários da Deepgram: adicione smart_format=true à sua chamada de API. Essa única flag cobre pontuação, quebras de parágrafo e normalização de texto para inglês. Para outros idiomas, o smart_format tem cobertura mais restrita, então teste explicitamente o seu idioma-alvo e, se necessário, volte para punctuate=true.
Usuários do Whisper: se você está auto-hospedando, avalie se adicionar uma etapa de restauração de pontuação no seu pipeline é mais fácil do que migrar. Uma passagem leve de pós-processamento com deepmultilingualpunctuation ou uma pequena chamada de LLM pode ser acrescentada em um único passo. Se você usa o endpoint hospedado da OpenAI, a qualidade da saída é melhor, mas ainda assim teste arquivos longos quanto a problemas nos limites dos blocos.
Ferramentas de navegador: se sua ferramenta é construída sobre a Web Speech API e consistentemente produz saídas sem pontuação, o problema é o motor subjacente. Nenhuma flag de configuração vai resolver isso. A solução prática é enviar o áudio para uma API do lado do servidor.
Se você só quer transcrever um arquivo sem configurar nada, o ConvertAudioToText retorna saídas com pontuação e parágrafos por padrão, sem necessidade de criar conta.
Como fica uma pontuação fraca (e quando insistir mais)
Nem todo problema de pontuação é "nenhuma pontuação". Algumas ferramentas adicionam pontuação, mas fazem isso mal. Os sintomas são diferentes.
Pontos em cada pausa, independentemente do sentido. O modelo insere um ponto sempre que o orador faz uma pausa para respirar, mesmo no meio de uma oração. Você recebe frases curtas e truncadas que fragmentam ideias naturalmente contínuas. Esse é um sinal de que o modelo está usando detecção de silêncio em vez de uma camada adequada de modelo de linguagem.
Vírgulas, mas nenhum ponto. O problema oposto: o modelo insere vírgulas, mas nunca fecha o limite de uma frase. Frases longas e arrastadas, com vírgulas emendando orações o tempo todo.
Sem quebras de parágrafo. A pontuação dentro das frases está boa, mas a transcrição é um bloco único e contínuo. Mudanças de assunto e trocas de orador não aparecem na estrutura de parágrafos. Esse é o problema de legibilidade de maior impacto e geralmente exige uma revisão manual ou uma correção baseada em LLM que adicione quebras de parágrafo.
Pontos de interrogação consistentemente ausentes. Perguntas formuladas como afirmações com entonação ascendente recebem pontos em vez de interrogações. O modelo detecta a sintaxe, mas não a prosódia. Faça uma varredura manual procurando "frases que parecem perguntas" e corrija-as, ou rode uma passagem direcionada de LLM com instruções para identificar perguntas pela sintaxe.
Para o caso das frases arrastadas especificamente, o teste da leitura em voz alta funciona: leia a transcrição em voz alta e, onde você naturalmente fizer uma pausa maior do que a de uma vírgula, insira um ponto. Seu ouvido é mais confiável do que o modelo na detecção de limites de frases em fala conversacional.
Qualidade da pontuação por idioma
O inglês tem o suporte de pontuação mais forte em todos os grandes motores. Os principais idiomas europeus (espanhol, francês, alemão, italiano, português) são bem suportados na AssemblyAI e na Deepgram, com alguma variação. Idiomas asiáticos com convenções de pontuação diferentes (japonês, coreano, mandarim) exigem testes motor por motor, já que as regras de pontuação diferem estruturalmente. Idiomas com menos recursos recebem suporte de pontuação mais fraco de modo geral.
Para transcrição em idiomas que não o inglês, a abordagem de restauração com LLM generaliza melhor do que modelos baseados em regras, porque grandes modelos de linguagem carregam convenções de pontuação de muitos idiomas em seus pesos. Veja o guia sobre precisão de transcrição explicada para entender como o suporte a idiomas afeta a qualidade da saída de forma geral.
FAQ
Por que minha transcrição não tem pontos nem vírgulas?
A causa mais comum é que sua API de transcrição tem a pontuação desativada por padrão e você não a ativou. Os parâmetros punctuate e smart_format da Deepgram, por exemplo, têm ambos o padrão false. Uma causa secundária é usar uma implantação auto-hospedada do Whisper sem uma camada de pós-processamento por modelo de linguagem, o que degrada a pontuação, especialmente nos limites dos blocos de 30 segundos.
Posso corrigir a pontuação de uma transcrição que eu já tenho?
Sim. Cole o texto sem pontuação no GPT-4o ou no Claude com um prompt instruindo-o a adicionar pontuação sem alterar nenhuma palavra. Para processamento em lote, a biblioteca open source deepmultilingualpunctuation trata inglês, francês, alemão e italiano sem uma chamada de LLM por transcrição.
O AWS Transcribe gera texto sem pontuação?
Não. O AWS Transcribe adiciona pontuação automaticamente por padrão para todos os idiomas suportados, conforme a documentação da AWS. Você não precisa ativar nenhuma flag. Se a saída do seu AWS Transcribe estiver sem pontuação, o problema provavelmente está na formatação posterior, nas configurações de exportação ou em uma biblioteca wrapper que a remove.
Como saber se minha ferramenta tem a pontuação ativada por padrão?
Rode 30 segundos de áudio falado claro na ferramenta. Se a saída for uma longa sequência de palavras sem nenhum ponto, a ferramenta tem a pontuação desativada por padrão ou não oferece esse recurso. Compare o mesmo áudio na AssemblyAI (ativada por padrão) ou na API do OpenAI Whisper para isolar se o problema está na configuração da sua ferramenta.
Fontes
- Documentação do Smart Format da Deepgram: https://developers.deepgram.com/docs/smart-format (verificado em julho de 2026)
- Documentação do parâmetro Punctuation da Deepgram: https://developers.deepgram.com/docs/punctuation (verificado em julho de 2026)
- Documentação de pontuação e capitalização automáticas da AssemblyAI: https://www.assemblyai.com/docs/pre-recorded-audio/automatic-punctuation-and-casing (verificado em julho de 2026)
- Documentação de pontuação do AWS Transcribe: https://docs.aws.amazon.com/transcribe/latest/dg/how-numbers.html (verificado em julho de 2026)
- Análise das limitações de pontuação do Whisper: https://prosperasoft.com/blog/openai/whisper-ai/whisper-punctuation-capitalization/ (verificado em julho de 2026)
- Biblioteca deepmultilingualpunctuation: https://pypi.org/project/deepmultilingualpunctuation/ (verificado em julho de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.