
Corrige la puntuación que falta en tu transcripción (Guía 2026)
Summarize this article with:
De dónde proviene la puntuación
La solución más rápida es un único cambio de configuración: activa la puntuación en tu llamada a la API. Si la transcripción ya está generada, pégala en GPT-4o o Claude con un mensaje que pida añadir puntuación sin cambiar las palabras. Si el problema se repite en cada trabajo, cambia a una herramienta que tenga la puntuación activada por defecto.
La puntuación de una transcripción no proviene del audio. Proviene de una capa que el motor de transcripción añade sobre el reconocimiento de voz en bruto. Los motores modernos pasan la secuencia bruta de palabras por un modelo de lenguaje que predice dónde van los puntos, las comas y los signos de interrogación según la sintaxis y la prosodia. Algunos motores ejecutan esta capa por defecto. Otros requieren una opción. Y unos pocos la omiten por completo.
Entender qué capa te falta te dice exactamente dónde intervenir.
La capa de posprocesamiento con modelo de lenguaje
El reconocimiento de voz en bruto produce una secuencia de palabras con tiempos aproximados. Un modelo aparte, a veces llamado modelo de restauración de puntuación o normalizador de texto, toma esa secuencia e inserta puntuación según la gramática, las señales de entonación en los datos de tiempo y patrones estadísticos de grandes corpus de texto.
Cuando esta capa se ejecuta, obtienes un documento legible. Cuando no, obtienes un muro de texto.
Esta capa puede fallar por tres razones: está desactivada por una opción de configuración, no existe en un despliegue autoalojado, o está presente pero funciona con un modelo demasiado pequeño para manejar el dominio o el idioma.
Por qué tu transcripción no tiene puntuación
Tres configuraciones explican casi todas las transcripciones sin puntuación en 2026.
Deepgram con la puntuación sin activar
Deepgram incluye tanto su parámetro punctuate como su parámetro más amplio smart_format con valor false por defecto. Si llamas a la API sin ninguna de las dos opciones, obtienes una salida palabra por palabra sin puntuación.
Establecer smart_format=true activa la puntuación, los saltos de párrafo y la normalización de texto (fechas, monedas, números de teléfono) con una sola opción. Si solo quieres puntuación y nada más, punctuate=true es la opción dirigida. Según la documentación de Deepgram (verificada en julio de 2026), no necesitas ambas: smart_format=true activa la puntuación automáticamente.
Whisper autoalojado sin posprocesamiento
El modelo Whisper de OpenAI sí produce algo de puntuación, pero es inconsistente. El modelo procesa el audio en fragmentos independientes de 30 segundos, y la puntuación se degrada en los límites entre fragmentos. Los puntos que faltan al final de las oraciones, las comas mal colocadas y la omisión de comillas en el discurso directo son problemas documentados y recurrentes en los despliegues autoalojados.
Whisper alojado (el endpoint gpt-4o-transcribe de OpenAI) funciona mejor, pero los despliegues autoalojados sin una capa de posprocesamiento suelen producir salidas que técnicamente llevan puntuación en algunos lugares, pero no de forma fiable a lo largo de toda la transcripción.
Web Speech API en el navegador
Las herramientas basadas en navegador construidas sobre la Web Speech API tienen un soporte de puntuación limitado. La especificación incluye un atributo continuous, pero la inserción de puntuación depende del motor de voz subyacente del navegador. En la práctica, muchas herramientas de navegador devuelven texto sin puntuar o con puntuación mínima y dependen del posprocesamiento en el cliente para añadirla.
Cómo gestiona la puntuación por defecto cada motor principal
| Motor | Puntuación por defecto | Notas (según la documentación de cada proveedor, julio de 2026) |
|---|---|---|
| AssemblyAI | Activada por defecto | punctuate y format_text están en true por defecto; se desactivan con false explícito |
| AWS Transcribe | Activada por defecto | Automática para todos los idiomas compatibles; no requiere ninguna opción |
| Deepgram Nova-3 | Desactivada por defecto | Requiere punctuate=true o smart_format=true |
| OpenAI Whisper API | Incluida pero variable | Degradación en los límites de fragmentos en archivos largos; el endpoint alojado es más fiable |
| Whisper autoalojado | Variable, a menudo débil | Depende de la capa de posprocesamiento; se degrada en los límites de fragmentos de 30 segundos |
| Web Speech API | Mínima o ausente | Depende del navegador y del sistema operativo; no fiable para transcripción en producción |

La solución inmediata: restaurar la puntuación a posteriori
Si ya tienes una transcripción sin puntuar y necesitas arreglarla ahora mismo, dos enfoques funcionan de forma fiable.
Restauración de puntuación basada en LLM
Pasa el texto sin puntuar a GPT-4o o Claude con una instrucción clara:
Add punctuation and paragraph breaks to the following transcript.
Do not change any words. Use periods, commas, and question marks
where natural. Insert paragraph breaks when the topic shifts or
when the speaker changes.
Transcript:
[paste here]
Esto funciona para cualquier idioma que el modelo admita bien. El resultado es un documento utilizable en segundos. El costo de una transcripción de una hora a través de la API de OpenAI es lo bastante pequeño como para ser insignificante en un uso ocasional.
Restauración de puntuación de código abierto para trabajo por lotes
Para el procesamiento de alto volumen, la biblioteca de Python deepmultilingualpunctuation ejecuta localmente un modelo de puntuación dedicado sin una llamada a un LLM por cada documento:
from deepmultilingualpunctuation import PunctuationModel
model = PunctuationModel()
result = model.restore_punctuation(unpunctuated_text)
La biblioteca maneja inglés, alemán, francés e italiano. Fue entrenada con discursos parlamentarios, por lo que es posible un desplazamiento de dominio con audio técnico o conversacional. Haz una prueba con una muestra antes de adoptarla en producción.
Si necesitas un idioma fuera de esos cuatro, el enfoque con LLM generaliza mejor.
La solución permanente: activa la puntuación en tu configuración
Para transcripciones continuas, la respuesta correcta es un cambio de configuración, no un paso de restauración en cada trabajo.
Usuarios de Deepgram: añade smart_format=true a tu llamada a la API. Esa única opción cubre puntuación, saltos de párrafo y normalización de texto para el inglés. Para otros idiomas, smart_format tiene una cobertura más limitada, así que prueba explícitamente tu idioma de destino y recurre a punctuate=true si es necesario.
Usuarios de Whisper: si estás autoalojando el modelo, plantéate si añadir un paso de restauración de puntuación a tu pipeline es más fácil que migrar. Una pasada ligera de posprocesamiento con deepmultilingualpunctuation o una pequeña llamada a un LLM puede añadirse en un solo paso. Si usas el endpoint alojado de OpenAI, la calidad de salida es mejor, pero aun así prueba archivos largos para detectar problemas en los límites de fragmentos.
Herramientas basadas en navegador: si tu herramienta está construida sobre la Web Speech API y produce sistemáticamente salidas sin puntuar, el problema es el motor subyacente. Ninguna opción de configuración lo arreglará. La solución práctica es enviar el audio a una API del lado del servidor.
Si solo quieres transcribir un archivo sin configurar nada, ConvertAudioToText devuelve salidas con puntuación y divididas en párrafos por defecto, sin necesidad de cuenta.
Cómo se ve una puntuación deficiente (y cuándo insistir más)
No todos los problemas de puntuación son "no tener puntuación alguna". Algunas herramientas añaden puntuación, pero lo hacen mal. Los síntomas son diferentes.
Puntos en cada pausa, sin importar el significado. El modelo inserta un punto dondequiera que el hablante hace una pausa para respirar, incluso a mitad de una cláusula. Obtienes frases cortas y entrecortadas que fragmentan ideas naturalmente continuas. Es una señal de que el modelo usa detección de silencios en lugar de una capa adecuada de modelo de lenguaje.
Comas, pero sin puntos. El problema opuesto: el modelo inserta comas pero nunca completa un límite de oración. Frases larguísimas encadenadas con comas por todas partes.
Sin saltos de párrafo. La puntuación dentro de las oraciones está bien, pero la transcripción es un bloque continuo. Los cambios de tema y de hablante no se reflejan en la estructura de párrafos. Este es el problema de legibilidad de mayor impacto y a menudo necesita una revisión manual o una corrección basada en LLM que añada saltos de párrafo.
Signos de interrogación sistemáticamente ausentes. Las preguntas formuladas como afirmaciones con entonación ascendente reciben puntos en su lugar. El modelo detecta la sintaxis pero no la prosodia. Revisa manualmente buscando "oraciones que parecen preguntas" y corrígelas, o ejecuta una pasada específica con un LLM dándole instrucciones de identificar preguntas por sintaxis.
En concreto, para el caso de las frases interminables funciona la prueba de leer en voz alta: lee la transcripción en voz alta y, donde hagas una pausa natural más larga que la de una coma, inserta un punto. Tu oído es más fiable que el modelo para detectar los límites de oración en habla conversacional.
Calidad de la puntuación según el idioma
El inglés tiene el soporte de puntuación más sólido en todos los motores principales. Los principales idiomas europeos (español, francés, alemán, italiano, portugués) están bien soportados en AssemblyAI y Deepgram, con cierta variación. Los idiomas asiáticos con convenciones de puntuación diferentes (japonés, coreano, mandarín) requieren pruebas motor por motor, ya que sus reglas de puntuación difieren estructuralmente. Los idiomas con menos recursos tienen un soporte de puntuación más débil en general.
Para la transcripción en idiomas distintos del inglés, el enfoque de restauración con LLM generaliza mejor que los modelos basados en reglas, porque los grandes modelos de lenguaje guardan las convenciones de puntuación de muchos idiomas en sus pesos. Consulta la guía sobre precisión de la transcripción explicada para saber cómo el soporte de idiomas afecta en general a la calidad del resultado.
Preguntas frecuentes
¿Por qué mi transcripción no tiene puntos ni comas?
La causa más común es que tu API de transcripción tiene la puntuación desactivada por defecto y tú no la has activado. Los parámetros punctuate y smart_format de Deepgram, por ejemplo, están ambos en false por defecto. Una causa secundaria es usar un despliegue de Whisper autoalojado sin una capa de posprocesamiento con modelo de lenguaje, lo que degrada la puntuación especialmente en los límites de fragmentos de 30 segundos.
¿Puedo corregir la puntuación de una transcripción que ya tengo?
Sí. Pega el texto sin puntuar en GPT-4o o Claude con un mensaje que le indique añadir puntuación sin cambiar ninguna palabra. Para el procesamiento por lotes, la biblioteca de código abierto deepmultilingualpunctuation maneja inglés, francés, alemán e italiano sin una llamada a un LLM por cada transcripción.
¿AWS Transcribe genera texto sin puntuación?
No. AWS Transcribe añade puntuación automáticamente por defecto para todos los idiomas compatibles, según la documentación de AWS. No necesitas activar ninguna opción. Si a la salida de tu AWS Transcribe le falta puntuación, el problema probablemente esté en el formato posterior, la configuración de exportación o una biblioteca envolvente que la elimina.
¿Cómo sé si mi herramienta tiene la puntuación activada por defecto?
Pasa 30 segundos de audio hablado claro por la herramienta. Si la salida es una larga cadena de palabras sin puntos, la herramienta tiene la puntuación desactivada por defecto o no la admite. Compara el mismo audio en AssemblyAI (activada por defecto) o en la API de OpenAI Whisper para aislar si el problema es la configuración de tu herramienta.
Fuentes
- Documentación de Deepgram Smart Format: https://developers.deepgram.com/docs/smart-format (verificado en julio de 2026)
- Documentación del parámetro Punctuation de Deepgram: https://developers.deepgram.com/docs/punctuation (verificado en julio de 2026)
- Documentación de puntuación y mayúsculas automáticas de AssemblyAI: https://www.assemblyai.com/docs/pre-recorded-audio/automatic-punctuation-and-casing (verificado en julio de 2026)
- Documentación de puntuación de AWS Transcribe: https://docs.aws.amazon.com/transcribe/latest/dg/how-numbers.html (verificado en julio de 2026)
- Análisis de las limitaciones de puntuación de Whisper: https://prosperasoft.com/blog/openai/whisper-ai/whisper-punctuation-capitalization/ (verificado en julio de 2026)
- Biblioteca deepmultilingualpunctuation: https://pypi.org/project/deepmultilingualpunctuation/ (verificado en julio de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.