Corrige la transcripción de números: una guía sistemática (2026)
númerostranscripciónformatocorrección

Corrige la transcripción de números: una guía sistemática (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

Los errores numéricos en la transcripción con IA se reducen a un conjunto pequeño de patrones repetibles: formas habladas confundibles («fifteen» frente a «fifty»), inconsistencia de formato (dígitos frente a palabras) y atribución incorrecta de unidades. La solución es por capas: primero activa el formato inteligente en tu herramienta, después aplica buscar y reemplazar para los errores específicos del dominio y, por último, haz una revisión manual dirigida solo para los números que de verdad importan. El posprocesamiento con LLM resuelve las inconsistencias de formato restantes que el formato inteligente no detecta.

Los errores numéricos en la transcripción tienen solución, pero esta depende de cuál de las tres causas raíz estés enfrentando. El modelo escuchó el número equivocado (una confusión auditiva). El modelo escuchó bien pero lo representó mal (un error de formato). O el formato es inconsistente a lo largo de la transcripción (un error de estilo). Cada uno tiene una solución distinta, y confundirlos hace perder tiempo.

Esta guía recorre cada causa y su solución, en el orden en que conviene probarlas.

Por qué los números fallan de forma distinta a otras palabras

Los números son la categoría donde la transcripción con IA comete sus errores más costosos. Los errores son específicos y repetibles.

«Fifteen» frente a «fifty» es la confusión numérica más común de todas. El mismo patrón se repite entre los números terminados en -teen y sus decenas correspondientes: thirteen/thirty, fourteen/forty, sixteen/sixty, seventeen/seventy. En habla rápida o con cualquier acento, estos pares comparten suficientes rasgos acústicos como para que el modelo elija entre ellos según el contexto, no solo según el sonido. Si la frase circundante no favorece claramente uno de los dos números, el modelo adivina y a veces adivina mal.

Las secuencias de números crean un segundo modo de fallo. «Two five seven nine» dicho como número de referencia se convierte en «2,579» como cantidad. «One hundred fifty-two» puede convertirse en «152» o en «one hundred, 52». El modelo intenta agrupar los dígitos en un número con significado, y no siempre sabe si quieres un fragmento de teléfono, una cantidad o un identificador.

La atribución de unidades falla de una tercera manera específica. «Five dollars fifty» puede convertirse en «$5.50», «five-fifty» o «5 dollars, 50 cents» según la herramienta y según si el formato inteligente está activado. El número tiene los dígitos correctos pero el formato está mal, o el decimal se desplaza.

El análisis de fechas y decimales forma el último gran grupo. «May fifteen twenty twenty-six» puede convertirse en «May 15, 2026», «5/15/26» o «May 15th» según el formato predeterminado del modelo. «Point five» puede convertirse en «.5», «0.5» o «five tenths».

Solución 1: Activar el formato inteligente

La mayoría de los errores de representación de números desaparecen al activar el formato inteligente. Esta es la primera solución que debes probar y, para muchos usuarios, resuelve el 80 % del problema.

Esto es lo que ofrece realmente cada herramienta principal, según la documentación actual de cada proveedor (verificado en julio de 2026):

HerramientaParámetroPredeterminadoQué gestiona
Deepgramsmart_format=trueDesactivadoCifras, moneda, fechas, horas, números de teléfono, correos electrónicos (inglés; otros idiomas seleccionados)
AWS TranscribeAutomático (no requiere parámetro)Activado para los idiomas compatiblesNúmeros, moneda, fechas, horas, direcciones
AssemblyAIformat_text=trueActivadoFormato de texto, incluida la representación de números
OpenAI Whisper APISin parámetro específicoMixtoSin formateador de números integrado; usa el prompt o el posprocesamiento

El smart_format=true de Deepgram es el más explícito: al pasar el parámetro en una solicitud por lotes o de streaming, los números hablados se convierten a su forma de dígitos en inglés, incluidos los símbolos de moneda, las horas AM/PM y las fechas ordinales. AWS Transcribe lo aplica automáticamente para los idiomas compatibles sin necesidad de configuración. El format_text de AssemblyAI viene activado por defecto, así que si estás recibiendo salida sin formato de AssemblyAI, comprueba que no se haya desactivado.

OpenAI Whisper es la excepción. No existe un parámetro smart_format. Su salida combina por defecto dígitos y palabras escritas según el contexto, y la documentación recomienda usar el parámetro prompt para guiar el estilo, o el posprocesamiento, para corregir la consistencia. Si necesitas una representación consistente de los números con Whisper, trata eso por separado.

Herramienta de carga de audio mostrando la salida del formato inteligente para números
Herramienta de carga de audio mostrando la salida del formato inteligente para números

Un matiz que vale la pena conocer: el formato inteligente resuelve la representación, no las confusiones auditivas. Si el modelo escuchó «fifteen» cuando el hablante dijo «fifty», smart_format=true representará limpiamente el número equivocado como «15». La confusión sigue ahí.

Solución 2: Buscar y reemplazar para errores específicos del dominio

Si transcribes habitualmente contenido del mismo dominio, verás repetirse los mismos errores numéricos. Un pódcast financiero cuyo presentador siempre dice «fifty basis points» producirá el mismo error de «15 basis points» episodio tras episodio. Crea una lista de sustituciones.

Patrones habituales para los que vale la pena tener una lista:

fifteen basis points → 50 basis points  [verify against audio first]
thirteen percent → 13%
two zero two five → 2025
seventy-five thousand → 75,000

La limitación es real: buscar y reemplazar no distingue el contexto. «Twenty» es la representación correcta para «twenty people», y «20» suele ser lo correcto para «20 dollars» en un contexto financiero. Una sustitución masiva de todos los «twenty» por «20» romperá los casos válidos. Usa esta solución para errores tan ligados a un término del dominio que sea improbable que haya reemplazos falsos positivos.

Solución 3: Posprocesamiento con LLM para la consistencia del formato

Para la inconsistencia de formato en una transcripción larga (fechas en tres formatos distintos, algunos números como palabras y otros como dígitos sin una lógica coherente), una pasada de posprocesamiento con LLM lo deja limpio sin que tengas que verificar el audio.

Un prompt que funciona:

Read this transcript and fix number formatting for consistency.
Convert quantities to digits ($50, 25%, 1,500, 8:30 AM).
Write out numbers that start a sentence.
Fix obvious impossible numbers if context makes the correction clear.
Do not change any number you are uncertain about.

Transcript:
[paste here]

GPT-4o y Claude manejan esto de forma fiable en tareas de formato. El límite importante: el LLM solo ve texto. Si la transcripción contiene una confusión auditiva, el LLM corregirá el formato alrededor del número equivocado, pero no arreglará la confusión. Úsalo para el estilo, no para verificar datos.

Solución 4: Verificación manual dirigida para contenido crítico

Para el contenido donde un número equivocado tiene consecuencias reales, una pasada dirigida de escuchar y verificar es la única solución fiable.

El flujo de trabajo:

  1. Ejecuta la transcripción con el formato inteligente activado.
  2. Busca todos los números en la transcripción: revisa dígitos, símbolos de moneda, porcentajes y fechas.
  3. Para cada número que importe, sal a esa marca de tiempo en el audio y verifica.
  4. Corrige los que estén mal.

En una reunión de 30 minutos con entre 10 y 15 menciones numéricas, esto lleva de 5 a 10 minutos. Es el único enfoque que detecta las confusiones auditivas que el formato inteligente no puede corregir.

Para el contenido más crítico, como contratos legales, dosis médicas o datos financieros publicados, merece la pena que una segunda persona haga la misma revisión de forma independiente.

Categorías de números y sus modos de fallo específicos

Las distintas categorías fallan de maneras diferentes. Saber con qué categoría estás tratando te orienta hacia la solución correcta.

Dinero y moneda

Errores comunes: magnitud equivocada (15 frente a 50), símbolo de moneda ausente, desplazamiento decimal («five fifty» interpretado como 5.50 frente a 550).

Solución: primero formato inteligente. Para cualquier contenido financiero cuyas cifras se vayan a citar o publicar, verificación manual.

Porcentajes

Errores comunes: orden de magnitud equivocado (3 % frente a 30 %, lo que invierte el significado de una tendencia). Un aumento del 30 % representado como 3 % no es una imprecisión menor.

Solución: formato inteligente. Revisa manualmente cualquier porcentaje que describa un cambio o una tasa, ya que son los que conllevan mayor riesgo de alterar el significado.

Fechas

Errores comunes: año equivocado (2025 frente a 2026), formato inconsistente dentro de la misma transcripción (15 de mayo en un párrafo, 5/15 en otro), ordinal frente a cardinal («May fifteenth» frente a «May 15»).

Solución: el formato inteligente cubre la mayoría de los casos. Para cualquier fecha en un contexto legal o contractual, verifica manualmente.

Números de teléfono y números de identificación

Errores comunes: dígitos intercambiados, dígitos omitidos, agrupación incorrecta (555-12-34 en lugar de 555-1234).

Solución: verificación manual obligatoria. Los números de teléfono y los identificadores son demasiado específicos para confiar en cualquier corrección automática. Tampoco se pueden comprobar a partir del contexto.

Cantidades y medidas

Errores comunes: magnitud equivocada («2 gramos» frente a «20 gramos»), unidad incorrecta unida al número correcto («50 metros» cuando el hablante dijo «50 milímetros»).

Solución: el formato inteligente ayuda con la representación. Para contenido técnico (médico, científico, ingeniería), trata todas las medidas igual que los datos financieros críticos: escucha y verifica.

Proporciones y rangos

Errores comunes: extremos del rango intercambiados, dirección de la proporción invertida («dos a uno» frente a «uno a dos»).

Solución: contrasta cada proporción y rango con el audio. Son semánticamente reversibles y el contexto no siempre desambigua.

Horas

Errores comunes: formato de 12 horas frente a 24 horas, AM/PM omitido, «o'clock» eliminado.

Solución: el formato inteligente cubre la mayoría. En transcripciones de reuniones donde las horas exactas corresponden a puntos del orden del día, verifica las que importen.

Un flujo de trabajo para contenido con muchos números

Para quien transcribe habitualmente informes financieros, clases técnicas, llamadas de resultados o grabaciones clínicas:

  1. Usa una herramienta con el formato inteligente activado por defecto o con un parámetro explícito para activarlo.
  2. Después de transcribir, haz una pasada solo de números: busca los dígitos y verifica los que aportan significado.
  3. Mantén una lista de sustituciones específica de tu dominio para los errores que se repiten en tu contenido.
  4. Para contenido publicado o legal, incorpora un paso de verificación por una segunda persona para cualquier cifra que se vaya a citar.

Esto detecta lo que la automatización pura pasa por alto sin obligarte a reverificar palabra por palabra.

Cuándo pasar a la transcripción humana

Hay contenidos con números que simplemente no pueden estar equivocados: documentos regulatorios, datos de ensayos clínicos, deposiciones judiciales, contratos inmobiliarios.

Para estos casos, la pila práctica es transcripción con IA como primera pasada, revisión manual cuidadosa de todos los números contra el audio y, opcionalmente, transcripción humana mediante un servicio especializado para los pasajes más críticos. La entrada IA frente a transcripción humana explica cuándo ese escalado tiene sentido económico.

Si además tienes problemas de precisión más amplios más allá de los números, la guía sobre cómo corregir la baja precisión de transcripción cubre el panorama completo. Los números son un subproblema concreto; las correcciones generales de precisión van aparte.

Si solo necesitas una transcripción limpia de primera pasada sin bot de reuniones ni configuración de cuenta, ConvertAudioToText aplica el formato inteligente por defecto y funciona directamente desde una carga o una URL, lo cual resulta útil para trabajos de verificación puntuales.

Preguntas frecuentes

¿Por qué mi transcripción dice «fifteen» cuando el hablante dijo «fifty»?

Las dos palabras comparten rasgos acústicos, especialmente en habla rápida o con acento: la sílaba tónica cae de forma distinta, pero ambas empiezan con el sonido /f/ y tienen una vocal similar. Los modelos de IA eligen entre ellas según la probabilidad acústica y el contexto circundante. Si el contexto no favorece claramente un número sobre el otro, el modelo se equivocará en algún porcentaje de los casos. Activar el formato inteligente y hacer una pasada dirigida de escuchar y verificar sobre cualquier número que importe son las soluciones prácticas.

¿Activar el formato inteligente corrige todos los errores numéricos?

No. El formato inteligente se encarga de la consistencia de la representación: convierte «fifty thousand dollars» en «$50,000» de forma fiable una vez que el modelo escuchó las palabras correctas. No puede corregir una confusión auditiva. Si el modelo escuchó «fifteen» cuando el hablante dijo «fifty», el formato inteligente representará ordenadamente el número equivocado. Sigues necesitando una comprobación manual para las cifras críticas.

¿Cuándo debo usar posprocesamiento con LLM frente a corrección manual para los números?

Usa el posprocesamiento con LLM para problemas de consistencia de formato en una transcripción larga: formatos de fecha inconsistentes, representación mixta de dígitos y palabras, números imposibles que el contexto vuelve evidentes. Usa la corrección manual cuando la cifra exacta importa y un error tendría consecuencias reales, como datos financieros, dosis, montos legales o especificaciones técnicas. Los LLM solo pueden trabajar a partir del texto de la transcripción, no del audio, así que no pueden resolver una confusión auditiva.

¿Qué herramientas de transcripción manejan mejor los números por defecto?

Deepgram con smart_format=true es la opción más potente para el inglés: gestiona cifras, moneda, fechas, números de teléfono y horas en un solo ajuste. AWS Transcribe aplica la normalización de números automáticamente para los idiomas compatibles sin ningún parámetro adicional. AssemblyAI tiene format_text=true activado por defecto y maneja bien la representación de números. OpenAI Whisper no tiene un parámetro dedicado al formato de números; su salida combina por defecto dígitos y palabras según el contexto, y el posprocesamiento es la solución recomendada para lograr consistencia.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles