Corregir errores de jerga en la transcripción: la pasada de glosario
jergatécnicotranscripcióncorrección

Corregir errores de jerga en la transcripción: la pasada de glosario

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

Por qué falla la jerga

La respuesta corta: la palabra nunca estuvo en la distribución de entrenamiento del modelo. Los modelos de transcripción con IA aprenden de millones de horas de audio, pero esos datos se inclinan fuertemente hacia la conversación cotidiana. «Kubernetes» aparece en una fracción de un por ciento de los enunciados de entrenamiento. «Electrocardiograma» aparece aún menos. Así que cuando llega la señal acústica, el modelo sustituye palabras fonéticamente similares que sí conoce. «Kubernetes» se convierte en «cuban itties». «PostgreSQL» se convierte en «postgrass quill». «gRPC» se escribe como «g-rpc» con un guion de más.

Las sustituciones son predecibles, no aleatorias. El modelo hace exactamente lo que fue entrenado para hacer: elegir la secuencia de palabras de mayor probabilidad dados los sonidos. El problema es que esa probabilidad refleja el inglés general, no tu dominio. Esta es la brecha de distribución de entrenamiento, y explica por qué el galimatías es consistente, no disperso. Cada vez que un hablante dice «Kubernetes» en esa grabación, la transcripción dice «cuban itties».

La buena noticia es que la solución es estructural. Resuelve la brecha de distribución una vez, y el problema desaparece en gran medida para cada transcripción posterior en ese dominio.

Tres vías de corrección, ordenadas por costo de configuración

Vía 1: Buscar y reemplazar (rápida, por transcripción)

Para una sola transcripción con un puñado de términos confusos, buscar y reemplazar toma menos de 10 minutos y funciona con cualquier herramienta. Crea una lista de sustituciones mientras lees el resultado:

cuban itties     → Kubernetes
postgrass quill  → PostgreSQL
g-rpc            → gRPC
docker compose   → Docker Compose
postgres equal   → PostgreSQL

Ejecuta buscar y reemplazar para cada par. Guarda la lista. En la siguiente transcripción sobre el mismo tema, aplica la lista antes de empezar a leer. Obtienes la mayor parte del valor con las primeras 20 sustituciones.

El límite es claro: esto es reactivo y específico de cada transcripción. Es la decisión correcta para una grabación única. Es la arquitectura equivocada para un equipo que produce 50 transcripciones por semana.

Vía 2: Vocabulario personalizado y keyterm prompting (solución permanente)

El vocabulario personalizado le indica al motor qué términos priorizar antes de escuchar una sola palabra. La mayoría de las API de nivel de producción ya lo admiten de forma nativa, y la configuración es un costo único.

Las implementaciones difieren según la plataforma:

PlataformaNombre de la funciónParámetro de APILímite
Deepgram Nova-3Keyterm Promptingkeyterm=TERM (repetible)500 tokens por solicitud (~100 términos)
AssemblyAI (streaming)Keyterms Promptingkeyterms_prompt100 términos, 50 caracteres cada uno
AWS TranscribeCustom VocabularyArchivo de vocabulario en S3 (formato de tabla)50 KB por archivo, 100 archivos por cuenta
Google Cloud STT (Chirp 3)Speech AdaptationObjeto SpeechAdaptation con frasesLista de frases por solicitud
Azure Custom SpeechEntrenamiento de Custom SpeechCarga de conjunto de datos de entrenamientoAjuste fino completo del modelo, mayor costo de configuración
OpenAI Whisper APIParámetro promptCadena promptMáximo 224 tokens

Algunos detalles verificados que vale la pena conocer:

Keyterm prompting de Deepgram Nova-3 (verificado en julio de 2026): pasa keyterm=TERM como parámetro de consulta, repitiéndolo por cada término. Según la documentación de Deepgram, los términos están limitados a 500 tokens en total por solicitud; la recomendación práctica es de 20-50 términos de alto valor. El keyterm prompting es específico de los modelos Nova-3 y Flux; el anterior Nova-2 usa un parámetro keywords aparte.

Keyterms prompting de AssemblyAI está documentado actualmente para transcripción en streaming, con hasta 100 términos de 50 caracteres cada uno. El parámetro es keyterms_prompt en la configuración de streaming. Para transcripción por lotes, el parámetro heredado word_boost de AssemblyAI con valores boost_param de low, default o high sigue aplicando.

Parámetro prompt de la API de OpenAI Whisper: el campo prompt acepta hasta 224 tokens y funciona haciendo que el modelo emule los patrones de escritura de lo que incluyas. Según el cookbook de OpenAI (verificado en julio de 2026), los prompts estilo frase natural superan a las listas simples. Escribe «El ingeniero habló de clústeres de Kubernetes y replicación de PostgreSQL» en lugar de «Kubernetes, PostgreSQL». El modelo copia tus grafías. No puede añadir información que no esté en el audio, pero preferirá fuertemente las grafías que le diste.

Vocabulario personalizado de AWS Transcribe: usa un formato de tabla de cuatro columnas (Phrase, IPA, SoundsLike, DisplayAs) subido a S3. Hasta 100 archivos de vocabulario por cuenta, 50 KB por archivo, 256 caracteres por entrada. La variante médica (Amazon Transcribe Medical) admite un vocabulario aparte para términos clínicos, solo inglés de EE. UU.

El flujo de trabajo para una solución permanente en cualquiera de estas opciones:

  1. Crea una lista de 30-100 términos que se repiten en tu dominio.
  2. Sube o pasa la lista a la función de vocabulario de tu motor.
  3. A partir de ese momento, cada transcripción en ese dominio se beneficia.
  4. Revisa y amplía la lista trimestralmente a medida que evoluciona tu vocabulario.

Herramienta de transcripción de audio procesando grabaciones técnicas con mucha jerga
Herramienta de transcripción de audio procesando grabaciones técnicas con mucha jerga

Para flujos de trabajo basados en API, consulta la comparación de las mejores API de voz a texto para 2026 para ver lado a lado qué motores manejan el vocabulario personalizado con la menor fricción.

Vía 3: Entrenamiento de modelos específicos del dominio (configuración pesada, mejor techo)

Para transcripción de volumen muy alto en un solo dominio, un modelo ajustado supera a las pistas de vocabulario en los términos más difíciles. Esto es lo que representa Deepgram Nova-3 Medical: un modelo preentrenado con audio clínico, no un modelo base con una lista de vocabulario adjunta. AWS Transcribe Medical adopta un enfoque similar. Azure Custom Speech te permite entrenar con tu propio audio etiquetado.

El punto de inflexión costo-beneficio es aproximado: por debajo de unas 50.000 minutos al mes de audio específico del dominio, el vocabulario personalizado sobre un modelo base sólido es más práctico que el entrenamiento de modelos. Por encima de eso, los compromisos de precisión y mantenimiento empiezan a favorecer un modelo ajustado.

Para la mayoría de los equipos que leen esto, la vía 2 es la respuesta.

Cómo construir una buena lista de vocabulario

Una lista bien construida comparte características entre dominios, independientemente de la herramienta de transcripción.

Nombres de productos y tecnologías

Cada producto que mencionen tus conversaciones, incluidos los tuyos, los de tus competidores y los de tus proveedores. «Kubernetes» y «K8s» pueden necesitar entradas separadas, ya que el modelo encuentra cada uno fonéticamente distinto. «PostgreSQL» y «Postgres» merecen entradas separadas por la misma razón.

Siglas tal como quieres que se escriban

Siglas técnicas que el modelo de otro modo expandiría o deformaría. Escríbelas exactamente como deben aparecer en la transcripción: «gRPC», no «g-r-p-c»; «SaaS», no «sass»; «DDoS», no «duh-dos»; «LLM», no «elm». La columna DisplayAs en AWS Transcribe y el formato de cadena en los keyterms de Deepgram te permiten especificar con precisión la forma de salida.

Términos compuestos y frases de varias palabras

Frases que el modelo podría separar incorrectamente. «Desarrollo guiado por pruebas» pasada como keyterm produce esa frase exacta en lugar de tres palabras desconectadas. «Infarto de miocardio» tratada como unidad se transcribe con más fiabilidad que cada palabra por separado.

Jerga especializada

Los términos que solo usan con regularidad los profesionales de tu campo. Para seguridad: patrones CVE específicos, frameworks de exploits, nombres de protocolos. Para medicina: nombres de fármacos por su denominación clínica (no solo marcas comerciales), nombres de procedimientos, términos anatómicos. Para derecho: frases latinas, doctrinas específicas, tipos de mociones procesales.

Nombres que suenan como palabras comunes

Algunos nombres de personas, empresas o tecnologías colisionan fonéticamente con palabras comunes del inglés. «Apache», el proyecto de servidor, frente a la palabra cotidiana. «Vue», el framework de JavaScript. «Rust», el lenguaje de programación. «Swift», el lenguaje. El modelo necesita una predisposición fuerte para evitar interpretarlos con sus significados de diccionario.

Listas de referencia por dominio

Estos son puntos de partida, no soluciones completas. Lee tu primera transcripción y añade todo aquello que el modelo haya escrito mal.

Ingeniería de software

Kubernetes, k8s, PostgreSQL, Postgres, gRPC, GraphQL, Docker,
TypeScript, async/await, monorepo, microservices, OAuth, JWT,
SQLite, MongoDB, Cassandra, Kafka, Redis, Elasticsearch,
LangChain, OpenAI, Anthropic, Claude, GPT-4o,
WebAssembly, WASM, RAG, vector database, embedding

Medicina

electrocardiogram, ECG, EKG, echocardiogram, defibrillator,
endotracheal intubation, laparoscopic, cholecystectomy,
metformin, lisinopril, atorvastatin, amoxicillin, ondansetron,
hypertension, hyperlipidemia, hypothyroidism, diabetes mellitus,
osteoarthritis, atrial fibrillation, myocardial infarction

Derecho

voir dire, habeas corpus, prima facie, mens rea, res ipsa loquitur,
amicus curiae, certiorari, en banc, stare decisis, sub judice,
deposition, interrogatory, subpoena, discovery, motion in limine,
summary judgment, demurrer, appellate, statute of limitations

Finanzas

EBITDA, ARR, MRR, churn, LTV, CAC, IRR, NPV, IPO, SPAC,
revenue recognition, accrual basis, deferred revenue, GAAP, IFRS,
preferred stock, common stock, dilution, cap table, term sheet,
liquidation preference, anti-dilution, mezzanine

Para nombres propios que pertenecen a una persona concreta en lugar de a un dominio, la guía para corregir nombres mal transcritos cubre el mismo mecanismo con ejemplos de nombres personales.

La elección de la herramienta importa para trabajos con mucha jerga

No todas las herramientas de transcripción exponen controles de vocabulario a los usuarios regulares. Las herramientas que vale la pena usar para dominios especializados:

Deepgram Nova-3 vía API: el keyterm prompting está bien documentado y surte efecto de inmediato en cada solicitud. Sin paso de carga, sin período de espera.

AssemblyAI vía API: word_boost para lotes, keyterms_prompt para streaming. Ambos son parámetros a nivel de solicitud.

AWS Transcribe: los archivos de vocabulario personalizado requieren una carga a S3 y un paso de creación antes de poder usarse, pero persisten y pueden reutilizarse entre trabajos.

AWS Transcribe Medical: un producto aparte con vocabulario clínico precargado y soporte para inglés de EE. UU. La función de vocabulario personalizado médico se suma a esa base.

Google Cloud STT (Chirp 3): las frases de speech adaptation se pasan por solicitud, similar a Deepgram. Chirp 3 es la generación actual a mediados de 2026.

API de OpenAI Whisper mediante el parámetro prompt: más débil que las funciones dedicadas de vocabulario personalizado, pero sin configuración alguna. Útil cuando la lista de jerga es corta (menos de 30 términos) y el prompt cabe en 224 tokens.

Herramientas que tendrán dificultades sin importar tu trabajo de vocabulario: herramientas basadas en navegador que usan la Web Speech API, y cualquier servicio de nivel gratuito que no exponga parámetros de vocabulario en absoluto.

Mi opinión: para un equipo con vocabulario de dominio estable, el keyterm prompting de Deepgram Nova-3 es la vía de menor fricción para pasar de transcripciones llenas de jerga confusa a transcripciones limpias. El vocabulario surte efecto de inmediato, no requiere paso de carga y no cuesta nada extra más allá de la tarifa por minuto. Para medicina en particular, Nova-3 Medical está lo suficientemente construido a medida como para que a menudo maneje la terminología clínica sin ningún término personalizado.

Si solo necesitas una transcripción limpia sin gestionar una integración de API, la herramienta de audio a texto de ConvertAudioToText admite la carga de archivos para una entrega directa. Usa el resultado corregido para construir tu lista de sustituciones y luego pasa a controles de vocabulario a nivel de API cuando tu lista de términos se estabilice.

Cuando la IA todavía pierde contra un humano

Alguna jerga está genuinamente fuera del alcance de la transcripción con IA, incluso con controles de vocabulario:

  • Nombres de fármacos de ensayos clínicos posteriores a la fecha de corte de entrenamiento de cualquier modelo.
  • Subcampos estrechos de la ingeniería donde el vocabulario nunca ha aparecido en ningún corpus de audio público (la química de procesos de semiconductores, por ejemplo).
  • Terminología legal arcaica que aparece en pocas grabaciones modernas.

Para esos casos, un transcriptor humano con experiencia en el dominio es la respuesta honesta. La entrada sobre transcripción con IA frente a humana cubre cuándo tiene sentido financiero dar ese salto. Para todo lo demás en 2026, el vocabulario personalizado sobre un modelo base sólido más una revisión manual ligera produce resultados de calidad editorial.

Preguntas frecuentes

¿Por qué el modelo transcribe correctamente las palabras generales pero falla con los términos del dominio?

Las estimaciones de probabilidad del modelo provienen de sus datos de entrenamiento. Las palabras comunes del inglés aparecen millones de veces; los términos del dominio aparecen rara vez o no aparecen en absoluto. Cuando el modelo escucha «Kubernetes», la señal fonética coincide más fuertemente con «cuban itties» en la distribución de entrenamiento que con el término correcto, así que gana la salida incorrecta. Los controles de vocabulario anulan esa predisposición al potenciar explícitamente los términos objetivo.

¿La API de Whisper admite vocabulario personalizado?

No con una función dedicada de vocabulario. El parámetro prompt (máximo 224 tokens) acepta texto de ejemplo, y el modelo intentará coincidir con las grafías de tu prompt. Escribir una frase natural que use tus términos técnicos tal como deben aparecer («El equipo migró el clúster de PostgreSQL a Kubernetes») es más eficaz que listar términos sueltos. Para problemas serios de jerga, Deepgram o AssemblyAI con API de vocabulario adecuadas son más fiables.

¿Cuántos términos debo incluir en mi lista de vocabulario?

Empieza con los 20-30 términos que causaron más errores en tu primera transcripción. Deepgram Nova-3 admite hasta 500 tokens (~100 términos) por solicitud. El streaming de AssemblyAI permite hasta 100 términos de 50 caracteres cada uno. Los archivos de AWS Transcribe pueden contener más, pero las listas de vocabulario grandes a veces perjudican la precisión en términos que realmente no están presentes en el audio, así que las listas pequeñas y enfocadas suelen rendir mejor que las listas que intentan incluirlo todo.

¿El vocabulario personalizado ayuda con las siglas o solo con palabras completas?

Con ambas. Las siglas suelen ser las entradas de mayor valor porque el modelo frecuentemente las expande («SaaS» a «sass», «gRPC» a «g rpc»). Pasa la sigla en el formato de salida exacto que quieres: gRPC, DDoS, LLM. En plataformas como AWS Transcribe donde especificas un campo DisplayAs, tienes control preciso sobre las mayúsculas y la puntuación en la salida.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles