Cómo convertir OGG a texto (notas de voz de WhatsApp) 2026
transcripciónaudioogg

Cómo convertir OGG a texto (notas de voz de WhatsApp) 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

La vía rápida

Sube tu archivo .ogg o .opus directamente a ConvertAudioToText y recibe una transcripción en menos de un minuto para clips cortos. No hace falta conversión. Si llegaste aquí porque una nota de voz de WhatsApp apareció en tus archivos como un .opus, se trata de un contenedor OGG que contiene audio Opus, y se sube exactamente igual.

Las notas de voz OGG y Opus se suben sin conversión
Las notas de voz OGG y Opus se suben sin conversión

El resto de esta entrada cubre por qué los archivos OGG se comportan de forma distinta según lo que los haya creado, cómo sacarlos de tu teléfono en primer lugar, y qué significan las diferencias entre códecs para la calidad de la transcripción.

Por qué aparece OGG en tu flujo de trabajo

OGG es un formato contenedor, no un códec de audio. Piensa en él como en un archivo ZIP: el contenedor guarda la secuencia de audio, y la codificación real la realiza Vorbis (más antiguo, de propósito general) u Opus (más reciente, optimizado para voz). Ambos están libres de regalías, y por eso acabaron dentro de software que no quería pagar las licencias de MP3.

Los lugares donde más habitualmente te encuentras archivos OGG:

  • Notas de voz de WhatsApp, códec Opus, extensión .opus (el mismo contenedor OGG por debajo)
  • Mensajes de voz de Telegram, Opus dentro de .ogg, ~32 kbps, 48 kHz mono
  • Mensajes de voz de Discord, Opus a velocidades bajas dentro de .ogg
  • Exportaciones de Audacity, Vorbis por defecto, nivel de calidad 5 (~equivalente a un MP3 de 128 kbps en tamaño pero con mayor calidad gracias al VBR)
  • GNOME Sound Recorder, volcados de PulseAudio y otras herramientas de audio de Linux, normalmente Vorbis
  • Artículos hablados de Wikipedia y audios de Wikimedia Commons, Vorbis a 96-128 kbps

Cada fuente tiene sus propios hábitos de velocidad de bits y su ruta de exportación. Las secciones siguientes repasan las más importantes.

Vorbis vs Opus: qué difiere realmente

Ambos códecs viven dentro de contenedores .ogg. Distinguirlos importa porque algunas herramientas de transcripción admiten uno y no el otro.

Vorbis (estandarizado en 2001) es de velocidad de bits variable por diseño. El nivel de calidad 5 predeterminado de Audacity apunta aproximadamente al mismo tamaño de archivo que un MP3 de 128 kbps, pero consigue mejor calidad porque asigna más bits a los pasajes complejos. Lo verás en grabaciones, podcasts y audios de Wikipedia a 128-256 kbps.

Opus (estandarizado en 2012, RFC 6716) fue creado para la voz en tiempo real. Opera desde 6 kbps hasta 510 kbps y alterna dinámicamente entre modos de codificación de habla y de música. Desde los 24 kbps en adelante, los estudios muestran una precisión de reconocimiento automático de voz a unos 1,5 puntos porcentuales de la calidad sin pérdidas. Por debajo de 16 kbps comienza una degradación significativa, y las notas de voz de WhatsApp se sitúan justo en ese borde.

La trampa de la extensión. La Xiph.Org Foundation especifica oficialmente .opus para los archivos Opus-en-OGG (RFC 7845 / XiphWiki OggOpus). Las herramientas modernas escriben .opus. Aplicaciones antiguas a veces escribían Opus con extensión .ogg. Si ves un archivo .ogg de WhatsApp, Discord o Telegram que parece sospechosamente pequeño (menos de 15 KB por minuto de audio), casi seguro es Opus etiquetado erróneamente. Ejecuta ffprobe yourfile.ogg y busca Audio: opus o Audio: vorbis en la salida para confirmarlo.

La ruta de exportación de las notas de voz de WhatsApp

WhatsApp es la mayor fuente real de archivos OGG Opus, y sacarlos correctamente de tu teléfono depende de tu plataforma.

Android

El camino más limpio: abre tu gestor de archivos y navega hasta Android/media/com.whatsapp/WhatsApp/Media/WhatsApp Voice Notes/. WhatsApp guarda allí las grabaciones como archivos .opus con la calidad original bit a bit. Copia el archivo a tu PC mediante USB o súbelo directamente a una carpeta de la nube.

Alternativamente, mantén pulsada una nota de voz en WhatsApp, toca el icono de compartir y envíala a Google Drive o a tu aplicación de correo. El archivo se transfiere como el .opus original.

iPhone

La ruta en iPhone tiene una trampa: el método de reenviar y compartir (mantener pulsado, tocar reenviar, tocar el icono de compartir) vuelve a codificar la nota de voz a .m4a. Pierdes la secuencia Opus original.

Para conservar la codificación original, ve a Ajustes > Chats > Exportar chat, elige «Adjuntar multimedia» y guarda el ZIP resultante en Archivos. Dentro del ZIP, las notas de voz aparecen como archivos .opus con su codificación original intacta. Esta es la ruta que debes usar cuando importa la calidad de la transcripción.

WhatsApp graba las notas de voz a 16 kHz, 16 kbps, mono. Una nota de un minuto suele pesar entre 110 y 160 KB. La captura estrecha de frecuencias (hasta 8 kHz, fijada por la tasa de muestreo de 16 kHz) cubre todo lo necesario para la inteligibilidad del habla. Sí significa que la precisión de la transcripción es algo menor que la de una grabación capturada a velocidades de bits más altas, no porque falle una herramienta, sino porque el códec está operando cerca de su límite inferior.

Mensajes de voz de Telegram

En Telegram, un clic derecho en escritorio (o «Guardar en Descargas» en Android) te da el archivo .ogg original a ~32 kbps Opus, 48 kHz mono. Esto supone un paso adelante respecto a los 16 kbps de WhatsApp, notablemente más limpio para hablantes con acento o entornos ruidosos.

En iPhone, toca el icono de compartir del mensaje de voz y elige un destino de guardado. El archivo llega como .ogg con la secuencia Opus intacta.

Exportaciones de Audacity

Audacity exporta OGG Vorbis (no Opus) por defecto, usando velocidad de bits variable. El nivel de calidad 5 de 10 es el predeterminado; el archivo resultante es comparable en tamaño a un MP3 de 128 kbps pero con mejor calidad, porque Vorbis emplea más bits en el audio complejo y menos en el silencio.

Si vas a transcribir tus propias grabaciones de Audacity, también puedes exportar como Opus (Archivo > Exportar audio > Opus) y obtener archivos más pequeños a calidad equivalente. Cualquiera de las dos opciones funciona bien para transcribir.

Subir archivos OGG para transcripción

Los motores de transcripción modernos manejan tanto Vorbis como Opus dentro de contenedores .ogg o .opus directamente. No conviertas primero a MP3. Pasar un archivo Opus con pérdidas por un segundo codificador con pérdidas (incluso a MP3 de 192 kbps) descarta información de audio. Sube el original.

Si tienes una herramienta que rechaza el OGG y lanza un error de «códec no compatible»:

ffmpeg -i in.ogg -c:a libmp3lame -b:a 192k out.mp3

Eso convierte a MP3 por compatibilidad. Para pasar de Opus a Vorbis (sin salir del contenedor OGG):

ffmpeg -i in.opus -c:a libvorbis -q:a 6 out.ogg

Y si un archivo se reproduce bien pero las herramientas lo rechazan (cabeceras malformadas de codificadores antiguos), reempaquétalo sin volver a codificar:

ffmpeg -i broken.ogg -c:a copy fixed.ogg

Las notas de voz cortas (de menos de 2 minutos) terminan de transcribirse en menos de 30 segundos. Un artículo hablado completo de Wikipedia o una exportación de podcast de Audacity de 1 hora tardan entre 2 y 5 minutos.

Para quien necesite obtener transcripciones de los formatos estándar de notas de voz en iPhone, cómo transcribir notas de voz en iPhone cubre toda la ruta de exportación.

Tabla comparativa de formatos

FormatoCódecVelocidad de bits típicaTasa de muestreoContenedor
Nota de voz de WhatsAppOpus16 kbps16 kHz.opus
Mensaje de voz de TelegramOpus~32 kbps48 kHz.ogg
Mensaje de voz de DiscordOpus12-32 kbps48 kHz.ogg
Exportación predeterminada de AudacityVorbis VBR~128 kbps equiv.44.1 kHz.ogg
Artículo hablado de WikipediaVorbis96-128 kbps44.1 kHz.ogg
Podcast en MP3MP3128 kbps44.1 kHz.mp3

Opus a partir de 24 kbps transcribe con una precisión dentro del ~1,5% respecto al audio sin pérdidas. El techo de precisión para las notas de WhatsApp a 16 kbps es algo menor: fiable para hablantes claros en entornos silenciosos, variable para grabaciones con acento o ruido.

Para una visión más amplia de cómo comparan los formatos en todos los contenedores comunes, formatos de audio compatibles para transcripción abarca todo el panorama.

Trampas específicas del OGG

Huecos por DTX de Opus. Algunos codificadores Opus usan la Transmisión Discontinua (DTX), insertando paquetes de longitud cero de «ruido de confort» durante los silencios en lugar de datos de audio. Según la especificación OggOpus (RFC 7845), estos deberían resolverse en ocultación de pérdida de paquetes en el decodificador. La mayoría de los motores de transcripción modernos lo manejan correctamente. Si tu transcripción tiene huecos inexplicables en los límites de los silencios, prueba a eliminar y rellenar los silencios antes de subirlo:

ffmpeg -i in.ogg -af "silenceremove=stop_periods=-1:stop_duration=0.5:stop_threshold=-40dB" out.ogg

El error de «códec no compatible», en concreto con Opus. Algunas herramientas antiguas manejan Vorbis pero no Opus. Es especialmente habitual con archivos .ogg procedentes de apps de mensajería. ffprobe yourfile.ogg confirmará el códec. Si indica opus y tu herramienta lo rechaza, cambia de herramienta o conviértelo como se mostró arriba.

Archivos OGG multipista de motores de videojuegos. Algunos juegos (en especial los que usan el motor Godot o sistemas de streaming antiguos basados en Ogg) almacenan varias secuencias lógicas en un único contenedor. La mayoría de las herramientas de transcripción leen solo la primera secuencia. Si tu OGG proviene de un juego y estás intentando extraer diálogos, usa ffmpeg para extraer explícitamente la secuencia 0:

ffmpeg -i game_audio.ogg -map 0:a:0 extracted.ogg

Archivos de proyecto de Audacity frente a exportaciones. El formato de proyecto propio de Audacity, .aup3, es una base de datos SQLite, no un archivo OGG. Necesitas exportar explícitamente (Archivo > Exportar audio) para obtener un .ogg reproducible. Quienes usan Audacity por primera vez a veces intentan subir el archivo de proyecto y reciben un error.

Cuándo considerar otro formato

Si tú controlas la grabación y la calidad de la transcripción importa, graba a 32 kbps Opus o superior, o usa WAV sin comprimir para sesiones cortas. La diferencia entre una nota de WhatsApp de 16 kbps y una grabación Opus de 64 kbps es perceptible tanto para el oído humano como para el motor de transcripción.

Si solo necesitas una transcripción limpia de un audio que grabaste tú mismo (y no notas de voz de otras personas), ConvertAudioToText acepta WAV, MP3, MP4, OGG y la mayoría de los demás contenedores; el desglose del coste de la transcripción por hora vale la pena leerlo si estás sopesando planes gratuitos frente a los de pago para trabajo por lotes.

Preguntas frecuentes

¿Es OGG Opus mejor que MP3 para la transcripción?

A velocidades de bits inferiores a 64 kbps, sí. Opus alcanza una precisión de reconocimiento de voz a unos 1,5 puntos porcentuales de la calidad sin pérdidas desde los 24 kbps en adelante, mientras que MP3 a esas velocidades suena notablemente degradado. Por encima de 128 kbps, ambos formatos son prácticamente equivalentes para efectos de transcripción. Para la voz en concreto, Opus tiene una ventaja clara en las velocidades bajas que las apps de mensajería realmente usan.

¿Puedo transcribir mensajes de voz de Discord gratis?

Sí. Haz clic derecho sobre el mensaje de voz en Discord, copia el enlace y descarga el archivo .ogg, o usa la opción «Guardar como» de Discord. Súbelo a una herramienta de transcripción; ConvertAudioToText transcribe los primeros 10 minutos sin ningún registro, y una cuenta gratuita añade 10 minutos de transcripción otorgados una sola vez. Para volúmenes mayores hay planes de pago disponibles.

¿Por qué mi nota de voz de WhatsApp suena bien pero se transcribe mal?

WhatsApp graba a 16 kbps, 16 kHz mono. A esa velocidad de bits, Opus está optimizado para la inteligibilidad del habla ante el oído humano, que tolera más compresión que los sistemas de reconocimiento automático de voz. Los acentos marcados, el ruido de fondo o el habla rápida que el oído completa por contexto son justo los casos en los que el límite inferior del códec perjudica la precisión de la transcripción. Con un audio que ya has recibido no puedes hacer nada; para tus propias grabaciones, usa una app de notas de voz que grabe a una velocidad de bits mayor.

¿Un archivo .opus funciona igual que un .ogg para transcribir?

Sí. El .opus es una secuencia de audio Opus dentro de un contenedor OGG, solo que con la extensión más específica que recomienda oficialmente la Xiph.Org Foundation. El formato del archivo es idéntico al de un .ogg que contenga audio Opus. Cualquier herramienta que acepte uno debería aceptar el otro. Si una herramienta rechaza específicamente los .opus basándose solo en la extensión, renómbralo a .ogg e inténtalo de nuevo; el códec no cambia.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles