Excluye tu audio del entrenamiento de IA: guía por proveedor (2026)
entrenamiento de IAprivacidadexclusión voluntaria

Excluye tu audio del entrenamiento de IA: guía por proveedor (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202615 min read

Summarize this article with:

TL;DR

La mayoría de las APIs de transcripción no entrenan con tu audio por defecto, pero varios servicios orientados al consumidor sí lo hacen, siendo Otter.ai el caso más controvertido con litigios activos. Deepgram hace que el entrenamiento sea opcional con un parámetro de consulta; el registro de datos de Google también es opcional. La posición más arriesgada es usar un producto que entrena por defecto y oculta la opción de exclusión. El lenguaje contractual en un DPA es la protección más sólida, por encima de cualquier interruptor de la aplicación.

Most transcription services don't train on your audio by default. But "most" is not "all," and the ones that do rarely lead with that fact. This guide walks through what each major provider actually does, verified against current policy pages as of July 2026, with the opt-out path where one exists.

Why It Matters More Than You Think

When your audio enters a training pipeline, two things happen that are hard to undo:

  1. The model learns statistical patterns from your content, including domain vocabulary, speaker styles, and sometimes sensitive subject matter.
  2. Removing your contribution later is not possible. You can delete the original file; the model's weights still carry its influence.

For podcasts and meeting notes, this is a low concern. For client calls, medical conversations, internal strategy, or source-protected interviews, it is a real exposure. The question is not just "is my audio stored?" but "is my audio teaching something?"

See is AI transcription private for the broader picture beyond training.

Three Categories of Provider

Category 1: Structural non-training. The service uses a pretrained model in inference mode. Your audio is processed and discarded. There is no training pipeline the provider could insert your data into, regardless of policy.

Category 2: Opt-in training. Training is off by default. You can volunteer data, sometimes in exchange for discounts or accuracy improvements.

Category 3: Default-on training. Your audio goes into the training pipeline unless you actively opt out. These providers require the most attention.

Category 3 is the worst posture. Category 1 is the simplest to trust. Category 2 is fine if you verify the default is genuinely off.

Per-Provider Reality

Proveedor¿Activado por defecto en el entrenamiento?Vía de exclusiónNotas
OpenAI Whisper APINoNo es necesarioLos datos de la API se excluyen del entrenamiento por defecto
DeepgramNo (opt-in)Parámetro de consulta mip_opt_out=trueLos participantes obtienen precios con descuento
Google Cloud STTNo (opt-in)Desactivar desde Cloud ConsoleEl registro de datos es opt-in; precios más bajos para participantes
AWS TranscribeNo (opt-in)Desactivado por defectoEl Programa de Mejora del Servicio es opt-in
Otter.aiNo está claro / contactar con soporteSe usa audio anonimizado; litigio federal activo (2025-2026)
Rev.comSí (IA propietaria)Escribir a support@rev.comLos datos se usan de forma anónima para la IA interna de Rev; los LLM de terceros quedan excluidos
Fireflies.aiNoNo es necesarioPolítica de retención de datos cero; los proveedores tienen prohibición contractual
DescriptNo (opt-in)Desactivado por defectoLos modelos de producción no usan datos de usuarios; el opt-in es solo para I+D
Happy ScribeContactar con dataprotection@happyscribe.comLa política de privacidad permite el entrenamiento de ML bajo "intereses legítimos"
TurboScribeNoNo es necesarioPolítica explícita: sin entrenamiento de IA con medios o transcripciones de usuarios

Las políticas cambian. Verifica los términos vigentes antes de confiar en esta tabla. Fechas de consulta: julio de 2026.

Conoce la política de entrenamiento antes de este paso, no después
Conoce la política de entrenamiento antes de este paso, no después

OpenAI Whisper API

Los datos de la API se excluyen del entrenamiento por defecto. La página de privacidad empresarial de OpenAI se compromete a que los datos enviados a través de la API no se usan para entrenar modelos. Esto aplica a todos los clientes de la API, incluido el endpoint de Whisper. No hace falta ningún interruptor de exclusión porque el valor por defecto ya es estar desactivado.

Ojo con la distinción: esto es la API. El producto de consumo ChatGPT de OpenAI tiene una política distinta y, históricamente, ha usado datos de conversaciones para entrenar salvo que se desactivara desde los ajustes de la cuenta.

La retención de datos cero (ZDR, por sus siglas en inglés) está disponible para clientes empresariales que cumplan los requisitos en endpoints compatibles, donde los datos se procesan en memoria y no se conservan después de la solicitud. La ZDR no es un interruptor de autoservicio; requiere trabajar con tu equipo de cuenta.

Verificado en: openai.com/policies, julio de 2026.

Deepgram

La formación es opcional mediante el Programa de Asociación para la Mejora de Modelos. Los clientes estándar no están inscritos por defecto. Para excluir explícitamente una solicitud, añade mip_opt_out=true como parámetro de consulta en cualquier llamada a la API. Los datos de las solicitudes excluidas se conservan solo el tiempo necesario para completar la solicitud.

Los participantes del programa reciben precios con descuento; excluirse no conlleva penalización, simplemente significa renunciar al descuento de participante. Si no quieres asumir ningún riesgo de formación, añade el parámetro y acepta los precios estándar.

Verificado en: developers.deepgram.com/docs/the-deepgram-model-improvement-partnership-program, julio de 2026.

Para un desglose completo de los precios de los niveles de Deepgram, consulta Deepgram Nova-3 explicado.

Google Cloud Speech-to-Text

El registro de datos es opcional. Esto es lo contrario de lo que implicaba la versión anterior de esta publicación. Los clientes que NO activan el registro de datos ven su audio procesado y descartado; no se almacena para la mejora de modelos. Se ofrece un precio más bajo a los clientes que se activan.

Si alguna vez has activado el registro de datos en un proyecto, los datos registrados antes de desactivarlo permanecen en los sistemas de Google. Las solicitudes futuras no se registran una vez que lo desactivas, pero el registro histórico no se puede recuperar.

Ruta para verificar: Consola de Cloud, APIs y Servicios, API de Cloud Speech, pestaña Registro de datos. Confirma que está desactivado. Haz una captura de pantalla.

Comprobado contra: docs.cloud.google.com/speech-to-text/docs/enable-data-logging, julio de 2026.

AWS Transcribe

El programa de mejora de servicios de AWS es de suscripción voluntaria. Los datos de los clientes no se utilizan para mejorar los modelos salvo que te inscribas activamente. Según la documentación de AWS, el valor predeterminado para los clientes de API es no participar en el entrenamiento de mejora de servicios.

Si tu cuenta ha tenido alguna suscripción voluntaria activada, verifícalo a través del panel de estado de servicios de AWS o en la consola de AWS, en las preferencias de tu cuenta.

Comprobado contra: documentación de AWS, julio de 2026.

Otter.ai

Otter entrena con audio de clientes anonimizado por defecto. Su política de privacidad declara explícitamente que utiliza "información de reuniones y archivos subidos", incluyendo grabaciones de audio y transcripciones, para entrenar su IA propietaria, tras un proceso de anonimización. No intervienen revisores humanos, pero el entrenamiento en sí es automático y está activado por defecto.

Mi opinión: la afirmación de anonimización es precisamente lo que se está cuestionando en una demanda colectiva federal activa (presentada en diciembre de 2025, aún en curso a julio de 2026) que alega que Otter grabó conversaciones privadas y las usó para entrenar modelos sin consentimiento adecuado. "Anonimizado" no es lo mismo que "no utilizado". Hasta que se resuelva ese litigio, trataría a Otter como Categoría 3 y asumiría que el entrenamiento está activado por defecto.

La vía de exclusión no es un simple interruptor en los ajustes. Tendrías que contactar directamente con Otter; el enlace "No vender ni compartir mi información personal" del pie de página cubre los derechos de privacidad de California de forma amplia, pero no se corresponde de manera clara con el entrenamiento con audio.

Comprobado contra: otter.ai/privacy-policy, julio de 2026.

Rev.com

Rev utiliza los datos de los clientes de forma anónima para entrenar su propia IA propietaria, según su política de privacidad. Esto no es entrenamiento con LLM de terceros; Rev afirma que no comparte datos con proveedores externos de IA para entrenamiento. Pero sus modelos internos de IA sí aprenden de las transcripciones de los clientes.

Los clientes pueden optar por no participar enviando un correo a support@rev.com. No hay ningún interruptor dentro del producto; envías la solicitud por correo y queda registrada en sus archivos.

Para la transcripción humana en Rev, se aplican otras consideraciones: personas reales revisan tu audio. Rev examina a sus transcriptores y les hace firmar acuerdos de confidencialidad, pero la cuestión es que ojos (y oídos) humanos llegan al contenido. Elige la transcripción con IA en Rev si quieres evitar la revisión humana.

Vía de exclusión: envía un correo a support@rev.com solicitando que excluyan tus datos del entrenamiento.

Verificado en: rev.com/security, support.rev.com/hc/en-us/articles/19509652584717-AI-Training-Opt-Out, julio de 2026.

Fireflies.ai

Fireflies prohíbe explícitamente el entrenamiento de IA con datos de reuniones de clientes. Su política de privacidad (actualizada el 6 de marzo de 2026) indica que no utiliza información personal para entrenar modelos de IA y aplica retención cero de datos con sus proveedores, lo que significa que los procesadores externos no pueden almacenar el contenido de las reuniones tras la entrega. Los proveedores tienen prohibido contractualmente entrenar con esos datos.

No hace falta optar por no participar; es una política de base, no un compromiso de adhesión voluntaria.

Verificado en: fireflies.ai/privacy-policy, julio de 2026.

Descript

Los modelos de producción en Descript no usan datos de clientes. Los modelos internos de I+D solo usan datos de usuarios que han aceptado compartir su información. No hay planes de usar datos de usuarios que hayan optado por no participar en ninguna fase.

Un matiz: las funciones de voz con IA (la herramienta de clonación de voz Overdub) usan datos de voz con seudonimización para investigación en tecnología de voz. Si usas transcripción general, esto no te afecta.

Verificado en: descript.com/privacy, julio de 2026.

Happy Scribe

Happy Scribe sí entrena modelos de aprendizaje automático con contenido de clientes. Su política de privacidad, en la sección II (Datos de contenido), afirma: "Podremos almacenar el Contenido para entrenar nuestros algoritmos de aprendizaje automático". La base legal que se invoca son los "intereses legítimos" según el RGPD.

No se describe ningún mecanismo explícito de exclusión voluntaria en el documento de la política. Bajo el RGPD, los usuarios pueden oponerse al tratamiento basado en intereses legítimos, pero Happy Scribe no ha publicado una vía de autoservicio. Contacta con dataprotection@happyscribe.com si necesitas esto por escrito.

Happy Scribe es una empresa constituida en la UE con centros de datos en la UE, lo que ofrece cierta protección procesal, pero la residencia en la UE no elimina el uso para entrenamiento.

Verificado contra: happyscribe.com/privacy, julio de 2026.

TurboScribe

La política de TurboScribe establece explícitamente que no entrena modelos de IA o de aprendizaje automático con los archivos multimedia o las transcripciones de los usuarios. No se necesita ninguna exclusión voluntaria. El servicio ejecuta Whisper en modo de inferencia.

Verificado contra: turboscribe.ai/privacy, julio de 2026.

Cómo Verificar que la Afirmación es Real

Una declaración en la política es un punto de partida, no una garantía. Las comprobaciones prácticas:

  1. Lee los términos de servicio y la política de privacidad actuales. Busca la palabra específica "entrenar" o "aprendizaje automático" en ambos documentos. Un lenguaje vago como "mejorar nuestros servicios" sin aclaración es una señal para hacer preguntas de seguimiento.
  2. Comprueba la fecha de actualización de la política de privacidad. Una política actualizada por última vez en 2022 puede no reflejar las prácticas actuales.
  3. Solicita confirmación por escrito. Envía un correo al soporte y pregunta específicamente: "¿Entran mis datos de audio en algún proceso de entrenamiento de modelos?". La respuesta queda registrada.
  4. Consigue un DPA con lenguaje explícito de no entrenamiento. Para clientes empresariales, el Acuerdo de Tratamiento de Datos es el mecanismo contractual. Incluye lenguaje como: "El proveedor no utilizará los datos del cliente, incluidos los registros de audio o las transcripciones, para entrenar, ajustar o mejorar de cualquier otro modo ningún modelo de inteligencia artificial, salvo con el consentimiento expreso por escrito del cliente". Esto es ejecutable; un interruptor no lo es.
  5. Mira qué modelo se utiliza. Si el proveedor indica Whisper Large-v3, un modelo preentrenado de OpenAI, no puede ajustarlo fácilmente con tus datos. Los modelos propietarios de extremo a extremo son más difíciles de auditar.

Para más información sobre cómo son tus opciones contractuales en la práctica, consulta acuerdos de transcripción y confidencialidad.

El argumento estructural contra el entrenamiento

La reclamación de privacidad más sólida no se basa en políticas, sino en la arquitectura. Si un servicio utiliza un modelo fundacional como Whisper Large-v3 en modo de inferencia pura, el proveedor carece de la infraestructura necesaria para incorporar tu audio a las actualizaciones de entrenamiento. Entrenar Whisper requiere la configuración original de OpenAI; reentrenar con audio de clientes no es algo que una empresa SaaS típica haga.

Por eso los proveedores de modelos preentrenados como TurboScribe y las herramientas basadas en la API de Whisper se sitúan en la Categoría 1. La afirmación es estructural, no solo una declaración en un documento.

Si necesitas la máxima garantía, transcripción en el dispositivo frente a la nube aborda el caso de autoalojar Whisper en tu propio hardware, donde el modelo nunca sale de tu entorno.

La posición de ConvertAudioToText

Si necesitas una transcripción limpia sin un bot de reuniones ni un pipeline de entrenamiento propietario que toque tus datos, ConvertAudioToText utiliza Whisper Large-v3 y AssemblyAI solo en modo de inferencia. Ninguno de los dos pipelines se reentrena con audio de clientes. Las cuentas de empresa pueden solicitar un DPA con una cláusula explícita de no entrenamiento.

El marco de decisión

  1. ¿Es sensible tu audio? Si no lo es, la mayoría de los proveedores reputados funcionan bien.
  2. Si lo es: comprueba si el proveedor entrena por defecto (Otter, Happy Scribe, la IA propietaria de Rev) y, o bien opta por no participar, o elige otro proveedor.
  3. ¿Necesitas una cláusula contractual de no entrenamiento? Consigue un DPA que la incluya, no solo un interruptor en la aplicación.
  4. ¿Necesitas una garantía estructural de no entrenamiento? Elige un proveedor que use modelos preentrenados en modo de inferencia (herramientas basadas en Whisper, TurboScribe, Fireflies).
  5. ¿Es el contenido extraordinariamente sensible? Autoaloja Whisper en tu propio hardware.

Para contextos regulados por el GDPR, consulta transcripción conforme al GDPR para el marco regulatorio, que implica más que una simple política de formación.

Preguntas frecuentes

¿Usa OpenAI el audio de la API de Whisper para entrenar sus modelos?

No. La política de privacidad empresarial de OpenAI establece que los datos enviados a través de la API no se utilizan para entrenar modelos. Esto se aplica por defecto a todos los clientes de la API, incluidos aquellos que usan el endpoint de Whisper. No necesitas hacer nada para excluirte; la opción ya viene desactivada de serie. La retención de datos cero está disponible para clientes empresariales que quieran una garantía adicional.

¿Cómo puedo excluirme del entrenamiento de modelos de Deepgram?

El programa de mejora de modelos de Deepgram es de adhesión voluntaria, lo que significa que no estás inscrito por defecto. Si quieres excluir explícitamente solicitudes individuales de la API, añade mip_opt_out=true como parámetro de consulta. Los datos de las solicitudes excluidas se conservan únicamente durante el tiempo necesario para procesarlas. Los participantes del programa reciben precios reducidos, pero excluirte no conlleva ninguna penalización.

¿Entrena Otter.ai con mis grabaciones de reuniones?

Sí, según la política de privacidad de Otter. Otter entrena su IA propietaria con grabaciones de audio y transcripciones de reuniones de clientes, previamente anonimizadas. El entrenamiento es automático y está activado por defecto. Una demanda colectiva federal activa presentada en 2025 cuestiona si esta práctica cumplió con los estándares de consentimiento informado. Si el entrenamiento con el contenido de tus reuniones es inaceptable, esta es una razón sólida para elegir otro proveedor.

¿Está activado el registro de datos de Google Cloud Speech-to-Text por defecto?

No. El registro de datos de Google Cloud Speech-to-Text es opcional. A menos que lo hayas activado manualmente en tu consola de Cloud, tu audio se procesa y se descarta. Los clientes que optan por activarlo obtienen precios más bajos a cambio de contribuir con datos. Si tienes un proyecto existente donde el registro pudo haberse activado anteriormente, verifica la configuración actual en la consola de Cloud, en APIs y servicios, API de Cloud Speech, pestaña de registro de datos.

¿Cuál es la protección más sólida frente a que un proveedor entrene con mi audio?

La combinación de dos cosas: un DPA con lenguaje contractual explícito que prohíba el entrenamiento, y elegir un proveedor cuya arquitectura técnica haga estructuralmente inviable entrenar con tus datos (como uno que use un modelo Whisper preentrenado en modo solo inferencia). Un DPA se puede hacer valer ante los tribunales; un interruptor en la aplicación no. El no entrenamiento estructural (sin infraestructura de entrenamiento, modelo solo preentrenado) es más difícil de eludir incluso si la política cambia más adelante.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles