Refuser l'entraînement IA avec votre audio : guide par fournisseur (2026)
entraînement IAconfidentialitéopposition

Refuser l'entraînement IA avec votre audio : guide par fournisseur (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202616 min read

Summarize this article with:

TL;DR

La plupart des API de transcription n'entraînent pas leurs modèles sur votre audio par défaut, mais plusieurs services grand public le font, Otter.ai étant le cas le plus contesté dans un litige en cours. Deepgram rend l'entraînement facultatif via un paramètre de requête ; la journalisation des données de Google est aussi facultative. La position la plus risquée, c'est d'utiliser un produit qui entraîne par défaut et qui cache l'option de refus. Le langage contractuel dans un DPA offre la protection la plus solide, bien au-dessus de tout réglage dans l'application.

La plupart des services de transcription n'entraînent pas leurs modèles sur votre audio par défaut. Mais « la plupart » ne veut pas dire « tous », et ceux qui le font le mentionnent rarement en premier. Ce guide détaille ce que chaque grand fournisseur fait réellement, vérifié sur les pages de politique en vigueur en juillet 2026, avec le chemin de désactivation quand il existe.

Pourquoi c'est plus important que vous ne le pensez

Quand votre audio entre dans un pipeline d'entraînement, deux choses se produisent, difficiles à annuler :

  1. Le modèle apprend des motifs statistiques à partir de votre contenu, y compris le vocabulaire de votre domaine, les styles de locuteurs et parfois des sujets sensibles.
  2. Retirer votre contribution plus tard est impossible. Vous pouvez supprimer le fichier original ; les poids du modèle conservent son influence.

Pour les podcasts et les notes de réunion, c'est un faible risque. Pour les appels clients, les conversations médicales, la stratégie interne ou les interviews protégées par des sources, c'est une vraie exposition. La question n'est pas seulement « mon audio est-il stocké ? » mais « mon audio sert-il à apprendre quelque chose ? »

Voir la transcription IA est-elle privée pour une vue d'ensemble au-delà de l'entraînement.

Trois catégories de fournisseurs

Catégorie 1 : non-entraînement structurel. Le service utilise un modèle pré-entraîné en mode inférence. Votre audio est traité puis supprimé. Il n'existe aucun pipeline d'entraînement dans lequel le fournisseur pourrait insérer vos données, quelle que soit la politique.

Catégorie 2 : entraînement sur option. L'entraînement est désactivé par défaut. Vous pouvez fournir des données volontairement, parfois en échange de réductions ou d'améliorations de précision.

Catégorie 3 : entraînement activé par défaut. Votre audio entre dans le pipeline d'entraînement sauf si vous vous désactivez activement. Ces fournisseurs exigent le plus d'attention.

La catégorie 3 est la pire posture. La catégorie 1 est la plus simple à faire confiance. La catégorie 2 est acceptable si vous vérifiez que le défaut est réellement désactivé.

Réalité par fournisseur

FournisseurActivé par défaut à l'entraînement ?Chemin de désactivationRemarques
API OpenAI WhisperNonInutileDonnées API exclues de l'entraînement par défaut
DeepgramNon (sur option)Paramètre de requête mip_opt_out=trueTarifs réduits pour les participants
Google Cloud STTNon (sur option)Désactivation via la console CloudJournalisation des données sur option, tarifs réduits pour les participants
AWS TranscribeNon (sur option)Désactivé par défautProgramme d'amélioration du service sur option
Otter.aiOuiFlou, contacter le supportAudio désidentifié utilisé, litige fédéral en cours (2025-2026)
Rev.comOui (IA propriétaire)Écrire à support@rev.comDonnées utilisées anonymement pour l'IA interne de Rev, LLM tiers exclus
Fireflies.aiNonInutilePolitique de rétention zéro donnée, fournisseurs contractuellement interdits
DescriptNon (sur option)Désactivé par défautLes modèles de production n'utilisent aucune donnée utilisateur, R&D sur option uniquement
Happy ScribeOuiContacter dataprotection@happyscribe.comLa politique de confidentialité autorise l'entraînement ML sous « intérêts légitimes »
TurboScribeNonInutilePolitique explicite, aucun entraînement IA sur les médias ou transcriptions utilisateur

Les politiques évoluent. Vérifiez les conditions actuelles avant de vous fier à ce tableau. Dates vérifiées : juillet 2026.

Connaissez la politique d'entraînement avant cette étape, pas après
Connaissez la politique d'entraînement avant cette étape, pas après

API OpenAI Whisper

Les données API sont exclues de l'entraînement par défaut. La page de confidentialité entreprise d'OpenAI s'engage à ce que les données soumises via l'API ne servent pas à entraîner les modèles. Cela s'applique à tous les clients API, y compris le point de terminaison Whisper. Aucune bascule de désactivation n'est requise, car l'option est déjà désactivée par défaut.

Notez la distinction : il s'agit de l'API. Le produit grand public ChatGPT d'OpenAI suit une politique différente et a historiquement utilisé les données de conversation pour l'entraînement, sauf désactivation via les paramètres du compte.

Zéro conservation des données (ZDR) est disponible pour les clients entreprise éligibles sur les endpoints pris en charge, où les données sont traitées en mémoire et non conservées après la requête. ZDR n'est pas une option à activer soi-même, cela nécessite de travailler avec votre équipe de compte.

Vérifié sur : openai.com/policies, juillet 2026.

Deepgram

L'entraînement est sur option via le programme de partenariat pour l'amélioration des modèles. Les clients standard ne sont pas inscrits par défaut. Pour exclure explicitement une requête, ajoutez mip_opt_out=true comme paramètre de requête à tout appel API. Les données des requêtes exclues ne sont conservées que le temps nécessaire pour traiter la requête.

Les participants au programme bénéficient d'un tarif réduit, se désengager n'entraîne aucune pénalité, cela signifie simplement renoncer à la remise participant. Si vous ne voulez aucun risque d'entraînement, ajoutez le paramètre et acceptez le tarif standard.

Vérifié sur : developers.deepgram.com/docs/the-deepgram-model-improvement-partnership-program, juillet 2026.

Pour une ventilation complète des tarifs des niveaux Deepgram, voir Deepgram Nova-3 expliqué.

Google Cloud Speech-to-Text

La journalisation des données est sur option. C'est l'inverse de ce que la version précédente de cet article laissait entendre. Les clients qui n'activent PAS la journalisation des données voient leur audio traité puis supprimé, il n'est pas stocké pour l'amélioration des modèles. Un tarif inférieur est proposé aux clients qui s'inscrivent.

Si vous avez déjà activé la journalisation des données sur un projet, les données journalisées avant sa désactivation restent dans les systèmes de Google. Les requêtes futures ne sont plus journalisées une fois désactivée, mais la journalisation historique ne peut pas être rappelée.

Chemin pour vérifier : Console Cloud, APIs et Services, API Cloud Speech, onglet Journalisation des données. Confirmez qu'elle est désactivée. Prenez une capture d'écran.

Vérifié par rapport à : docs.cloud.google.com/speech-to-text/docs/enable-data-logging, juillet 2026.

AWS Transcribe

Le programme d'amélioration des services d'AWS est sur la base du volontariat. Les données clients ne sont pas utilisées pour améliorer les modèles, sauf si vous vous inscrivez activement. Selon la documentation AWS, par défaut, les clients API ne participent pas à l'entraînement lié à l'amélioration des services.

Si une option d'inscription a déjà été activée sur votre compte, vérifiez via le tableau de bord AWS Service Health ou la console AWS, dans les préférences de votre compte.

Vérifié par rapport à : documentation AWS, juillet 2026.

Otter.ai

Otter entraîne ses modèles sur des données audio clients dépersonnalisées par défaut. Sa politique de confidentialité indique explicitement qu'elle utilise les « informations de réunion et téléchargées », y compris les enregistrements audio et les transcriptions, pour entraîner son IA propriétaire, après un processus de dépersonnalisation. Aucun réviseur humain n'est impliqué, mais l'entraînement lui-même est automatique et activé par défaut.

Mon avis : la revendication de dépersonnalisation est précisément ce qui est contesté dans le cadre d'une action collective fédérale en cours (déposée en décembre 2025, toujours en cours en juillet 2026), qui allègue qu'Otter a enregistré des conversations privées et les a utilisées pour entraîner ses modèles sans consentement adéquat. « Dépersonnalisé » ne signifie pas « non utilisé ». Tant que ce litige n'est pas résolu, je considérerais Otter comme relevant de la catégorie 3 et je partirais du principe que l'entraînement est activé par défaut.

La voie de désinscription n'est pas un simple réglage dans les paramètres. Vous devez contacter Otter directement ; le lien « Ne pas vendre ni partager mes informations personnelles » en pied de page couvre largement les droits à la confidentialité en Californie, mais ne correspond pas clairement à l'entraînement sur les données audio.

Vérifié par rapport à : otter.ai/privacy-policy, juillet 2026.

Rev.com

Rev utilise les données clients de manière anonyme pour entraîner sa propre IA propriétaire, selon sa politique de confidentialité. Il ne s'agit pas d'un entraînement par un LLM tiers ; Rev précise qu'elle ne partage pas les données avec des fournisseurs d'IA externes à des fins d'entraînement. Mais ses modèles internes apprennent bien à partir des transcriptions clients.

Les clients peuvent se désinscrire en envoyant un e-mail à support@rev.com. Il n'y a pas de bouton dans le produit ; vous envoyez la demande par e-mail et elle est consignée dans leurs dossiers.

Pour la transcription humaine chez Rev, un autre ensemble de préoccupations s'applique : de vraies personnes écoutent votre audio. Rev vérifie ses transcripteurs et leur fait signer des accords de confidentialité, mais le fait demeure que des yeux (et des oreilles) humains atteignent le contenu. Choisissez la transcription par IA chez Rev si vous voulez éviter l'examen humain.

Voie de désinscription : envoyez un e-mail à support@rev.com avec une demande d'exclusion de vos données de l'entraînement.

Vérifié sur : rev.com/security, support.rev.com/hc/en-us/articles/19509652584717-AI-Training-Opt-Out, juillet 2026.

Fireflies.ai

Fireflies interdit explicitement l'entraînement de l'IA sur les données de réunions des clients. Sa politique de confidentialité (mise à jour le 6 mars 2026) stipule qu'elle n'utilise pas les informations personnelles pour l'entraînement des modèles d'IA et impose une rétention de données nulle avec ses fournisseurs, ce qui signifie que les processeurs tiers ne peuvent pas stocker le contenu des réunions après la livraison. Les fournisseurs sont contractuellement interdits d'entraîner leurs modèles sur ces données.

Aucune désinscription n'est nécessaire ; c'est une politique de base, pas un engagement sur option.

Vérifié sur : fireflies.ai/privacy-policy, juillet 2026.

Descript

Les modèles de production chez Descript n'utilisent aucune donnée client. Les modèles de R&D internes n'utilisent que les données des utilisateurs qui ont choisi de partager leurs données. Il n'y a aucun projet d'utiliser les données des utilisateurs désinscrits à quelque étape que ce soit.

La seule nuance : les fonctionnalités vocales par IA (l'outil de clonage vocal Overdub) utilisent les données vocales avec désidentification pour la recherche sur la technologie vocale. Si vous utilisez la transcription générale, cela ne s'applique pas.

Vérifié sur : descript.com/privacy, juillet 2026.

Happy Scribe

Happy Scribe entraîne effectivement des modèles d'apprentissage automatique sur le contenu des clients. Sa politique de confidentialité, sous la section II (Données de contenu), déclare : « Nous serons en mesure de stocker le Contenu pour entraîner nos algorithmes d'apprentissage automatique. » La base juridique invoquée est celle des « intérêts légitimes » au titre du RGPD.

Aucun mécanisme explicite de désinscription n'est décrit dans le document de politique. En vertu du RGPD, les utilisateurs peuvent s'opposer au traitement fondé sur des intérêts légitimes, mais Happy Scribe n'a pas publié de parcours en libre-service. Contactez dataprotection@happyscribe.com si vous avez besoin de cette confirmation par écrit.

Happy Scribe est une société immatriculée dans l'UE avec des centres de données européens, ce qui offre une certaine protection procédurale, mais la résidence dans l'UE n'élimine pas l'utilisation à des fins d'entraînement.

Vérifié sur : happyscribe.com/privacy, juillet 2026.

TurboScribe

La politique de TurboScribe indique explicitement qu'elle n'entraîne pas de modèles d'IA ou d'apprentissage automatique sur les fichiers média ou les transcriptions des utilisateurs. Aucune désinscription n'est nécessaire. Le service exécute Whisper en mode inférence.

Vérifié sur : turboscribe.ai/privacy, juillet 2026.

Comment vérifier que l'affirmation est réelle

Une déclaration de politique est un point de départ, pas une garantie. Les vérifications pratiques :

  1. Lisez les conditions d'utilisation et la politique de confidentialité en vigueur. Cherchez le mot précis « entraîner » ou « apprentissage automatique » dans les deux documents. Un langage vague comme « améliorer nos services » sans précision est un signal pour poser des questions de suivi.
  2. Vérifiez la date de mise à jour de la politique de confidentialité. Une politique mise à jour pour la dernière fois en 2022 peut ne pas refléter les pratiques actuelles.
  3. Demandez une confirmation écrite. Envoyez un e-mail au support et demandez précisément : « Mes données audio entrent-elles dans un pipeline d'entraînement de modèles ? » La réponse devient une trace écrite.
  4. Obtenez un DPA avec un langage explicite de non-entraînement. Pour les clients professionnels, l'accord de traitement des données est le mécanisme contractuel. Incluez un langage tel que : « Le fournisseur ne doit pas utiliser les données du client, y compris les enregistrements audio ou les transcriptions, pour entraîner, affiner ou autrement améliorer un quelconque modèle d'intelligence artificielle, sauf avec le consentement écrit exprès du client. » Cela est exécutoire ; un bouton à bascule ne l'est pas.
  5. Examinez le modèle utilisé. Si le fournisseur indique Whisper Large-v3, un modèle pré-entraîné d'OpenAI, il ne peut pas facilement l'affiner sur vos données. Les modèles propriétaires de bout en bout sont plus difficiles à auditer.

Pour en savoir plus sur vos options contractuelles concrètes, consultez les accords de transcription et de confidentialité.

L'argument structurel contre l'entraînement

La revendication de confidentialité la plus solide ne repose pas sur une politique, mais sur l'architecture. Si un service utilise un modèle de fondation comme Whisper Large-v3 en mode inférence pure, le fournisseur n'a pas l'infrastructure nécessaire pour intégrer votre audio dans des mises à jour d'entraînement. Entraîner Whisper exige la configuration d'entraînement originale d'OpenAI ; ré-entraîner sur l'audio des clients n'est pas une pratique courante pour une entreprise SaaS classique.

C'est pourquoi les fournisseurs de modèles pré-entraînés comme TurboScribe et les outils basés sur l'API Whisper se situent dans la catégorie 1. Cette affirmation est structurelle, pas seulement une déclaration dans un document.

Si vous avez besoin d'une garantie maximale, la transcription sur appareil ou dans le cloud couvre le cas de l'auto-hébergement de Whisper sur votre propre matériel, où le modèle ne quitte jamais votre environnement.

La position de ConvertAudioToText

Si vous avez besoin d'une transcription propre sans bot de réunion ni pipeline d'entraînement propriétaire qui touche à vos données, ConvertAudioToText utilise Whisper Large-v3 et AssemblyAI en mode inférence uniquement. Aucun des deux pipelines n'est ré-entraîné sur l'audio des clients. Les comptes professionnels peuvent demander un DPA avec une clause explicite de non-entraînement.

Le cadre de décision

  1. Votre audio est-il sensible ? Si non, la plupart des fournisseurs réputés conviennent parfaitement.
  2. Si oui : vérifiez si le fournisseur entraîne par défaut (Otter, Happy Scribe, l'IA propriétaire de Rev) et désactivez cette option ou choisissez un autre fournisseur.
  3. Avez-vous besoin d'une clause contractuelle de non-entraînement ? Obtenez un DPA qui l'inclut, pas seulement un interrupteur dans l'application.
  4. Avez-vous besoin d'une garantie structurelle de non-entraînement ? Choisissez un fournisseur qui utilise des modèles pré-entraînés en mode inférence (outils basés sur Whisper, TurboScribe, Fireflies).
  5. Le contenu est-il extraordinairement sensible ? Auto-hébergez Whisper sur votre propre matériel.

Pour les contextes régis par le RGPD, consultez la transcription conforme au RGPD pour le cadre réglementaire, qui va au-delà de la simple politique de formation.

FAQ

OpenAI utilise-t-il l'audio de l'API Whisper pour entraîner ses modèles ?

Non. La politique de confidentialité d'OpenAI pour les entreprises stipule que les données soumises via l'API ne sont pas utilisées pour entraîner les modèles. Cela s'applique par défaut à tous les clients de l'API, y compris ceux qui utilisent le point de terminaison Whisper. Vous n'avez rien à faire pour vous désinscrire, le défaut est déjà désactivé. La conservation zéro donnée (Zero Data Retention) est disponible pour les clients professionnels qui souhaitent une garantie supplémentaire.

Comment me désinscrire de l'entraînement des modèles de Deepgram ?

Le programme d'amélioration des modèles de Deepgram (Model Improvement Partnership Program) est sur la base du volontariat, ce qui signifie que vous n'y êtes pas inscrit par défaut. Si vous souhaitez exclure explicitement des requêtes API individuelles, ajoutez mip_opt_out=true comme paramètre de requête. Les données des requêtes désinscrites ne sont conservées que le temps nécessaire au traitement de la requête. Les participants au programme bénéficient d'un tarif réduit, mais se désinscrire n'entraîne aucune pénalité.

Otter.ai entraîne-t-il ses modèles sur mes enregistrements de réunions ?

Oui, conformément à la politique de confidentialité d'Otter. Otter entraîne son IA propriétaire sur des enregistrements audio et des transcriptions anonymisés issus des réunions de ses clients. L'entraînement est automatique et activé par défaut. Une action collective fédérale déposée en 2025 conteste si cette pratique respectait les normes de consentement éclairé. Si l'entraînement sur le contenu de vos réunions est inacceptable, c'est une raison solide de choisir un autre fournisseur.

La journalisation des données de Google Cloud Speech-to-Text est-elle activée par défaut ?

Non. La journalisation des données pour Google Cloud Speech-to-Text est sur la base du volontariat. Sauf si vous l'avez activée activement dans votre console Cloud, votre audio est traité puis supprimé. Les clients qui optent pour cette option bénéficient d'un tarif réduit en échange de la contribution de leurs données. Si vous avez un projet existant où la journalisation a pu être activée auparavant, vérifiez le paramètre actuel sous Console Cloud, API et services, API Cloud Speech, onglet Journalisation des données.

Quelle est la protection la plus solide contre un fournisseur qui entraîne ses modèles sur mes enregistrements audio ?

C'est la combinaison de deux éléments : un DPA avec une clause contractuelle explicite interdisant l'entraînement, et le choix d'un fournisseur dont l'architecture technique rend l'entraînement sur vos données structurellement impossible (par exemple, un fournisseur qui utilise un modèle Whisper pré-entraîné en mode inférence uniquement). Un DPA est opposable devant un tribunal, ce qui n'est pas le cas d'un simple interrupteur dans une application. La non-formation structurelle (absence d'infrastructure d'entraînement, modèle uniquement pré-entraîné) est plus difficile à contourner, même si une politique venait à changer par la suite.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles