
Comment transcrire un Space X (Twitter Space) en 2026
Summarize this article with:
Les Spaces X ne génèrent pas de transcription native. Des sous-titres en direct existent pendant une session, mais ils disparaissent dès qu'elle se termine. Pour obtenir une transcription, il faut d'abord l'audio : les hôtes peuvent le récupérer depuis l'archive de données X (comptez 24 heures d'attente) ; les auditeurs n'ont aucun moyen officiel de téléchargement. Une fois le fichier en main, un outil de transcription fait le reste, même si les Spaces à plusieurs intervenants demandent plus de retouches qu'un podcast classique.
X Spaces ne sauvegarde pas de transcription. Les sous-titres automatiques en direct s'affichent à l'écran pendant la session, mais ils disparaissent quand le Space se termine. Obtenir une transcription implique deux étapes distinctes : capturer l'audio, puis le faire passer dans un outil de transcription. Ce post couvre les deux, honnêtement.

Ce avec quoi vous travaillez réellement
Un Space est une salle audio en direct : un ou plusieurs hôtes, jusqu'à 10 intervenants sur scène, et des auditeurs qui ne peuvent pas parler sauf s'ils sont invités. Quand la session se termine, X conserve l'audio côté serveur. Ce que personne ne conserve, c'est une transcription.
Les points clés concernant l'enregistrement :
- Tout l'audio de la scène (hôtes et intervenants invités) est enregistré.
- L'audio des auditeurs n'est jamais enregistré.
- Pas de vidéo, pas de canaux séparés par intervenant, tout l'audio est mixé sur une seule piste.
- Les sous-titres en direct sont générés à la volée et ne sont pas stockés.
Ce mix mono-piste avec plusieurs intervenants, c'est ce qui rend les Spaces plus difficiles à transcrire qu'un podcast classique.
Étape 1 : Récupérer le fichier audio
Si vous êtes l'hôte
Le chemin officiel passe par l'outil d'archive de données de X, pas par un bouton de téléchargement rapide. Il n'existe pas d'export audio direct via le menu à trois points.
- Ouvrez X (web ou app) et allez dans Paramètres et confidentialité.
- Touchez Votre compte, puis Télécharger une archive de vos données.
- Cliquez sur Demander une archive et confirmez.
- X vous envoie un lien par e-mail quand l'archive est prête. Cela peut prendre 24 heures ou plus.
- Décompressez l'archive et naviguez jusqu'à
data > spaces_media. - Votre enregistrement s'y trouve sous forme de fichier .ts (un flux de transport MPEG contenant de l'audio AAC).
Pour convertir le fichier .ts en quelque chose qu'un outil de transcription peut ingérer, exécutez :
ffmpeg -i space-recording.ts space.mp3
C'est sans perte pour le contenu audio. Le MP3 convient parfaitement ; le laisser en .ts fonctionne aussi si votre outil de téléversement l'accepte.
Note sur la conservation : les hôtes qui utilisent les applications X à jour (iOS 9.15 ou version ultérieure, Android 9.46 ou version ultérieure) bénéficient d'un stockage d'enregistrement illimité, jusqu'à ce qu'ils le suppriment. Si vous ou votre co-animateur utilisez une version plus ancienne de l'application, l'expiration de 30 jours s'applique toujours. Téléchargez dans les 30 jours si vous avez un doute.
Si vous êtes un intervenant (et non l'hôte)
Il n'existe aucune option de téléchargement intégrée pour les co-animateurs ou les invités. La solution pratique : demandez à l'hôte. La plupart partageront le fichier d'archive ou enverront un MP3 si vous le demandez avant la fin du Space. Contacter l'hôte juste après la session, avant que l'occasion ne passe, est la garantie la plus simple.
Si vous êtes un auditeur
C'est le cas le plus délicat, et il n'y a pas de réponse propre. X ne propose aucun téléchargement officiel pour les auditeurs.
Vos options, par ordre décroissant de fiabilité :
- Demandez directement à l'hôte. C'est toujours le chemin le plus simple et le plus propre. La plupart des hôtes partageront le fichier si vous le demandez.
- Enregistrez l'audio système pendant la rediffusion. Pendant que la rediffusion est lue sur X, capturez la sortie avec OBS, Audacity ou un enregistreur d'écran réglé sur l'audio système. Vous obtenez une copie légèrement dégradée, car vous recapturez un audio déjà compressé, mais cela suffit généralement pour la transcription.
- Outils de téléchargement tiers. Des outils comme SpacesDown et autres scrapers similaires peuvent récupérer les enregistrements publics des Spaces. La qualité varie ; ces outils dépendent d'un comportement non documenté de l'API X, et certains nécessitent vos cookies d'authentification X pour fonctionner. Ils peuvent aussi violer les conditions d'utilisation de X. Utilisez-les à vos propres risques pour du contenu diffusé publiquement.
Si vous assistez à des Spaces dont vous voulez des transcriptions, le conseil permanent est de contacter l'hôte avant le début de l'événement et de demander s'il partagera l'enregistrement par la suite.
Étape 2 : Transcrire le fichier
Une fois que vous avez l'audio, le processus de transcription est le même que pour toute autre source audio.
- Téléversez le fichier. ConvertAudioToText accepte les fichiers M4A, MP3 et TS sans nécessiter de compte pour les fichiers de moins de 10 minutes. Les Spaces plus longs nécessitent un plan payant.
- Définissez explicitement le nombre d'intervenants. C'est crucial pour les Spaces. Comptez les animateurs ainsi que tous les invités qui sont montés sur scène. Un Space avec 2 animateurs et 4 invités représente 6 intervenants. La détection automatique fonctionne mal sur l'audio mixte multi-intervenants.
- Ajoutez une liste de vocabulaire. Inscrivez les noms de tous les intervenants ainsi que les noms de produits, le jargon ou les acronymes mentionnés. Une liste de 10 à 20 termes améliore nettement la précision sur ces mots.
- Lancez le traitement. Un Space de 60 minutes est généralement traité en 3 à 5 minutes.
Pour les Spaces non anglophones ou ceux qui alternent entre deux langues, consultez l'article sur la diarisation des locuteurs expliquée pour savoir comment gérer l'audio multilingue.
Si vous avez simplement besoin d'une transcription propre sans outils supplémentaires, l'outil de conversion audio en texte de ConvertAudioToText gère le flux téléversement-et-transcription en une seule étape.
Le problème de la diarisation sur les Spaces
La diarisation, c'est-à-dire le processus qui consiste à étiqueter qui a dit quoi, est nettement plus difficile pour les Spaces que pour d'autres formats audio. Voici pourquoi :
- Piste mixte unique. Tous les intervenants partagent un seul canal audio. Comparez cela à un podcast enregistré via Riverside ou Zencastr, où chaque intervenant dispose de sa propre piste.
- Nombre élevé d'intervenants. Cinq à dix personnes est courant. Plus il y a d'intervenants, plus le modèle risque de confondre les groupes de voix.
- Qualité de micro variable. Un animateur sur un micro USB de studio, un autre sur haut-parleur. Les empreintes acoustiques sont incohérentes.
- Apparitions brèves. Un auditeur est invité sur scène, parle pendant 45 secondes, puis repart. Le diariseur n'a presque pas d'audio pour construire un profil fiable.
- Chevauchements de parole. Les Spaces animés présentent fréquemment des interférences. L'audio superposé sur une piste unique est difficile à démêler.
Expectation pratique : la diarisation sur un Space à 5 intervenants comportera des erreurs. Sur un Space à 2 ou 3 intervenants, avec des locuteurs expérimentés qui ne se coupent pas la parole, le résultat est généralement propre. Sur un grand Space avec de nombreux invités, prévoyez un nettoyage manuel.
La passe de montage
Les transcriptions de X Spaces nécessitent plus de travail d'édition que les podcasts en studio. Le schéma fiable :
- Écoutez les 5 premières minutes en lisant. Vérifiez que les étiquettes d'intervenants sont correctes au départ, avant que le schéma ne se propage sur 90 minutes.
- Remplacez immédiatement les étiquettes génériques. Quand l'intervenant 2 se présente en disant « je suis Marcus », faites un rechercher-remplacer de « intervenant 2 » sur tout le document.
- Surveillez les invités de passage. Quand un auditeur est invité sur scène pour un court segment, le diariseur le fusionne souvent avec un intervenant existant. Vérifiez ces transitions.
- Corrigez les noms propres. Marques, noms de personnes, noms de produits. C'est là que la transcription IA échoue systématiquement dans l'audio conversationnel.
- Marquez les passages inaudibles plutôt que de deviner. Un [inaudible] entre crochets est plus honnête qu'un mot plausible mais faux.
Un Space de 60 minutes avec 5 intervenants prend généralement 30 à 45 minutes à éditer en profondeur, contre 15 minutes pour un podcast comparable.
Comparaison : X Spaces vs transcription de podcast
| Aspect | Podcast | X Space |
|---|---|---|
| Qualité audio | Généralement élevée (configuration studio) | Variable (appareils mixtes) |
| Nombre d'intervenants | 1 à 3 en général | 2 à 10 en général |
| Structure des pistes | Souvent multi-pistes ou par intervenant | Toujours une seule piste mixée |
| Disponibilité de l'enregistrement | Fichier direct de l'hôte | Archive de données X, attente de 24 heures ou plus |
| Téléchargement par les auditeurs | N/A | Pas officiellement disponible |
| Difficulté de diarisation | Facile à moyenne | Moyenne à difficile |
| Temps d'édition par heure | Environ 15 minutes | 30 à 45 minutes |
Si vous produisez les deux formats, prévoyez environ le double du temps d'édition pour les Spaces.
Pourquoi transcrire un Space en premier lieu
Les raisons les plus courantes :
Réutilisation de contenu. Les Spaces permettent de transformer une conversation en direct en newsletter, en fil de points forts ou en article de blog. La transcription sert de matière première.
Citations et journalisme. Les journalistes qui ont couvert un Space et ont besoin d’une attribution précise. Une transcription horodatée constitue la preuve défendable.
Référence et recherche. Retrouver un moment précis dans un replay de 90 minutes en écoutant l’audio est lent. Une transcription consultable rend cela instantané.
Accessibilité. Les abonnés sourds et malentendants qui veulent le contenu sous forme de texte.
Pour les longs Spaces utilisés comme référence ou pour la recherche, le flux de travail créer un compte rendu de réunion à partir d’un audio s’applique bien ici : faites passer la transcription par une étape de synthèse pour extraire les citations clés, les thèmes et les actions à mener.
Notes juridiques
Les Spaces X sont des conversations audio publiques. Transcrire un Space public pour un usage personnel est généralement sans controverse. Republier la transcription ou utiliser des citations à des fins commerciales est une autre question :
- Les intervenants détiennent les droits d’auteur sur leurs propres paroles.
- Citer à des fins journalistiques relève de l’usage équitable, mais des citations sorties de leur contexte peuvent créer une responsabilité.
- L’utilisation commerciale de la voix ou du nom d’un intervenant nécessite généralement une autorisation.
Pour un usage interne de référence, aucune considération particulière ne s’applique.
FAQ
X Spaces propose-t-il un export de transcription intégré ?
Non. X offre des sous-titres automatiques en direct pendant un Space, mais ils ne sont pas enregistrés et disparaissent à la fin de la session. Depuis mi-2026, il n’existe aucune fonctionnalité native de transcription ou d’export sur X.
Combien de temps un enregistrement X Spaces reste-t-il disponible ?
Pour les hôtes utilisant une version récente de l’application X (iOS 9.15+ ou Android 9.46+), les enregistrements sont conservés indéfiniment jusqu’à ce que l’hôte les supprime. Pour les hôtes sur des versions plus anciennes, ainsi que pour tous les enregistrements réalisés avant le changement de politique de juin 2022, ils expiraient après 30 jours. En cas de doute, téléchargez dans les 30 jours.
Les auditeurs peuvent-ils télécharger un enregistrement X Spaces ?
Aucune interface X officielle ne le permet. Les auditeurs peuvent demander le fichier à l'hôte, utiliser la capture audio système pendant la rediffusion, ou tenter des outils de scraping tiers, même si ces outils peuvent enfreindre les Conditions d'utilisation de X et que leur fiabilité varie.
Pourquoi la diarisation est-elle plus difficile pour Spaces que pour un podcast ?
Les Spaces mélangent tous les intervenants sur une seule piste audio, alors que les podcasts sont souvent enregistrés sur des canaux séparés par personne. Avec une seule piste mixée, les modèles de diarisation doivent séparer les voix qui se chevauchent uniquement par empreinte acoustique, sans aucune séparation de canal pour les aider. Ajoutez à cela une qualité de micro variable selon les 5 à 10 intervenants et des passations fréquentes, et le taux d'erreur grimpe vite.
Sources
- Téléchargement des archives de données X : confirmé via plusieurs guides vérifiés, dont ytechb.com et maestra.ai, corroborant la documentation d'aide de X
- Politique d'enregistrement illimité des Spaces X (iOS 9.15+ / Android 9.46+) : annonce x.com/XSpaces et couverture corroborante sur grecrecorder.com
- Format de fichier .ts pour les Spaces archivés : TIL de Simon Willison sur l'exportation des enregistrements Spaces, corroboré par ryusei.io
- Conversion FFmpeg de .ts en MP3 : vérifiée via la documentation FFmpeg standard et des guides communautaires
- Sous-titres en direct non sauvegardés après la session : confirmé via le guide vocap.io 2026 et plusieurs descriptions d'outils de transcription tiers
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How to Convert AAC to Text: Streams vs M4A Explained
AAC to text: the raw-stream vs M4A container distinction that trips tools, broadcast origins, and the reliable workflow.

How to Convert FLAC to Text: Lossless Audio Guide 2026
FLAC to text for field recordings and archival interviews: why lossless helps, half-of-WAV file sizes, and the upload workflow.