ChatGPT transforme ton enregistrement en notes (payant)

ChatGPT transforme ton enregistrement en notes et e-mail de relance, mais seulement en payant. Limites, consentement, CNIL : le mode d'emploi.

Le 6 octobre, OpenAI a glissé une ligne dans les notes de version de ChatGPT, et elle répond à l’une des plus vieilles frustrations du produit. Tu peux désormais joindre un fichier audio à une conversation : ChatGPT en tire une transcription, un résumé, des notes structurées ou un brouillon d’e-mail de relance. Pendant des années, la réponse honnête à « ChatGPT peut-il transcrire mon enregistrement ? » était « pas vraiment, passe d’abord par un autre outil ». Cette réponse est périmée.

Il y a un hic, et je préfère le dire tout de suite plutôt qu’au vingtième paragraphe : l’import audio est réservé aux abonnements payants et aux espaces de travail. Il n’est pas disponible sur le plan gratuit « pour le moment », selon les mots d’OpenAI. Si tu es en Free, une bonne partie de cet article est un aperçu, avec une section plus bas sur les alternatives.

Deuxième hic, moins visible : la transcription peut se tromper sur un chiffre, un prénom ou une date, et le consentement des gens que tu enregistres, c’est à toi de le recueillir avant d’appuyer sur « enregistrer ». L’outil n’en demande à personne. En France, ça peut même relever du Code pénal.

Au programme : ce qu’OpenAI a vraiment annoncé (en citant ses pages, pas les blogs qui les réécrivent), les affirmations périmées qui dominent encore les résultats en français, un exemple complet du mémo vocal à l’e-mail de relance, puis les règles françaises : article 226-1 du Code pénal, RGPD et CNIL, CSE, secret professionnel.

Ma méthode, pour que tu saches ce que valent ces lignes. J’ai lu la note de version du 6 octobre, l’article d’aide « Uploading files and audio to ChatGPT » et les pages d’OpenAI sur Record et sur le plugin Meetings. J’ai ouvert moi-même Légifrance, la CNIL et la Cour de cassation, consulté la présentation de l’Insee, et sondé X en français. Mais je n’ai pas encore passé mes propres fichiers dans la fonction avec un compte payant : quand je décris un comportement, c’est ce qu’OpenAI documente, pas ce que j’ai mesuré.

Ce que dit vraiment OpenAI

La note de version est courte. Ses phrases clés, dans ma traduction :

« Importez des fichiers audio dans ChatGPT pour créer des transcriptions, résumer des enregistrements et poser des questions sur leur contenu. Vous pouvez transformer une réunion, un entretien ou un cours en notes structurées ou en brouillon d’e-mail de relance. Pour commencer, joignez un fichier audio compatible à une conversation et décrivez ce dont vous avez besoin. »

Et la petite ligne qu’on lit trop vite : disponible « avec les abonnements ChatGPT payants et les espaces de travail ». La disponibilité « peut varier selon les réglages de l’espace, la région, la version du client et le modèle ». Les transcriptions « peuvent contenir des erreurs », et les performances « varient selon les langues ».

La page des notes de version de ChatGPT dans le centre d’aide d’OpenAI, avec l’entrée du 6 octobre 2026 « Audio uploads in ChatGPT » en tête de l’index L’index des notes de version d’OpenAI liste « Audio uploads in ChatGPT » au 6 octobre 2026. Source : centre d’aide OpenAI, « ChatGPT — Release Notes ».

Concrètement (et c’est plus simple qu’il n’y paraît), c’est une pièce jointe, pas une nouvelle appli. Tu attaches un fichier audio comme un PDF, tu dis ce que tu veux en faire, et tu continues à discuter avec derrière. C’est ça, la vraie valeur : une transcription brute, c’est un mur de texte ; une transcription dans une conversation où tu peux demander « qu’est-ce que le client a dit sur le délai ? », c’est un document de travail.

Trois fonctions que tout le monde mélange

Ces dernières semaines, OpenAI a sorti ou mis à jour deux autres fonctions audio, et les articles sur les trois se mélangent. Elles n’ont pas les mêmes règles :

  • L’import audio (6 octobre) : tu as déjà un fichier, tu l’attaches. Abonnements payants et espaces de travail. ChatGPT n’enregistre rien.
  • Record (plus ancien) : un bouton de l’appli de bureau macOS qui écoute en direct et construit des notes. Réservé à macOS, pour les espaces Plus, Enterprise, Edu, Business et Pro.
  • Le plugin Meetings (29 septembre) : macOS aussi, en bêta pour tous les Pro et tous les Business, en alpha limitée pour Enterprise. Il prend des notes pendant un appel sans robot dans la réunion et sauvegarde un résumé avec des actions suggérées dans ChatGPT Space.

« ChatGPT enregistre mes réunions » : c’est Record ou Meetings. « ChatGPT transcrit mon mémo vocal » : c’est l’import. Cet article ne parle que de l’import. (Si la catégorie entière est nouvelle pour toi, notre page What Is an AI Notetaker? pose les bases, en anglais pour l’instant.)

Ce qui est périmé dans les pages françaises

Plusieurs de ces pages étaient exactes le jour où elles ont été écrites. Mais le 6 octobre a rendu plusieurs affirmations fausses, et ce sont celles que tu vas lire en tapant « ChatGPT transcrire audio » dans Google. J’ai ouvert les pages que la recherche remonte en tête :

Ce que tu lis encoreOùCe que dit OpenAI depuis le 6 octobre
« La limite est de 25 Mo »Transkriptor (anglais, 3 avril 2026) l’applique à ChatGPT, avec 1 500 secondes par fichier. Sonix en français (20 juillet 2026) la cite, correctement, comme limite de l’API25 Mo, c’est l’API développeur. Dans ChatGPT, l’article d’aide annonce « jusqu’à 512 Mo » par fichier
« ChatGPT transcrit avec Whisper »TranskriptorOpenAI ne dit pas quel modèle se cache derrière l’import. Whisper est l’ancien modèle de l’API
« OpenAI ne documente pas de formats audio dans les conversations »Vomo en français, mis à jour le 2 septembre 2026L’article d’aide liste désormais WAV, MP3/MPEG, OGG/OGA, WebM audio seul, PCM, FLAC, AAC, M4A et MP4 audio seul
« Pour transcrire dans ChatGPT, il faut Record, donc un Mac »Blog du Modérateur, 21 juillet 2025 : Record, macOS, abonnés payants, aucune mention d’import de fichierExact à l’époque. Record reste macOS, mais l’import de fichier existe désormais, sous réserve de « version du client »

Bref, le motif se répète : un chiffre vrai pour l’API, recopié comme s’il valait pour l’appli. L’erreur la plus coûteuse, c’est la taille : si tu crois devoir découper à 25 Mo, tu perds du temps pour rien.

Les faits de l’article d’aide, rangés

Qui y a droit. Les abonnements et espaces payants, Enterprise compris. Pas le plan gratuit « pour le moment ». Si tu es abonné et que tu ne vois rien, mets l’appli à jour et demande à l’administrateur de ton espace avant de conclure à une panne. Un point que je ne peux pas trancher : l’article dit « abonnements payants » sans détailler plan par plan, et je n’ai pas vérifié si le plus petit (Go, environ 8 € par mois au 10 juillet d’après notre tableau des plans) y donne accès. Vérifie dans ton appli avant de souscrire.

La section « Availability » de l’article d’aide d’OpenAI : les imports audio sont disponibles avec les abonnements et espaces de travail payants, pas sur le plan gratuit La section « Availability » au 7 octobre 2026. Source : centre d’aide OpenAI, « Uploading files and audio to ChatGPT ».

Quels fichiers. WAV, MP3/MPEG, OGG/OGA, WebM audio seul, PCM, FLAC, AAC, M4A et MP4 audio seul : le mémo vocal d’un téléphone, un appel exporté, la plupart des dictaphones. Le piège : les WebM et MP4 identifiés comme vidéo ne sont pas pris en charge. Une vidéo de visio sauvegardée en MP4 peut être refusée malgré une piste son parfaite. Exporte l’audio seul d’abord.

Quelle taille. « Les fichiers audio peuvent atteindre 512 Mo. » Les enregistrements plus longs « peuvent être traités par sections », le traitement se fait « au mieux », et les très longs peuvent expirer. Aucune durée maximale n’est promise, ni en minutes ni en heures.

La section des limites de l’article d’aide : 512 Mo par fichier, et la mention que les enregistrements très longs peuvent expirer Un plafond de taille, plus un traitement « au mieux » pour les longs fichiers. Source : centre d’aide OpenAI.

Quelle fiabilité. La page le dit deux fois : « Les transcriptions peuvent contenir des erreurs, et l’identification des locuteurs peut être peu fiable. Vérifiez les détails importants à l’aide de l’enregistrement original. » Et les performances « peuvent varier selon les langues ». OpenAI te dit de ne pas te fier aux étiquettes de locuteurs. Prends-le au mot.

Le mode d’emploi en six étapes

  1. Mets l’audio dans un format accepté, de taille raisonnable. Un mémo de téléphone passe tel quel. Une visio : exporte l’audio seul. Un énorme WAV : convertis en MP3 ou M4A (le calcul plus bas dit pourquoi).
  2. Ouvre une conversation neuve et joins le fichier. Une conversation par enregistrement, pour que les notes d’un client ne contaminent pas celles d’un autre.
  3. Dis ce que tu veux, avec le format. « Transcris ça » donne une transcription. « Résumé, décisions, questions ouvertes avec un responsable, prochaines étapes » donne de quoi alimenter ton CRM. Un prompt à copier est plus bas.
  4. Vérifie contre l’enregistrement. Avant d’envoyer quoi que ce soit, réécoute les deux ou trois moments qui comptent : chaque chiffre, chaque date, chaque nom propre, chaque « oui, d’accord ». C’est le conseil d’OpenAI et l’habitude la plus rentable avec n’importe quel outil de transcription.
  5. Pose tes questions de suivi dans la même conversation. « Qui a dit qu’il enverrait le devis corrigé, et pour quand ? », ou « réécris les actions en message au client, ton simple et aimable ». C’est là que ça bat un outil de transcription isolé.
  6. Décide où vit le fichier. Supprimer une conversation et supprimer un fichier enregistré sont deux actions distinctes : « supprimer une conversation ne supprime pas un fichier qui reste enregistré dans la Bibliothèque » (Space remplace Library sur les comptes qui l’ont). Si c’est sensible, supprime la copie à la main.
Importer un fichier ou enregistrer en direct : deux logiques
📁 Tu as déjà le fichier
Import audio (nouveau)
Mémo vocal, appel exporté, dictaphone. Abonnement payant. 512 Mo par fichier, traitement au mieux sur les longs enregistrements. ChatGPT n'enregistre rien.
🎙️ Tu veux des notes pendant l'appel
Record / Meetings (macOS)
Capture en direct sur Mac. Record : Plus, Business, Enterprise, Edu et Pro. Meetings : bêta Pro et Business, sans robot dans la réunion.

Un exemple de bout en bout : du mémo vocal à l’e-mail de relance

Pas d’enregistrement de vrai client ici, et pas de test en direct. Les chiffres ci-dessous sont de l’arithmétique que tu peux refaire ; la transcription de départ et la forme de la sortie sont une illustration que j’ai écrite, pas un résultat réel de ChatGPT.

D’abord, la taille du fichier (vrai calcul)

Le plafond de 512 Mo a l’air énorme jusqu’à ce que tu regardes la vitesse à laquelle l’audio grossit. La taille dépend du débit, donc de la façon dont l’enregistrement est sauvegardé. En mégaoctets décimaux (1 Mo = 1 000 000 octets) :

SauvegardeDébitTaille par minuteRéunion de 45 minMinutes avant 512 Mo
MP3 ou M4A, qualité voix64 kbit/s0,48 Moenviron 22 Moenviron 1 067 (17,8 h)
MP3 ou M4A, qualité standard128 kbit/s0,96 Moenviron 43 Moenviron 533 (8,9 h)
WAV 16 bits mono, 16 kHz256 kbit/s1,92 Moenviron 86 Moenviron 267 (4,4 h)
WAV 16 bits stéréo, 44,1 kHz (qualité CD)1 411 kbit/s10,6 Moenviron 476 Moenviron 48 min
Combien de minutes d'audio tiennent dans 512 Mo ?
Selon la façon dont l'enregistrement est sauvegardé
MP3/M4A 64 kbit/s
1067 min
MP3/M4A 128 kbit/s
533 min
WAV mono 16 kHz
267 min
WAV stéréo qualité CD
48 min
Calcul : 512 Mo divisés par la taille par minute. Les formats compressés ne sont presque jamais le problème.

Trois conclusions, du coup. Un : un MP3 ou un mémo vocal normal n’atteint presque jamais le plafond. Deux : un WAV qualité CD d’une réunion de 45 minutes pèse déjà environ 476 Mo, pile au bord. À 50 minutes, il dépasse le plafond, alors qu’en MP3 le même fichier est environ onze fois plus léger, sans perte utile pour de la voix. Trois : la vraie contrainte sur les très longs fichiers, c’est le traitement « au mieux » et les expirations, pas les 512 Mo. Pour trois heures d’enregistrement, découpe en morceaux d’une heure. Pour comparer, les 25 Mo de l’API représenteraient environ 26 minutes à 128 kbit/s : c’est pour ça que les vieilles pages te disent de découper.

Le prompt à copier

Les prompts restent en anglais (les modèles y répondent mieux), avec une consigne de réponse en français. Le vouvoiement du client est un choix : adapte-le.

This is a recording of a call with a client. Answer in French.

1. Give me a 5-sentence summary in plain language.
2. List every decision that was made, one line each, with who made it.
3. List open questions that nobody answered, with the person who should answer each.
4. List action items as: owner / what / by when (write "pas de date donnée" if none was said).
5. Flag anything where the speaker sounded unsure, or where you weren't confident in the transcript: names, numbers, dates, addresses. For every amount, say whether it was stated excluding tax (HT) or including tax (TTC), or whether that wasn't said.
6. Draft a short follow-up email to the client in French, polite "vous" form, that confirms the decisions and next steps. Don't add any commitment that wasn't said on the call.

Don't guess at names or numbers. If you can't tell, say so.

Le point 5 et la dernière ligne sont les plus importants : ils donnent au modèle la permission de dire « je ne suis pas sûr » au lieu de lisser un mot étouffé avec une supposition bien tournée. Le détour par HT/TTC, c’est un réflexe bien français : à l’oral, on dit « mille huit cent cinquante » sans préciser, parce qu’entre pros tout le monde sait de quoi on parle. Une transcription, en fait, ne le sait pas.

L’entrée : un mémo de 90 secondes (illustration inventée)

Nadia, consultante indépendante en organisation, sort d’un rendez-vous, s’assoit dans sa voiture et dicte sur son téléphone :

« Rendez-vous avec Mme Lefèvre, directrice d’une petite agence immobilière, 11 salariés. Elle veut remettre à plat la gestion de ses mandats. J’ai proposé un devis à mille huit cent cinquante euros hors taxes, avec un acompte de trente pour cent à la signature. Elle valide sur le principe mais doit en parler à son associé, réponse jeudi quinze octobre. Je lui envoie le devis détaillé et la liste des outils d’ici vendredi. Elle préfère faire le point en visio plutôt que sur place, plutôt le matin. »

Le fichier fait 90 secondes. En M4A à 128 kbit/s : 90 × 0,016 Mo par seconde, environ 1,4 Mo. Aucun risque côté taille.

La sortie attendue : une forme, pas un résultat réel

Une bonne réponse a cette forme (je la décris, je ne cite pas une exécution). D’abord un résumé court : la cliente, son besoin, le montant, la condition de décision. Aucune décision ferme, puisque l’accord est « sur le principe ». Deux questions ouvertes : la réponse de l’associé et le créneau de la visio. Deux actions : Nadia envoie le devis et la liste des outils d’ici vendredi, Mme Lefèvre répond jeudi 15 octobre. Enfin des alertes sur le nom, le montant HT et la date, et un brouillon d’e-mail aimable.

Ce que tu vérifies toi-même, chiffres à l’appui

C’est là que l’étape 4 gagne sa place. Trois contrôles, deux minutes :

  1. Le montant et sa base. 1 850 € hors taxes + 20 % de TVA (370 €) = 2 220 € TTC. Si l’e-mail annonce « 1 850 € » sans « HT », le client lira peut-être l’inverse. Un devis ne supporte pas l’ambiguïté.
  2. L’acompte. 30 % de 1 850 € = 555 € HT (666 € TTC). Refais le calcul : un modèle de langage fait la plupart du temps une arithmétique correcte, mais « la plupart du temps » ne suffit pas sur une facture.
  3. La date et le nom. Le 15 octobre 2026 tombe bien un jeudi, mais c’est à toi de le vérifier. Pour « Lefèvre », compare avec la carte de visite : un modèle peut choisir « Lefebvre », orthographe plus fréquente.

Un mot pour les agents immobiliers, parce que le cas arrive tout le temps : ne dicte pas, dans des notes que tu gardes, la situation familiale, la santé, l’origine ou la religion d’un acheteur. Une transcription rend ces mots permanents et recherchables. Dicte le budget et les critères, pas « sa femme est malade ».

Pourquoi ça concerne les indépendants (et un chiffre à ne pas mal lire)

Je te donne ces chiffres tels qu’ils figurent dans la présentation de l’Insee Première n° 2120 (juillet 2026) : je n’ai pas pu rouvrir le PDF complet. Selon l’Insee, 18 % des entreprises de 10 salariés ou plus déclaraient utiliser au moins une technologie d’IA en 2025, soit 8 points de plus qu’en 2024 et 12 de plus qu’en 2023, avec 58 % chez les 250 salariés ou plus. Parmi celles qui n’en utilisent pas, 71 % disent n’y voir aucune utilité.

Regarde ce que ce chiffre ne dit pas : il ne couvre que les entreprises d’au moins 10 salariés. Les auto-entrepreneurs, consultants, coachs, mandataires immobiliers et pigistes en sont absents, alors que « j’ai un mémo vocal, je veux un e-mail de relance » est précisément leur quotidien. À ma connaissance, personne ne mesure leur usage aussi proprement. Ce que je peux dire, c’est que l’import audio est taillé pour eux : pas de robot à inviter, pas de licence d’équipe, un fichier et une phrase.

Est-ce que ça transcrit bien en français ?

Franchement, je n’en sais rien, et toi non plus tant que tu n’as pas testé. À ma connaissance, personne n’a publié de test indépendant de la fonction d’import, et OpenAI ne dit pas quel modèle tourne derrière. Je ne peux donc pas te donner de pourcentage, et tu devrais te méfier de qui t’en donne un : plusieurs sites de transcription publient des « taux d’erreur en français » flatteurs, mais ce sont des arguments commerciaux, pas des mesures indépendantes.

Ce que je peux te donner, c’est de la preuve indépendante sur la technologie en général. Une étude à comité de lecture de 2023 (Journal of Medical Internet Research) a testé 65 entretiens psychiatriques sur Zoom en anglais américain, 46 minutes en moyenne. Taux d’erreur de mots, donc plus c’est bas mieux c’est : 19,2 % pour la transcription en direct d’Otter, 14,8 % pour Whisper, 8,9 % pour Amazon Transcribe, 7,6 % pour un service humain. Les outils automatiques testés se trompent donc sur un mot sur onze à un mot sur cinq environ, contre un sur treize pour l’humain. Ce n’est pas un classement des produits actuels : modèles plus anciens, locuteurs américains natifs, peu de bruit.

Une prépublication de 2026, GigaSpeechBench, est plus parlante sur les accents : sur de l’anglais spontané, GPT-4o Transcribe allait de 17,1 % d’erreurs pour l’accent indien à 66,1 % pour l’accent chinois, contre 7,9 % à 27,2 % pour Whisper Large v3. Prudence : non relue par des pairs, audio de YouTube, anglais uniquement, donc rien sur le français. Retiens l’avertissement : les écarts d’un locuteur à l’autre peuvent être énormes.

Ce que le français ajoute, à en juger par ce que la reconnaissance vocale rate d’habitude (une probabilité, pas une mesure) : les nombres (« soixante-dix », « quatre-vingt-dix »), les homophones (« a » et « à », « ces » et « ses »), les noms propres, les sigles, les accents belges, suisses ou québécois, et le franglais de bureau. Un test de cinq minutes sur un enregistrement que tu connais par cœur t’apprendra plus que n’importe quel benchmark.

Ce que fait OpenAI de ton audio

C’est la partie que la plupart des articles sautent, et celle qui a des conséquences.

Ça dépend d’où le fichier est stocké. Selon l’article d’aide, la conservation « dépend de l’endroit où le fichier est stocké et de toute politique de rétention de l’espace de travail ». Les fichiers de la Bibliothèque « peuvent être conservés séparément de la conversation », et le contenu amené dans une conversation « peut y rester ». Dans les espaces Enterprise, Edu et Healthcare, la Bibliothèque suit la politique de rétention de l’espace.

L’entraînement dépend de ton plan et de tes réglages. Pour le grand public, ça « dépend du service utilisé et de tes réglages de données ». Pour les offres professionnelles, OpenAI affirme ne pas utiliser les contenus clients (API, ChatGPT Enterprise) pour améliorer ses modèles. Si tu es sur Plus ou Pro à titre personnel, vérifie l’option d’amélioration du modèle avant d’importer la voix de quelqu’un d’autre. Pour la question générale : ChatGPT est-il vraiment privé ?

Les règles de Record ne s’appliquent pas aux imports. Record supprime l’audio après transcription ; pour Meetings, l’audio est supprimé du Mac et des serveurs une fois les notes prêtes. L’article sur les imports ne promet rien d’équivalent : un enregistrement importé est un fichier de ton compte, avec la conservation décrite plus haut.

La section « Privacy and data » de la page d’aide du plugin Meetings : l’audio est supprimé du Mac et des serveurs d’OpenAI une fois les notes prêtes Meetings promet explicitement de supprimer l’audio. L’article sur les imports n’en fait pas autant. Source : centre d’aide OpenAI, « The Meetings plugin in ChatGPT ».

La CNIL dit la même chose côté utilisateur dans ses questions-réponses sur l’IA générative (18 juillet 2024) : « ne jamais partager d’informations confidentielles telles que des données personnelles, des données de l’entreprise ou de l’administration » avec un service grand public, et garder un regard critique sur les sorties, sans les reprendre « telles quelles ». Ce passage vise du texte ; l’audio, qui contient en prime une voix, n’est pas moins concerné.

La règle simple : si l’enregistrement contient ce que tu serais mal à l’aise de voir entre des mains inconnues (dossier médical d’un client, appel de stratégie juridique, entretien d’évaluation, candidat en recrutement), soit tu passes par un espace professionnel avec les protections qu’OpenAI documente pour ces offres (sans que ça règle tout pour des données de santé ou couvertes par le secret, voir plus bas), soit tu n’importes pas.

Enregistrer quelqu’un en France : ce que disent vraiment les textes

C’est la section où les articles citent souvent le bon article de loi avec la mauvaise conclusion, dans un sens ou dans l’autre. Je m’en tiens à ce que j’ai ouvert sur Légifrance, la CNIL et la Cour de cassation.

Code pénal, article 226-1. Le texte (en vigueur dans cette version depuis le 23 mars 2024 d’après Légifrance) punit d’« un an d’emprisonnement et de 45 000 euros d’amende » le fait, par un procédé quelconque, de porter volontairement atteinte à l’intimité de la vie privée d’autrui, notamment en captant, enregistrant ou transmettant, sans le consentement de leur auteur, des paroles prononcées à titre privé ou confidentiel. Il prévoit aussi que, quand ces actes sont accomplis au vu et au su des intéressés sans qu’ils s’y soient opposés alors qu’ils étaient en mesure de le faire, leur consentement est présumé. Sur le papier, le texte ne prévoit pas d’exception pour l’appel dont tu es toi-même participant : il parle du consentement de celui qui parle, pas de ta présence dans la pièce.

Deux précisions pour éviter les contresens. D’abord, le texte vise les paroles « à titre privé ou confidentiel », sans liste officielle de ce qui l’est : ça s’apprécie au cas par cas, donc ne parie pas dessus. Ensuite, la présomption « au vu et au su » est fragile : le silence de quelqu’un qui ignore qu’une IA va traiter sa voix ne vaut pas son oui prononcé à voix haute. Si une situation te paraît limite, relis le texte en vigueur et demande à un juriste.

La preuve en justice, c’est un autre sujet. Tu liras que « depuis 2023, on peut enregistrer à l’insu de quelqu’un ». Raccourci qui fait des dégâts. L’Assemblée plénière de la Cour de cassation a jugé le 22 décembre 2023 que, « dans un procès civil, l’illicéité ou la déloyauté dans l’obtention ou la production d’un moyen de preuve ne conduit pas nécessairement à l’écarter des débats », à condition que cette production soit « indispensable » à l’exercice du droit à la preuve et que l’atteinte aux droits adverses soit « strictement proportionnée au but poursuivi ». Un juge civil peut donc, sous conditions strictes, accepter un enregistrement clandestin. Ça ne veut pas dire qu’enregistrer était permis, ça ne t’immunise pas contre l’article 226-1, et ça n’a rien à voir avec « je veux des notes IA de ma réunion ».

RGPD et CNIL. Dès que tu enregistres des gens à titre professionnel, tu traites des données personnelles (une voix en est une). Deux nuances. Le RGPD n’impose pas systématiquement le consentement de chaque participant : un article de TPE Actu du 11 août 2026 sur les IA qui s’invitent dans les réunions Teams le rappelle, en séparant bien l’obligation d’information du consentement. Mais ça ne rend pas l’article 226-1 caduc : les deux se cumulent. Une phrase dite au début de l’appel couvre l’information et le consentement d’un coup, sans régler pour autant le reste du RGPD (base légale, durée de conservation). Côté durée, la CNIL donne un repère, avec une réserve : sa page sur l’écoute et l’enregistrement des appels au travail vise les dispositifs de l’employeur, et indique des enregistrements conservés « jusqu’à six mois au maximum » et des documents d’analyse « jusqu’à un an ». Ce n’est pas une règle pour ton usage, c’est un ordre de grandeur de ce que la CNIL juge proportionné. Garde le compte rendu, jette l’audio dès qu’il est validé.

Salarié ou employeur : le CSE. Le Code du travail (L1222-4) pose qu’« aucune information concernant personnellement un salarié ne peut être collectée par un dispositif qui n’a pas été porté préalablement à sa connaissance ». L’article L2312-38 prévoit que le CSE est informé et consulté, avant la décision de mise en œuvre, sur les moyens ou techniques permettant un contrôle de l’activité des salariés (il relève des attributions du CSE dans les entreprises d’au moins cinquante salariés). La CNIL écrit de son côté, à propos des écoutes d’appels, que les instances représentatives doivent être informées et consultées avant tout dispositif d’enregistrement, et que l’employeur ne peut pas mettre en place un enregistrement permanent ou systématique, sauf texte légal. Un outil de transcription déployé pour tous les managers « permet-il un contrôle de l’activité » ? C’est la question à poser à ton service juridique ou RH avant de généraliser, pas après. Je ne la tranche pas ici.

Secret professionnel. L’article 226-13 du Code pénal punit d’un an d’emprisonnement et de 15 000 euros d’amende la révélation d’une information à caractère secret par une personne qui en est dépositaire par état ou par profession. Avocat, médecin, psychologue : envoyer un enregistrement à un service tiers, ce n’est pas une question de confort, c’est savoir si tu révèles quelque chose. On a détaillé ça pour avocats, thérapeutes et conseillers financiers face aux notes IA de Google Meet et pour couper l’IA de Copilot dans Teams : même raisonnement, avec un fichier au lieu d’un robot.

Ta situationCe qui s’appliqueEn pratique
Indépendant, tu enregistres un client ou un rendez-vousArt. 226-1 (consentement de l’auteur des paroles) ; RGPDPhrase de consentement à voix haute au début, gardée dans l’enregistrement ; audio supprimé une fois le compte rendu validé
Salarié, tu enregistres des collègues pour tes notesArt. 226-1 ; politique interne de ton employeurAccord de chacun ; relis la charte informatique avant d’importer du contenu d’entreprise dans un outil public
Employeur ou manager, tu déploies un outil pour l’équipeL1222-4 et L2312-38 Code du travail ; RGPD ; repères CNILInformer avant ; poser la question du CSE (50 salariés ou plus) ; conservation courte
Tenu au secret professionnelArt. 226-13 ; déontologie de ta professionPas de conversation couverte par le secret dans un service grand public ; avis de ton ordre avant tout test
Enregistrement « pour preuve » dans un conflitCass., Ass. plén., 22 déc. 2023 (preuve civile, conditions strictes)Parle à un avocat d’abord : la recevabilité d’une preuve n’efface pas l’infraction éventuelle

Le geste le plus simple est aussi le plus efficace : dis-le à voix haute au début. « Je vais enregistrer cet échange et utiliser un outil d’IA pour en faire un compte rendu. Ça vous va à tous ? » Attends un oui, garde-le dans l’enregistrement, arrête si quelqu’un refuse. Dix secondes, et tu règles le point du consentement (le reste du cadre, RGPD compris, demande un peu plus). OpenAI fait d’ailleurs peser la charge sur toi : sa page Meetings demande d’obtenir le consentement de chacun avant de commencer et précise que le rappel de l’appli est « visible par vous », qu’il ne notifie pas les autres participants et n’obtient pas leur consentement à ta place ; sa page Record demande de « vérifier les lois locales et d’obtenir toujours les bons consentements avant d’enregistrer d’autres personnes ».

Et les francophones, qu’en disent-ils ? Sur X en français, depuis le 6 octobre, à peu près rien sur l’import audio lui-même : le seul débat de consentement visible portait sur le plugin Meetings, fin septembre. Du coup, à ma connaissance, la question n’est pas éclaircie en français pour cette fonction. D’où cet article.

Quel outil pour quel enregistrement ?

L’import audio est un bon généraliste, pas le meilleur partout. Ce tableau compare ce qu’OpenAI documente pour ses outils avec les prix et limites publiés par les alternatives, relevés cette semaine (prix en dollars, hors TVA, qui bougent souvent : vérifie chaque page avant d’acheter).

OutilÀ quoi ça sertCoût publiéLimites notables
Import audio ChatGPTTu as déjà l’enregistrement : notes, transcription, relanceInclus dans les abonnements éligibles512 Mo par fichier ; traitement au mieux sur les longs ; locuteurs « peu fiables » ; pas sur Free
ChatGPT Record (macOS)Capture en direct sur MacInclus avec Plus, Pro, Business, Enterprise, EdumacOS ; sessions de 4 heures max ; meilleur en anglais ; locuteurs génériques (« Speaker 1 »)
Plugin Meetings (macOS)Notes sans robot pendant l’appel, actions dans ChatGPT SpaceBêta pour tous les Pro et BusinessmacOS ; 4 heures max ; audio supprimé une fois les notes prêtes ; Enterprise en alpha
API speech-to-text d’OpenAIDéveloppeurs, automatisation, fichiers en masseGPT-4o Transcribe ≈ 0,006 $ la minute (≈ 0,36 $ l’heure) ; modèle mini ≈ 0,003 $25 Mo par requête ; tu construis le flux
OtterCapture en direct et historiqueGratuit : 300 min par mois, 30 min par conversation. Pro ≈ 8,33 $ par mois en annuel (1 200 min)Plafonds de minutes ; limites d’import
FathomNotes d’appels en visioGratuit (enregistrements et transcription illimités) ; Premium 20 $ par mois ou 16 $ en annuelRésumés avancés limités en gratuit après les premiers appels du mois
GranolaNotes sans robot sur ton appareilBase gratuite, historique limité ; Business ≈ 14 $ par utilisateur et par moisPensé pour le direct, pas pour les fichiers
Gemini (gratuit)Transcription gratuite avec étiquettes de locuteursGratuitNotre tutoriel Gemini : méthode et limites

Le schéma : si tu paies déjà ChatGPT et que ta tâche est « j’ai un enregistrement, donne-moi des notes », l’import remplace probablement un abonnement séparé. Si tu veux que chaque appel soit capturé automatiquement, avec les noms et une archive consultable, un outil dédié va plus loin. Et sur Mac, pour des notes pendant l’appel, Record ou Meetings valent mieux qu’enregistrer puis importer. Pour les prix en euros des abonnements ChatGPT (Plus ≈ 23 € TTC au 10 juillet), c’est dans notre tableau des plans.

Quel chemin pour cet enregistrement ?
Tu as déjà le fichier audio ? mémo vocal, appel exporté, dictaphone
Abonnement ChatGPT payant ? le plan Free n'inclut pas l'import
Format accepté, moins de quelques heures ? 512 Mo max, découpe les très longs
Importe, demande notes + e-mail puis vérifie noms, chiffres, dates
Pour choisir vite. Les règles diffèrent selon le coût, la confidentialité et ce qui est inclus dans ton plan.

Ce que ça change pour toi, selon ton métier

Auto-entrepreneur ou freelance : le mémo vocal d’une minute après chaque rendez-vous client, transformé en e-mail de relance. C’est le réflexe qu’on travaille dans notre cours pour auto-entrepreneurs : un seul document de travail au lieu de trois outils. Première action : dicte le debrief de ton prochain rendez-vous (tu n’as besoin du consentement de personne pour parler seul), passe le prompt et compare avec ce que tu as dit.

Consultant ou coach : enregistre l’appel avec l’accord explicite du client, importe, récupère résumé, décisions et mail de récap pendant que c’est frais. Le gain : être pleinement présent parce que tu ne tapes pas. Première action : une phrase de consentement au début de chaque séance. Pour du sensible (coaching individuel, santé, difficultés personnelles), pas d’import dans un compte grand public. Notre cours IA pour consultants indépendants couvre les livrables client.

Agent immobilier : le mémo de 90 secondes après chaque visite, dicté seul dans ta voiture : tu ne captes la parole de personne, c’est l’usage idéal. Pour un appel avec un acquéreur, demande l’accord à voix haute. Première action : un vrai debrief, le prompt, la comparaison. Suite du flux dans IA pour agents immobiliers.

Journaliste : transcrire tes propres entretiens est le cas d’école, avec l’accord de la personne dit à voix haute, dans l’enregistrement. Première action : teste sur un entretien sans enjeu et compare mot à mot sur les citations, là où une transcription approximative fait mal. Si la confidentialité d’une source compte, ne l’importe pas dans un service grand public. Voir IA pour journalistes.

Salarié ou manager : sur Mac avec un abonnement Pro ou Business, teste Meetings pour du direct ; pour un appel Teams déjà enregistré ou un mémo, l’import. Avant de généraliser : informe l’équipe, relis la charte informatique, pose la question du CSE à ton RH si l’entreprise a 50 salariés ou plus. Première action : une réunion récurrente, un seul outil pendant deux semaines, comparaison avec ce qui s’est réellement passé. Les prompts sont dans Comptes rendus de réunion avec l’IA.

Étudiant : les cours enregistrés, sous réserve du règlement de ton établissement (beaucoup d’enseignants refusent : demande). Première action : un cours court, avec notions clés, trois questions d’entraînement et glossaire, vérifiés contre le diaporama, avant de t’y fier pour un examen.

Tenu au secret (avocat, médecin, psychologue, expert-comptable) : n’improvise pas. La question n’est pas l’exactitude de la transcription mais où part l’audio, combien de temps il reste et qui peut le voir. Première action : avis de ton ordre ou de ton référent déontologie avant d’importer le moindre enregistrement de ce type.

Plan gratuit : l’import n’est pas disponible. Tu peux utiliser la dictée vocale de ChatGPT pour parler un message (voir Parler à ChatGPT à la voix), ou transcrire avec un outil gratuit d’abord puis coller le texte dans ChatGPT pour le résumer, comme dans notre tutoriel Gemini.

Quand ça coince : dépannage

Je sépare ce qu’OpenAI documente de ce qui est seulement probable d’après la technologie, et les retours de première main sont rares. Cette liste va s’allonger.

1. « Fichier refusé alors qu’il se lit très bien. » (Documenté.) MP4 ou WebM identifié comme vidéo : exporte la piste audio en MP3 ou M4A. Vérifie aussi que le fichier n’est pas corrompu.

2. « La transcription s’arrête au milieu d’un long enregistrement. » (Avertissement documenté, cause probable.) Les très longs enregistrements « peuvent expirer ». Découpe en fichiers plus courts, un par sujet ou par heure.

3. « Les noms des intervenants sont faux ou mélangés. » (Documenté.) Les locuteurs sont « peu fiables ». Donne les noms dans le prompt (« deux intervenants : Priya, la cliente, et moi ») et vérifie les engagements dans l’audio.

4. « Un chiffre, une date ou un nom est faux. » (Probable.) La reconnaissance vocale rate plus souvent noms, chiffres, adresses et jargon. Demande de signaler les éléments peu sûrs et réécoute ces passages.

5. « C’est bien pire avec l’accent de mon collègue ou dans une salle bruyante. » (Cohérent avec la recherche citée plus haut, mais pas mesuré sur l’import.) Teste sur ton propre audio. Un micro plus proche et une pièce calme améliorent plus que n’importe quel prompt.

6. « Il mélange français et anglais, ou répond dans la mauvaise langue. » (Probable.) Précise la langue de l’audio et celle de la sortie, et teste un court extrait avant un long. OpenAI note que Record marche mieux en anglais aujourd’hui.

7. « J’ai supprimé la conversation, mais le fichier est toujours là. » (Documenté.) Supprime la copie dans Bibliothèque (ou Space). Dans certains espaces, une zone « supprimés récemment » permet de restaurer jusqu’à suppression définitive : vide-la.

Ce que l’import audio ne fait pas

Il ne rattrape pas un mauvais enregistrement. Voix qui se coupent, vent, téléphone posé de l’autre côté de la table : la précision chute, et aucun prompt n’y change rien.

Il ne garantit pas qui a dit quoi. Une transcription est un brouillon, pas une pièce que tu déposerais devant un tribunal.

Il ne promet pas de supprimer l’audio. Contrairement à Meetings, l’article sur l’import ne promet aucune suppression après traitement. Considère l’audio comme un fichier de ton compte tant que tu ne l’as pas supprimé.

Il ne marche pas partout. Plan gratuit exclu, et les espaces professionnels peuvent restreindre la fonction.

Questions fréquentes

ChatGPT peut-il transcrire un fichier audio maintenant ? Oui, avec un abonnement ou un espace de travail payant. Depuis le 6 octobre, tu joins un fichier audio à une conversation et tu demandes une transcription, un résumé, des notes ou un e-mail de relance. Pas sur le plan gratuit « pour le moment », selon OpenAI.

Quels formats audio ChatGPT accepte-t-il ? WAV, MP3/MPEG, OGG/OGA, WebM audio seul, PCM, FLAC, AAC, M4A et MP4 audio seul. Les fichiers identifiés comme vidéo ne sont pas pris en charge, et le fichier doit contenir un flux audio valide.

Quelle est la taille maximale d’un fichier ? 512 Mo par fichier. Les enregistrements plus longs peuvent être traités par sections, au mieux, et les très longs peuvent expirer. Les 25 Mo que tu as peut-être lus concernent l’API développeur.

Mon enregistrement sert-il à entraîner ChatGPT ? Ça dépend de ton plan et de tes réglages. Grand public : vérifie l’option d’amélioration du modèle. Offres professionnelles comme Enterprise et l’API : OpenAI dit ne pas utiliser les contenus clients pour améliorer ses modèles.

Est-ce légal d’enregistrer quelqu’un en France pour le faire transcrire ? Avec son consentement, c’est en principe possible. L’article 226-1 du Code pénal punit d’un an de prison et de 45 000 euros d’amende le fait d’enregistrer sans le consentement de leur auteur des paroles prononcées à titre privé ou confidentiel. Le RGPD s’ajoute à titre professionnel (information, durée de conservation). Annonce l’enregistrement à voix haute et obtiens un oui clair. En cas de doute, vérifie le texte en vigueur auprès d’un juriste.

Un enregistrement fait à l’insu de quelqu’un peut-il servir de preuve ? Parfois, au civil, sous conditions strictes (« indispensable » et « strictement proportionnée »), d’après l’arrêt de l’Assemblée plénière du 22 décembre 2023. Mais la recevabilité d’une preuve et la légalité de l’enregistrement sont deux questions distinctes : parle à un avocat avant de t’y fier.

Dois-je encore payer Otter, Fathom ou Granola ? Si tu n’as besoin que de notes à partir d’enregistrements existants, l’import peut suffire. Pour une capture automatique de chaque appel, un historique consultable et des fonctions d’équipe, un outil dédié va plus loin.

En résumé

L’import audio de ChatGPT est un vrai changement, mais plus modeste que le « ChatGPT transcrit tout » qui circule. C’est une fonction payante, qui accepte la plupart des formats courants jusqu’à 512 Mo, traite les longs fichiers au mieux, et vient avec l’avertissement d’OpenAI lui-même : transcriptions parfois fausses, étiquettes de locuteurs fragiles. La bonne façon de s’en servir est la plus ennuyeuse : enregistrer avec consentement, importer un fichier par conversation, demander une structure précise, vérifier noms, chiffres et dates contre l’audio, et supprimer la copie enregistrée quand c’est sensible.

Pour en faire une routine fiable, notre cours Comptes rendus de réunion avec l’IA couvre les prompts et les contrôles, dans les règles du RGPD. L’IA pour les auto-entrepreneurs et L’IA pour les consultants indépendants appliquent les mêmes idées au travail avec des clients, et Les Fondamentaux de l’IA sont le bon point de départ si tu veux d’abord poser les bases. Pour creuser la conformité, il y a Conformité RGPD et IA Act (niveau avancé).

Et toi, tu fais déjà tes comptes rendus à partir de tes enregistrements ? Dis-moi en commentaire ce qui t’a fait gagner du temps, et surtout ce que la transcription a raté en français.

Sources

Textes et autorités françaises

Pages citées comme exemples d’affirmations périmées

OpenAI et recherche

Développe de Vraies Compétences IA

Cours pas à pas avec quiz et certificats pour ton CV