La nouvelle voix de ChatGPT te parle pendant que tu parles

GPT-Live a remplacé le mode vocal de ChatGPT le 8 juillet. Le full-duplex expliqué, qui a quelle version en gratuit, comment le trouver, et ce qui coince.

Le truc qui trahissait la machine, ça n’a jamais été la voix. C’était l’attente. Tu t’arrêtes, un blanc, puis ça répond. Tous les assistants vocaux depuis Siri ont eu ce blanc, parce qu’au fond ils marchaient tous pareil : attendre que l’humain finisse, puis répondre.

Le 8 juillet, OpenAI a remplacé le mode vocal de ChatGPT par un truc conçu autrement. GPT-Live écoute et parle en même temps — il peut glisser un « mhmm » pendant que tu es au milieu d’une phrase, rester tranquille quand tu marques une pause pour réfléchir au lieu de te couper, et encaisser une interruption sans perdre le fil. Si tu utilises déjà ChatGPT à la voix, la mise à jour est arrivée toute seule. Si tu as essayé le vocal une fois avant de laisser tomber, c’est la semaine pour réessayer.

On avait détaillé comment parler à ChatGPT à la voix la semaine dernière — ce guide-là tient toujours. Du coup ici, c’est la couche actu : ce qui a vraiment changé, qui a quelle version, et là où la nouvelle voix se plante.

La campagne de lancement rétro d’OpenAI pour la toute nouvelle voix de ChatGPT, avec trois femmes âgées en train de discuter avec un téléphone, légendée « Propulsé par GPT-Live-1 »
La campagne de lancement d’OpenAI mise pile sur le public que la voix sert le mieux — les gens qui préfèrent parler que taper. Source : OpenAI

Ce qui a changé, en une minute

Le mode vocal était à tour de rôle. L’ancien système (le mode vocal avancé) était un seul modèle qui gérait l’audio de bout en bout, mais il attendait quand même le silence avant de répondre — d’où la pause de réflexion qui te faisait couper, et le bruit de fond qui terminait parfois ton tour à ta place.

GPT-Live, lui, est full-duplex : il traite ce qu’il entend et ce qu’il dit en même temps, en prenant des micro-décisions plusieurs fois par seconde — continuer à écouter, parler maintenant, se taire, aller chercher une info. Trois différences concrètes :

  • Tu peux le couper en pleine phrase et il s’adapte au lieu de repartir de zéro.
  • Il fait des petits signaux — des « ouais », « d’accord » pendant que tu parles, comme quelqu’un qui écoute vraiment.
  • Il attend quand tu réfléchis. Une phrase qui traîne ne déclenche plus une réponse à une demi-question.
Pourquoi toutes les voix IA sonnaient robot — et ce qui a changé le 8 juillet
🤖 Avant : à tour de rôle
Parle, attends, écoute
attend le silence avant de répondre · une pause de réflexion = il te coupe · une interruption casse le fil
🗣️ Après : full-duplex
Écoute en parlant
décide plusieurs fois par seconde : parler, attendre ou écouter · « mhmm » pendant que tu parles · se tait quand tu réfléchis

Il y a un deuxième changement, plus discret : GPT-Live n’est que la couche conversation. Quand tu demandes un truc dur, il refile la question en douce à un modèle plus costaud en coulisse (GPT-5.5 pour l’instant) et réintègre la réponse dans l’échange. Demande la météo ou une action en Bourse et il peut désormais faire apparaître une petite carte visuelle à l’écran — météo, Bourse, sport et cartes au lancement — tout en continuant à parler.

Qui a quoi (et ce que ça coûte)

Tout le monde l’a eu automatiquement — pas de bouton à trouver. La répartition :

PlanModèle de voixLes petites lignes
FreeGPT-Live-1 miniRéponses instantanées seulement ; environ 2 h de voix par jour
Go / Plus / ProGPT-Live-1Ajoute les réglages « réflexion » Medium et High ; usage quasi illimité

Deux notes de terrain de la semaine de lancement. L’usage payant est « quasi illimité », mais les grosses sessions tapent quand même un plafond — un utilisateur a fait tourner un quiz de vocabulaire anglais en faisant le ménage et a eu environ 20 minutes sur le modèle complet avant que ça bascule discrètement sur mini (son verdict : bien plus naturel qu’avant, quand même). Et les conversations d’arrière-plan se coupent d’elles-mêmes au bout d’une heure environ par session.

Pour le lancer : l’icône micro en bas à droite dans l’app mobile, ou à droite de la barre de message sur le web. Les mêmes neuf voix qu’avant — remastérisées pour le nouveau système et nettement meilleures pour rester intelligibles par-dessus la circulation ou le bruit de la cuisine.

À quoi c’est vraiment bon

Le tour de parole naturel, ce n’est pas qu’un gadget de démo ; en fait, ça change carrément les tâches que la voix peut encaisser :

  • Pratiquer une langue. C’est LA killer feature. Le rythme d’une vraie conversation — les interruptions, les hésitations, le fait d’être poliment attendu — c’est ce qu’aucun manuel ne peut te donner. Et pour nous en France, où « je comprends l’anglais mais j’ose pas le parler » est un classique national, avoir un interlocuteur infiniment patient dans la poche, ça vaut de l’or. La recherche sur l’IA conversationnelle pour l’apprentissage des langues est plutôt encourageante (une méta-analyse de 2024 sur 31 études trouve un effet positif solide sur l’apprentissage d’une langue seconde, et des études contrôlées relèvent régulièrement une baisse de l’anxiété à l’oral), avec un bémol honnête : personne n’a encore étudié formellement cette génération de voix full-duplex. Des utilisateurs enchaînent déjà des exercices de vocabulaire en pliant le linge.
  • Les moments mains occupées. Cuisiner, conduire, marcher — les endroits où la manie de couper de l’ancien mode était la plus relou, c’est là que le full-duplex brille.
  • Penser à voix haute. Débobiner une décision à l’oral marche mieux quand l’autre sait quand se taire.
  • Les enfants et les proches âgés. Un parent l’a raconté à la sortie : son gamin de quatre ans a tenu une vraie conversation à double sens avec. L’interface, c’est la parole — aucune UI à apprendre.

Là où ça coince (le consensus des premiers utilisateurs)

Section honnête, tirée de trois jours de vraies réactions :

  • Certains regrettent l’ancienne voix. La plainte la plus fréquente n’est pas technique, elle est de ton : les nouvelles voix paraissent à certains plus plates, « plus plastique », moins chaleureuses que le mode vocal avancé. Les avis divergent ; teste et juge.
  • Il peut être trop pressé de parler. Le full-duplex coupe dans les deux sens — un système autorisé à intervenir intervient parfois quand tu ne voulais pas. Quelques utilisateurs trouvent les interruptions agressives.
  • La latence du lancement a piqué pour certains. Le trafic du premier jour a rendu l’« instantané » tout sauf instantané, sur une partie du déploiement. Ce genre de souci se tasse d’habitude en quelques jours.
  • Le mini du tier gratuit, c’est le même tour de magie, un cerveau plus petit. Le flux conversationnel est là, mais il réfléchit au niveau Instant seulement — nickel pour discuter et s’entraîner, plus léger pour les vraies questions.
  • L’intelligence vient toujours du modèle derrière. GPT-Live rend la conversation humaine ; il ne rend pas les réponses plus justes. Vérifie tout ce qui compte, comme à l’écrit.

En résumé

La voix, c’était la fonction de ChatGPT que tout le monde a essayée une fois avant de laisser tomber en douce. GPT-Live corrige le truc précis qui la rendait pénible — le rythme — et donne au tier gratuit une vraie version de la chose. D’ailleurs, le blanc gênant qui trahissait encore ChatGPT Voice, comme le note Blog du Modérateur, disparaît enfin. Confie-lui une tâche mains occupées cette semaine : un exo de langue, une décision à débobiner à voix haute, la préparation du dîner avec questions à la volée. Tu sauras en dix minutes si c’est pour toi.

Et si tu veux devenir vraiment bon pour diriger l’IA — voix ou texte, quel que soit le prochain nom qu’OpenAI lui collera — les fondamentaux ne changent pas. Vu que le meilleur usage de la voix, c’est de bosser ton oral, Apprendre l’anglais avec l’IA transforme la nouvelle voix en coach de poche, et Fondamentaux de l’IA pose le raisonnement en dessous.

Sources

Développe de Vraies Compétences IA

Cours pas à pas avec quiz et certificats pour ton CV