OpenAI poursuit l'évolution de son écosystème d'intelligence artificielle en déployant une nouvelle version de ChatGPT Voice sur son application de bureau pour macOS et Windows. Cette mise à jour introduit des fonctionnalités avancées permettant aux utilisateurs d'interagir avec leur ordinateur à la voix, de piloter plusieurs agents d'intelligence artificielle et d'exécuter des tâches complexes sans utiliser le clavier.
Cette évolution marque une nouvelle étape dans la stratégie d'OpenAI, qui entend faire de ChatGPT un véritable assistant numérique capable d'accompagner les utilisateurs dans leurs activités quotidiennes et professionnelles.
Une interaction vocale plus naturelle
Au cœur de cette nouveauté figure GPT-Live, une technologie conversationnelle capable d'écouter, de parler et de coordonner simultanément plusieurs actions.
Contrairement aux assistants vocaux traditionnels fonctionnant par échanges successifs, GPT-Live repose sur une architecture permettant une conversation fluide, sans interruption systématique entre les demandes de l'utilisateur et les réponses de l'assistant.
Cette approche vise à rendre les interactions plus naturelles tout en accélérant l'exécution des tâches.
Un ordinateur piloté à la voix
Grâce à cette nouvelle version, les utilisateurs peuvent demander oralement à ChatGPT de consulter leur agenda, préparer une réunion, rédiger un courrier électronique ou encore effectuer des recherches dans différentes applications.
L'assistant est également capable de naviguer sur des sites web, d'interagir avec des logiciels et de coordonner plusieurs agents spécialisés, notamment via les environnements ChatGPT Work et Codex.
Lors de démonstrations techniques, OpenAI a présenté des scénarios dans lesquels une seule commande vocale permettait d'ouvrir une nouvelle discussion, de créer une demande de fusion de code (pull request) ou encore d'identifier l'origine d'un dysfonctionnement dans un projet informatique.
Des capacités renforcées sur macOS
Les utilisateurs de macOS bénéficient également d'une fonctionnalité baptisée Appshots, qui permet à ChatGPT d'analyser le contenu affiché à l'écran afin de mieux comprendre le contexte de travail.
Cette technologie prend notamment en compte certains éléments d'accessibilité, comme les descriptions alternatives des contenus visuels, et facilite le traitement de plusieurs dossiers appartenant à un même projet local.
L'objectif est d'offrir une assistance plus pertinente lors des tâches de développement, de rédaction ou d'organisation.
Une concurrence de plus en plus intense
Le lancement de cette version intervient dans un contexte de forte compétition entre les principaux acteurs de l'intelligence artificielle générative.
Au même moment, Anthropic a annoncé une évolution du mode vocal de son assistant Claude, désormais compatible avec plusieurs modèles et capable d'interagir avec des applications connectées telles que Gmail, Google Calendar, Slack, Notion ou Canva.
Toutefois, les deux approches diffèrent sur le plan technique. Là où Claude fonctionne selon un schéma classique alternant écoute et réponse, GPT-Live privilégie un traitement continu permettant d'écouter et de répondre simultanément.
Un déploiement réservé aux offres payantes
La nouvelle version de ChatGPT Voice est progressivement accessible aux abonnés des formules Plus, Pro, Business, Edu et Enterprise.
OpenAI indique également que la fonctionnalité est disponible dans l'application de bureau ainsi que dans Codex sur iOS grâce à un système d'accès à distance permettant de contrôler son ordinateur depuis un smartphone. Une version destinée aux utilisateurs Android est attendue dans les prochaines semaines.
Avec cette évolution, OpenAI poursuit son ambition de transformer ChatGPT en une plateforme capable d'assister les utilisateurs bien au-delà de la simple conversation, en intégrant des fonctions de productivité, de développement logiciel et d'automatisation directement pilotées par la voix.