
Ces dernières années, les grands modèles de langage sont allés bien au-delà des simples questions-réponses.
Ils ont d'abord appris à écrire du code. Puis ils ont obtenu un accès aux terminaux, aux fichiers, aux navigateurs et aux environnements de développement. OpenAI vient de montrer une étape supplémentaire : GPT-5.6 Sol peut participer directement à des expériences réalisées sur du matériel de calcul quantique réel.
Dans le cadre d'un travail mené avec des chercheurs du MIT, GPT-5.6 Sol a été relié via Codex à un environnement de laboratoire contenant des qubits supraconducteurs. Le modèle a pu interagir avec les logiciels expérimentaux, sélectionner des paramètres de mesure, analyser les données produites et adapter les mesures suivantes.
Cela ne signifie pas qu'un système d'IA est soudainement devenu un physicien quantique autonome.
Mais cette démonstration révèle quelque chose de potentiellement plus important pour l'avenir des agents IA : un modèle peut désormais opérer dans un véritable workflow scientifique, où ses actions produisent des mesures physiques et pas seulement du texte ou des sorties logicielles.
De l'agent de code à l'opérateur expérimental
L'expérience portait principalement sur la calibration et la caractérisation de qubits supraconducteurs.
La calibration est une étape fondamentale du calcul quantique. Les qubits sont des systèmes extrêmement sensibles, dont le comportement évolue avec le temps. Les chercheurs doivent mesurer régulièrement certains paramètres, vérifier que le matériel reste dans les conditions attendues et ajuster les réglages expérimentaux.
Ce processus combine souvent la manipulation de logiciels et un véritable jugement scientifique.
Un expérimentateur peut devoir :
- inspecter l'état actuel du dispositif ;
- sélectionner des paramètres de mesure adaptés ;
- lancer des séquences de mesures ;
- analyser les données obtenues ;
- déterminer si le résultat est fiable ;
- modifier les paramètres si nécessaire ;
- recommencer le processus ;
- enregistrer les résultats pour les expériences suivantes.
Traditionnellement, un chercheur réalise ces étapes manuellement à l'aide d'un ensemble de scripts, d'instruments de laboratoire et de logiciels d'analyse.
Dans la démonstration d'OpenAI et du MIT, GPT-5.6 Sol a pris en charge une partie de cette boucle opérationnelle.
Le modèle avait accès aux instructions propres aux mesures, aux logiciels expérimentaux, aux informations sur la puce, aux résultats précédents, aux journaux et aux outils d'analyse. Il pouvait décider quels paramètres tester, exécuter les procédures correspondantes et examiner les mesures reçues.
Si un résultat était ambigu, il pouvait ajuster la mesure suivante au lieu de simplement s'arrêter.
C'est cette capacité à observer, agir puis s'adapter qui rend la démonstration particulièrement intéressante.
L'expérience a produit un retour du monde réel
La plupart des agents IA opèrent dans des environnements où l'échec est facile à détecter.
Un compilateur renvoie une erreur. Une suite de tests échoue. Une API répond avec un code d'erreur.
Les expériences scientifiques sont moins prévisibles.
Une commande peut s'exécuter parfaitement tout en produisant une mesure bruitée, ambiguë ou physiquement dépourvue de sens.
Un agent doit donc faire plus qu'exécuter des commandes. Il doit interpréter le résultat et décider de la suite.
C'est l'une des raisons pour lesquelles le matériel quantique constitue un environnement de test intéressant pour les agents IA avancés.
Le modèle doit composer avec un système dans lequel :
- les mesures contiennent du bruit statistique ;
- les caractéristiques du matériel peuvent dériver ;
- la calibration est déterminante ;
- les paramètres expérimentaux interagissent entre eux ;
- une exécution réussie ne garantit pas un résultat utile.
GPT-5.6 Sol a donc dû fonctionner dans une boucle de rétroaction plutôt que suivre une séquence de commandes figée.
Dans certaines parties de l'expérience, le système a pu continuer à effectuer des mesures pendant plusieurs heures avec une intervention humaine limitée. Cela se rapproche davantage du comportement attendu d'un véritable agent de recherche que de celui d'un chatbot classique.
Ce que GPT-5.6 Sol a réellement fait
La distinction la plus importante est celle entre découverte scientifique et opération scientifique.
Les travaux publiés ne montrent pas GPT-5.6 Sol en train d'inventer seul une nouvelle théorie de la mécanique quantique ou de découvrir un nouvel algorithme quantique.
La démonstration montre plutôt qu'un agent IA peut effectuer des tâches opérationnelles qui nécessiteraient normalement un chercheur ou un ingénieur expérimental.
Il s'agit notamment de sélectionner des paramètres expérimentaux, de contrôler les logiciels de mesure, d'interpréter les résultats et d'adapter les mesures suivantes.
Le modèle pouvait également travailler avec le code environnant.
C'est important, car la recherche en laboratoire dépend rarement d'un programme unique. Les environnements expérimentaux contiennent généralement plusieurs scripts, outils d'analyse, interfaces avec les appareils, fichiers de configuration et mesures historiques.
Un agent efficace doit comprendre cet environnement comme un système cohérent.
C'est précisément le type de capacité pour lequel les agents de programmation modernes sont de plus en plus conçus.
Pourquoi GPT-5.6 Sol est adapté à ce type de tâche
GPT-5.6 Sol a été conçu pour des workflows complexes faisant intervenir le raisonnement, des outils et une exécution prolongée.
OpenAI rapporte un score de 88,8 % sur Terminal-Bench 2.1, qui passe à 91,9 % avec Ultra, ainsi que 72,7 % sur DeepSWE v1.1.
Ces benchmarks ne sont pas des tests de calcul quantique.
Ils évaluent néanmoins des aptitudes importantes dans un environnement expérimental : naviguer dans des projets logiciels, utiliser un terminal, modifier du code, récupérer après un échec et mener à bien des tâches nécessitant de nombreuses actions séquentielles.
L'expérience quantique combine plusieurs de ces capacités avec une difficulté nouvelle : le retour d'un matériel physique.
La boucle devient beaucoup plus exigeante :
raisonner → exécuter → mesurer → interpréter → ajuster → exécuter à nouveau
La qualité de la réponse finale n'est plus le seul critère.
La qualité du processus compte également.
Ultra ajoute une autre dimension
Le mode Ultra d'OpenAI est également pertinent ici.
Ultra coordonne par défaut quatre agents GPT-5.6 Sol travaillant en parallèle. Cette architecture peut être utile lorsqu'un problème comporte plusieurs aspects pouvant être étudiés indépendamment.
Dans un environnement de recherche, un agent pourrait inspecter le code pendant qu'un autre analyse les mesures et qu'un troisième vérifie les hypothèses expérimentales.
Le parallélisme ne rend pas automatiquement une réponse correcte. Plusieurs agents peuvent partager la même hypothèse erronée.
Mais il permet d'explorer davantage de possibilités, d'effectuer des vérifications supplémentaires et de diviser les workflows complexes en tâches spécialisées.
L'évolution importante ne concerne donc pas seulement les capacités des modèles individuels.
L'architecture d'agents qui les entoure devient elle aussi plus sophistiquée.
Les humains restent dans la boucle
Il ne faut pas interpréter cette expérience comme la preuve que les laboratoires n'ont plus besoin de chercheurs.
L'étude de cas du MIT met elle-même en évidence plusieurs limites.
Les physiciens expérimentaux expérimentés disposent encore d'une intuition forgée par des années de travail avec des systèmes physiques. Ils peuvent parfois reconnaître plus vite qu'un agent automatisé une mesure inhabituelle ou un comportement anormal du matériel.
Les modèles peuvent également partir de mauvaises hypothèses.
Dans un workflow expérimental long, une petite erreur commise au début peut influencer de nombreuses décisions ultérieures.
Les environnements scientifiques nécessitent donc de solides garde-fous opérationnels :
- des journaux complets des expériences ;
- la conservation des mesures brutes ;
- des permissions clairement définies ;
- des configurations reproductibles ;
- un suivi des versions des logiciels et des modèles ;
- une revue humaine pour les conclusions scientifiques importantes.
L'objectif n'est pas de retirer les scientifiques de la boucle.
Il s'agit d'automatiser davantage le travail opérationnel répétitif qui les entoure.
L'histoire dépasse largement le calcul quantique
Le calcul quantique rend la démonstration impressionnante, mais ses implications dépassent largement les laboratoires quantiques.
Pendant des années, la plupart des interactions avec les systèmes d'IA ont suivi le même schéma :
humain → prompt → modèle → réponse
Les agents ont changé ce modèle.
Ils y ont introduit des outils :
humain → objectif → modèle → outils → actions → résultat
Les agents scientifiques ajoutent une étape supplémentaire :
humain → objectif → agent → système physique → mesure → agent → action suivante
Lorsque les modèles pourront fonctionner de manière fiable dans ce type de boucle, de nombreux autres domaines deviendront accessibles.
L'automatisation de laboratoire est un exemple évident, mais les mêmes principes peuvent s'appliquer aux tests industriels, à la robotique, aux simulations d'ingénierie, aux infrastructures réseau et à tout système où les actions produisent des résultats externes mesurables.
C'est pourquoi l'expérience d'OpenAI et du MIT concerne aussi les développeurs qui ne s'intéressent pas au calcul quantique.
Elle montre la direction prise par les systèmes d'IA : devenir des opérateurs d'environnements complexes, et plus seulement des interfaces capables de générer de l'information.
Vers une infrastructure scientifique native pour les agents
Une autre conséquence est à prévoir.
Si les agents participent de plus en plus aux expériences, les logiciels de laboratoire devront eux aussi évoluer.
Les systèmes expérimentaux actuels sont généralement conçus autour d'opérateurs humains. Les plateformes de demain pourraient exposer des interfaces structurées spécialement pensées pour les agents IA :
- des états de dispositifs lisibles par machine ;
- des systèmes de permission explicites ;
- des API d'expérimentation standardisées ;
- des enregistrements de mesures immuables ;
- un suivi automatique de la provenance ;
- des erreurs structurées ;
- des environnements d'exécution reproductibles.
Au lieu de forcer les modèles à imiter un humain qui clique dans un logiciel de laboratoire, les chercheurs pourraient leur fournir des interfaces contrôlées pour interagir avec les équipements en toute sécurité.
La même transformation commence déjà dans le développement logiciel, où les agents de programmation sont plus efficaces lorsque les dépôts, les outils et les environnements d'exécution sont structurés pour eux.
Le calcul scientifique pourrait suivre une trajectoire comparable.
L'efficacité compte autant que l'intelligence
Un autre aspect important de GPT-5.6 est son efficacité.
Les agents complexes peuvent générer énormément de tokens et effectuer de nombreux appels d'outils pour résoudre un seul problème. Lorsqu'un agent fonctionne en continu, la facture augmente rapidement.
Selon les chiffres publiés autour du lancement de GPT-5.6, Sol obtient de solides résultats dans les évaluations d'agents de programmation tout en nécessitant sensiblement moins de tokens de sortie et moins de temps d'exécution que certains systèmes concurrents.
Cela compte pour les applications scientifiques.
Un agent de laboratoire peut réaliser des centaines d'actions intermédiaires au cours d'une seule session. Le coût, la latence et la fiabilité deviennent donc aussi importants que la précision sur les benchmarks.
Cela explique également la structure de la famille GPT-5.6 :
Sol pour les raisonnements les plus exigeants et les workflows d'agents complexes.
Terra pour les usages professionnels généralistes qui doivent conserver un équilibre entre coût et capacités.
Luna pour les tâches à fort volume et faible latence.
Un futur système de recherche n'utiliserait pas nécessairement Sol pour tout. Un agent puissant pourrait gérer la planification expérimentale et les analyses difficiles, tandis que des modèles plus légers traiteraient les journaux, classeraient les mesures ou extrairaient les métadonnées.
Les systèmes d'agents pourraient de plus en plus ressembler à des architectures logicielles composées de plusieurs modèles spécialisés plutôt qu'à un modèle unique chargé de répondre à toutes les demandes.
Le véritable jalon
L'aspect le plus intéressant de cette expérience n'est pas que GPT-5.6 Sol connaisse certains éléments de mécanique quantique.
Les modèles modernes obtiennent déjà de bons résultats dans de nombreux benchmarks scientifiques.
La différence essentielle est que le modèle a été connecté à un environnement dans lequel ses décisions avaient des conséquences mesurables.
Il pouvait effectuer une action.
Le matériel produisait un résultat.
Le modèle pouvait examiner ce résultat.
Et l'action suivante pouvait changer en fonction de ce qu'il avait observé.
Cette boucle de rétroaction constitue l'un des fondements des systèmes autonomes.
Nous sommes encore loin de laboratoires scientifiques entièrement autonomes, et la fiabilité reste un défi majeur.
Mais la frontière entre les assistants IA et les opérateurs IA devient de plus en plus difficile à ignorer.
Conclusion
Le travail de GPT-5.6 Sol sur des expériences menées avec des qubits supraconducteurs représente une évolution importante des agents IA.
Le modèle n'a pas découvert seul une nouvelle loi de la physique. Il a démontré quelque chose de plus concret : un agent IA peut prendre en charge une partie d'un workflow expérimental réel, contrôler des logiciels de laboratoire, analyser des mesures physiques et adapter ses actions au fil du temps.
Cette avancée pourrait finalement compter davantage qu'un nouveau record sur un benchmark.
La prochaine génération de systèmes d'IA sera de plus en plus évaluée non seulement sur les réponses produites, mais aussi sur la fiabilité avec laquelle elle interagit avec des systèmes complexes, utilise des outils, réagit à des résultats inattendus et mène des workflows réels de bout en bout.
Le calcul quantique est simplement l'un des premiers domaines où cette transition devient visible.
Sources
Tester l’API RouterLab
Passez d’un article à une requête réelle : créez un essai, récupérez une clé et appelez les modèles depuis une API compatible OpenAI.