
In den vergangenen Jahren sind große Sprachmodelle weit über einfache Frage-und-Antwort-Systeme hinausgewachsen.
Zunächst lernten sie, Code zu schreiben. Dann erhielten sie Zugriff auf Terminals, Dateien, Browser und Entwicklungsumgebungen. OpenAI hat nun einen weiteren Schritt gezeigt: GPT-5.6 Sol kann direkt an Experimenten mit echter Quantencomputer-Hardware teilnehmen.
Im Rahmen einer Zusammenarbeit mit Forschern des MIT wurde GPT-5.6 Sol über Codex mit einer Laborumgebung verbunden, die supraleitende Qubits enthielt. Das Modell konnte mit der Experimentiersoftware interagieren, Messparameter auswählen, die erzeugten Daten analysieren und die folgenden Messungen anpassen.
Das bedeutet nicht, dass ein KI-System plötzlich zu einem autonomen Quantenphysiker geworden ist.
Die Demonstration zeigt jedoch etwas, das für die Zukunft von KI-Agenten möglicherweise wichtiger ist: Ein Modell kann in einem echten wissenschaftlichen Workflow arbeiten, in dem seine Aktionen physische Messungen erzeugen und nicht nur Text oder Softwareausgaben.
Vom Code-Agenten zum experimentellen Operator
Das Experiment befasste sich hauptsächlich mit der Kalibrierung und Charakterisierung supraleitender Qubits.
Die Kalibrierung ist ein grundlegender Schritt des Quantencomputings. Qubits sind äußerst empfindliche Systeme, deren Verhalten sich mit der Zeit verändert. Forschende müssen bestimmte Parameter regelmäßig messen, prüfen, ob die Hardware innerhalb der erwarteten Bedingungen bleibt, und die experimentellen Einstellungen anpassen.
Dieser Prozess verbindet häufig Softwarebedienung mit echtem wissenschaftlichem Urteilsvermögen.
Ein Experimentator muss möglicherweise:
- den aktuellen Zustand des Geräts prüfen;
- geeignete Messparameter auswählen;
- Messsequenzen starten;
- die erhaltenen Daten analysieren;
- entscheiden, ob das Ergebnis zuverlässig ist;
- die Parameter bei Bedarf ändern;
- den Prozess wiederholen;
- die Ergebnisse für spätere Experimente speichern.
Traditionell führt ein Forscher diese Schritte manuell mit einer Kombination aus Skripten, Laborinstrumenten und Analysesoftware durch.
In der Demonstration von OpenAI und dem MIT übernahm GPT-5.6 Sol einen Teil dieser operativen Schleife.
Das Modell hatte Zugriff auf die messungsspezifischen Anweisungen, die Experimentiersoftware, Informationen über den Chip, frühere Ergebnisse, Logs und Analysetools. Es konnte entscheiden, welche Parameter getestet werden sollten, die entsprechenden Verfahren ausführen und die erhaltenen Messungen untersuchen.
Wenn ein Ergebnis mehrdeutig war, konnte es die nächste Messung anpassen, statt einfach anzuhalten.
Diese Fähigkeit, zu beobachten, zu handeln und sich anschließend anzupassen, macht die Demonstration besonders interessant.
Das Experiment lieferte Rückmeldungen aus der realen Welt
Die meisten KI-Agenten arbeiten in Umgebungen, in denen sich Fehler leicht erkennen lassen.
Ein Compiler gibt einen Fehler zurück. Eine Testsuite schlägt fehl. Eine API antwortet mit einem Fehlercode.
Wissenschaftliche Experimente sind weniger vorhersehbar.
Ein Befehl kann völlig korrekt ausgeführt werden und dennoch eine verrauschte, mehrdeutige oder physikalisch bedeutungslose Messung erzeugen.
Ein Agent muss daher mehr tun, als Befehle auszuführen. Er muss das Ergebnis interpretieren und über den nächsten Schritt entscheiden.
Das ist einer der Gründe, warum Quantenhardware eine interessante Testumgebung für fortgeschrittene KI-Agenten darstellt.
Das Modell muss mit einem System umgehen, in dem:
- Messungen statistisches Rauschen enthalten;
- sich die Eigenschaften der Hardware verschieben können;
- die Kalibrierung entscheidend ist;
- experimentelle Parameter miteinander interagieren;
- eine erfolgreiche Ausführung kein nützliches Ergebnis garantiert.
GPT-5.6 Sol musste daher in einer Feedbackschleife arbeiten, statt eine festgelegte Befehlssequenz abzuarbeiten.
In Teilen des Experiments konnte das System über mehrere Stunden Messungen durchführen, wobei nur begrenzt menschliches Eingreifen erforderlich war. Das ähnelt eher dem erwarteten Verhalten eines echten Forschungsagenten als dem eines klassischen Chatbots.
Was GPT-5.6 Sol tatsächlich getan hat
Die wichtigste Unterscheidung liegt zwischen wissenschaftlicher Entdeckung und wissenschaftlichem Betrieb.
Die veröffentlichten Arbeiten zeigen nicht, dass GPT-5.6 Sol selbstständig eine neue Theorie der Quantenmechanik erfunden oder einen neuen Quantenalgorithmus entdeckt hat.
Die Demonstration zeigt vielmehr, dass ein KI-Agent operative Aufgaben ausführen kann, für die normalerweise ein Forscher oder experimenteller Ingenieur nötig wäre.
Dazu gehören die Auswahl experimenteller Parameter, die Steuerung der Messsoftware, die Interpretation von Ergebnissen und die Anpassung nachfolgender Messungen.
Das Modell konnte außerdem mit dem umgebenden Code arbeiten.
Das ist wichtig, weil die Forschung im Labor selten von einem einzigen Programm abhängt. Experimentierumgebungen enthalten normalerweise mehrere Skripte, Analysetools, Geräteschnittstellen, Konfigurationsdateien und historische Messungen.
Ein effektiver Agent muss diese Umgebung als zusammenhängendes System verstehen.
Genau für diese Art von Fähigkeit werden moderne Programmieragenten zunehmend entwickelt.
Warum GPT-5.6 Sol für diese Aufgabe geeignet ist
GPT-5.6 Sol wurde für komplexe Workflows entwickelt, die Reasoning, Tools und eine längere Ausführung verbinden.
OpenAI berichtet einen Wert von 88,8 % auf Terminal-Bench 2.1, der mit Ultra auf 91,9 % steigt, sowie 72,7 % auf DeepSWE v1.1.
Diese Benchmarks testen kein Quantencomputing.
Sie bewerten jedoch Fähigkeiten, die in einer experimentellen Umgebung wichtig sind: Softwareprojekte navigieren, ein Terminal verwenden, Code ändern, sich von Fehlern erholen und Aufgaben mit vielen aufeinanderfolgenden Aktionen abschließen.
Das Quantenexperiment verbindet mehrere dieser Fähigkeiten mit einer neuen Schwierigkeit: Rückmeldungen von physischer Hardware.
Die Schleife wird deutlich anspruchsvoller:
reasoning → ausführen → messen → interpretieren → anpassen → erneut ausführen
Nicht nur die Qualität der endgültigen Antwort ist entscheidend.
Auch die Qualität des Prozesses zählt.
Ultra fügt eine weitere Dimension hinzu
Auch OpenAIs Ultra-Modus ist hier relevant.
Ultra koordiniert standardmäßig vier parallel arbeitende GPT-5.6-Sol-Agenten. Diese Architektur kann hilfreich sein, wenn ein Problem mehrere Aspekte umfasst, die unabhängig voneinander untersucht werden können.
In einer Forschungsumgebung könnte ein Agent den Code prüfen, während ein anderer die Messungen analysiert und ein dritter die experimentellen Hypothesen kontrolliert.
Parallelität macht eine Antwort nicht automatisch korrekt. Mehrere Agenten können dieselbe falsche Annahme teilen.
Sie ermöglicht jedoch die Untersuchung weiterer Möglichkeiten, zusätzliche Prüfungen und die Aufteilung komplexer Workflows in spezialisierte Aufgaben.
Die wichtige Entwicklung betrifft daher nicht nur die Fähigkeiten einzelner Modelle.
Auch die Agentenarchitektur um diese Modelle herum wird ausgefeilter.
Menschen bleiben in der Schleife
Dieses Experiment darf nicht als Beweis verstanden werden, dass Labore keine Forscher mehr benötigen.
Die MIT-Fallstudie weist selbst auf mehrere Grenzen hin.
Erfahrene experimentelle Physiker verfügen über eine durch jahrelange Arbeit mit physikalischen Systemen entwickelte Intuition. Sie können eine ungewöhnliche Messung oder ein abweichendes Hardwareverhalten manchmal schneller erkennen als ein automatisierter Agent.
Modelle können außerdem von falschen Annahmen ausgehen.
In einem langen experimentellen Workflow kann ein kleiner Fehler zu Beginn viele spätere Entscheidungen beeinflussen.
Wissenschaftliche Umgebungen benötigen daher starke operative Schutzmechanismen:
- vollständige Versuchsprotokolle;
- die Aufbewahrung der Rohmessungen;
- klar definierte Berechtigungen;
- reproduzierbare Konfigurationen;
- Versionsverfolgung für Software und Modelle;
- eine menschliche Prüfung wichtiger wissenschaftlicher Schlussfolgerungen.
Das Ziel besteht nicht darin, Wissenschaftler aus der Schleife zu entfernen.
Es geht darum, die repetitive operative Arbeit in ihrem Umfeld stärker zu automatisieren.
Die Geschichte geht weit über Quantencomputing hinaus
Quantencomputing macht die Demonstration beeindruckend, aber ihre Auswirkungen reichen weit über Quantenlabore hinaus.
Jahrelang folgten die meisten Interaktionen mit KI-Systemen demselben Muster:
Mensch → Prompt → Modell → Antwort
Agenten haben dieses Modell verändert.
Sie fügten Tools hinzu:
Mensch → Ziel → Modell → Tools → Aktionen → Ergebnis
Wissenschaftliche Agenten ergänzen einen weiteren Schritt:
Mensch → Ziel → Agent → physisches System → Messung → Agent → nächste Aktion
Wenn Modelle zuverlässig in solchen Schleifen arbeiten können, werden viele weitere Bereiche zugänglich.
Laborautomatisierung ist ein offensichtliches Beispiel. Dieselben Prinzipien können jedoch auf industrielle Tests, Robotik, technische Simulationen, Netzwerkinfrastrukturen und jedes System angewandt werden, in dem Aktionen messbare externe Ergebnisse erzeugen.
Deshalb betrifft das Experiment von OpenAI und dem MIT auch Entwickler, die sich nicht für Quantencomputing interessieren.
Es zeigt die Richtung, in die sich KI-Systeme bewegen: Sie werden zu Operatoren komplexer Umgebungen und nicht nur zu Schnittstellen, die Informationen erzeugen.
Auf dem Weg zu einer wissenschaftlichen Infrastruktur für Agenten
Eine weitere Konsequenz ist absehbar.
Wenn Agenten zunehmend an Experimenten teilnehmen, müssen sich auch Laborsoftwaresysteme weiterentwickeln.
Die heutigen Experimentiersysteme sind in der Regel auf menschliche Bediener ausgerichtet. Die Plattformen von morgen könnten strukturierte Schnittstellen anbieten, die speziell für KI-Agenten gedacht sind:
- maschinenlesbare Gerätezustände;
- explizite Berechtigungssysteme;
- standardisierte Experimentier-APIs;
- unveränderliche Messaufzeichnungen;
- automatische Herkunftsverfolgung;
- strukturierte Fehler;
- reproduzierbare Ausführungsumgebungen.
Anstatt Modelle dazu zu zwingen, einen Menschen nachzuahmen, der in einer Laboranwendung klickt, könnten Forscher ihnen kontrollierte Schnittstellen für eine sichere Interaktion mit den Geräten bereitstellen.
Dieselbe Veränderung beginnt bereits in der Softwareentwicklung, wo Programmieragenten effizienter sind, wenn Repositories, Tools und Ausführungsumgebungen auf sie abgestimmt strukturiert sind.
Die wissenschaftliche Datenverarbeitung könnte eine vergleichbare Entwicklung durchlaufen.
Effizienz zählt genauso wie Intelligenz
Ein weiterer wichtiger Aspekt von GPT-5.6 ist seine Effizienz.
Komplexe Agenten können enorme Mengen an Tokens erzeugen und viele Tool-Aufrufe durchführen, um ein einziges Problem zu lösen. Wenn ein Agent dauerhaft arbeitet, steigen die Kosten schnell.
Nach den rund um die Veröffentlichung von GPT-5.6 publizierten Zahlen erzielt Sol bei Bewertungen für Programmieragenten solide Ergebnisse und benötigt dabei deutlich weniger Ausgabetokens und weniger Ausführungszeit als manche Konkurrenzsysteme.
Das ist für wissenschaftliche Anwendungen relevant.
Ein Laboragent kann in einer einzigen Sitzung Hunderte von Zwischenaktionen durchführen. Kosten, Latenz und Zuverlässigkeit werden daher ebenso wichtig wie die Benchmark-Präzision.
Das erklärt auch die Struktur der GPT-5.6-Familie:
Sol für anspruchsvollstes Reasoning und komplexe Agenten-Workflows.
Terra für allgemeine professionelle Anwendungen, die ein Gleichgewicht zwischen Kosten und Fähigkeiten benötigen.
Luna für Aufgaben mit hohem Volumen und geringer Latenz.
Ein zukünftiges Forschungssystem würde Sol nicht unbedingt für alles einsetzen. Ein leistungsfähiger Agent könnte die Planung von Experimenten und schwierige Analysen übernehmen, während leichtere Modelle Logs verarbeiten, Messungen klassifizieren oder Metadaten extrahieren.
Agentensysteme könnten zunehmend wie Softwarearchitekturen aus mehreren spezialisierten Modellen aussehen und nicht wie ein einzelnes Modell, das jede Anfrage beantworten soll.
Der eigentliche Meilenstein
Das Interessanteste an diesem Experiment ist nicht, dass GPT-5.6 Sol bestimmte Aspekte der Quantenmechanik kennt.
Moderne Modelle erzielen bereits in vielen wissenschaftlichen Benchmarks gute Ergebnisse.
Der entscheidende Unterschied ist, dass das Modell mit einer Umgebung verbunden wurde, in der seine Entscheidungen messbare Konsequenzen hatten.
Es konnte eine Aktion ausführen.
Die Hardware erzeugte ein Ergebnis.
Das Modell konnte dieses Ergebnis untersuchen.
Und die nächste Aktion konnte sich auf Grundlage seiner Beobachtung ändern.
Diese Feedbackschleife gehört zu den Grundlagen autonomer Systeme.
Wir sind noch weit von vollständig autonomen wissenschaftlichen Laboren entfernt, und Zuverlässigkeit bleibt eine große Herausforderung.
Doch die Grenze zwischen KI-Assistenten und KI-Operatoren wird immer schwerer zu ignorieren.
Fazit
Die Arbeit von GPT-5.6 Sol an Experimenten mit supraleitenden Qubits stellt eine wichtige Entwicklung für KI-Agenten dar.
Das Modell hat nicht selbstständig ein neues physikalisches Gesetz entdeckt. Es hat etwas Konkreteres gezeigt: Ein KI-Agent kann einen Teil eines realen experimentellen Workflows übernehmen, Laborsoftware steuern, physische Messungen analysieren und seine Aktionen im Laufe der Zeit anpassen.
Diese Entwicklung könnte letztlich wichtiger sein als ein neuer Rekord in einem Benchmark.
Die nächste Generation von KI-Systemen wird zunehmend nicht nur danach bewertet, welche Antworten sie erzeugt, sondern auch danach, wie zuverlässig sie mit komplexen Systemen interagiert, Tools verwendet, auf unerwartete Ergebnisse reagiert und reale Workflows von Anfang bis Ende durchführt.
Quantencomputing ist lediglich einer der ersten Bereiche, in denen dieser Übergang sichtbar wird.
Quellen
Testen Sie die RouterLab-API
Gehen Sie von einem Artikel zu einer tatsächlichen Abfrage über: Erstellen Sie eine Testversion, rufen Sie einen Schlüssel ab und rufen Sie Modelle über eine OpenAI-kompatible API auf.