
Wenn Sie Claude Code (den CLI-Agenten von Anthropic) mit mehreren MCP-Servern (Model Context Protocol) verwenden, sind Sie wahrscheinlich bereits auf dieses frustrierende Problem gestoßen: Ihr Prompt bleibt überschaubar, doch die Tool-Beschreibungen explodieren und verschlingen einen großen Teil des Kontextfensters.
Das Symptom ist tückisch. Das Modell beginnt mit weniger Platz zu Reasonen, die Antworten werden instabiler, und Sie haben den unangenehmen Eindruck, Tokens für technische Handbücher zu „bezahlen“, die Sie in der aktuellen Unterhaltung gar nicht verwenden.
Anthropic hat diesen kritischen Reibungspunkt kürzlich mit MCP Tool Search angegangen – einer Funktion, die die Verwaltung von Tools auf bedarfsgeladenes (lazy loading) Laden umstellt. Darum ist dies eine grundlegende Veränderung für die Skalierbarkeit von KI-Agenten.
Das Problem: Wenn Beschreibungen den Kontext füllen
In der MCP-Architektur stellt jeder Server eine Liste von Tools mit Namen, Parametern, JSON-Schemas und Beschreibungen bereit. Das ist praktisch, damit das Modell weiß, was existiert. In einer realistischen Produktionsumgebung verbindet man jedoch nie nur einen isolierten Server. Typischerweise wird ein ganzes Ökosystem angeschlossen:
- ein Server für das Dateisystem (Git-Repository)
- ein Webserver für die Recherche
- DevOps-Server (CI/CD, Deployment, Logs)
- Business-Server (Datenbank, Jira-Tickets, CRM)
- eine Vielzahl eigener Skripte
Jeder Server kann Dutzende Tools bereitstellen. Bisher arbeitete Claude Code im Eager-Loading-Modus: Alle Definitionen landeten beim Start im Kontext. Dadurch wurde Ihr „mentaler Arbeitsbereich“ (Reasoning, Plan, Code) von unnötigen Definitionen zusammengedrängt.
Genau dieses Anti-Pattern versucht moderne Softwareentwicklung zu vermeiden: Man lädt nicht beim Start vorsichtshalber sämtliche Abhängigkeiten einer Anwendung.
Die Lösung: von „alles laden“ zu „bei Bedarf laden"
MCP Tool Search kehrt diese Dynamik um. Statt alle Tool-Beschreibungen vorab zu laden, indexiert Claude Code die Tools, damit sie entdeckt werden können, und lädt die vollständige Definition nur für Tools, die tatsächlich aufgerufen werden.
Architektonisch ist dies ein Wechsel von Eager Loading zu Lazy Loading. Die Idee ist einfach: Wenn Ihr Katalog 200 Tools enthält, die aktuelle Aufgabe aber nur 3 davon benötigt, dürfen auch nur diese 3 Tools Ihren wertvollen Kontext verbrauchen.
Die technische Schwelle von 10 %
Anthropic hat dieses Verhalten pragmatisch umgesetzt. Standardmäßig arbeitet Tool Search im Modus „auto“. Das System überwacht die Größe der Tool-Definitionen:
- Wenn die Beschreibungen wenig Platz einnehmen, werden sie vorab geladen (schneller).
- Wenn sie ungefähr 10 % des Kontextfensters überschreiten, beendet Claude Code das massenhafte Vorladen.
Ab diesem Punkt wechseln die Tools in den Modus deferred (zurückgestellt). Sie werden nicht mehr in den System-Prompt eingefügt, sondern über einen internen Suchmechanismus zugänglich.
Wie sieht der Ablauf auf Modellebene aus?
Konzeptionell wird die Reasoning-Pipeline des Agenten um einen Entdeckungsschritt erweitert:
- Empfang: Claude erhält Ihren Prompt zusammen mit einem „leichten“ Index der verfügbaren Tools.
- Tool Discovery: Bei Bedarf führt es eine Suche durch, um relevante Tools zu identifizieren.
- Laden: Es lädt die vollständige Definition (Schema und Parameter) nur für die ausgewählten Tools.
- Ausführung: Es ruft die Tools auf und setzt sein Reasoning fort.
Sie verlieren den anfänglichen Definitions-„Dump“, gewinnen aber enorm viel Platz für Geschäftslogik, Produktcode und die Behandlung von Sonderfällen.
Was ändert sich konkret (und warum Sie es merken werden)
1. Mehr nützlicher Kontext, weniger Rauschen
Das ist der unmittelbarste Gewinn. Wenn der Kontext voll ist, neigen LLMs dazu, Anweisungen aus der Mitte des Prompts zu „vergessen“ oder generisch zu werden. Indem technisches Rauschen entfernt wird, macht Tool Search das Modell auf Ihre spezifischen Vorgaben aufmerksamer.
2. Eine endlich skalierbare Architektur
Früher war jeder zusätzliche MCP-Server eine Belastung. Sie zögerten, den internen Dokumentationsserver anzuschließen, weil Sie befürchteten, Claude zu verlangsamen. Mit Tool Search können Sie Observability- oder Dokumentationsserver „für alle Fälle“ verbinden, ohne die Token-Steuer jedes Mal zu bezahlen.
3. Ein amortisierter Suchschritt
Die Suche nach einem Tool fügt zwar einen kleinen zusätzlichen Schritt (einen Round Trip) hinzu, amortisiert sich aber über die Dauer einer Sitzung. Weniger Tokens bei jedem Gesprächsschritt und weniger „ähnliche“ Tools, die die Auswahl stören, machen den Austausch insgesamt leistungsfähiger und günstiger.
Konfiguration: Wie wird die Funktion aktiviert?
Im Claude-Code-Ökosystem stellt Anthropic eine Umgebungsvariable bereit, mit der dieses Verhalten gesteuert wird. Wenn Sie ein großes MCP-Setup verwalten und in Ihren Logs weiterhin einen „Tool Dump“ sehen, ist dies die erste Stelle, die Sie prüfen sollten:
# Claude verwalten lassen (Standardverhalten)
export ENABLE_TOOL_SEARCH=auto
# Laden bei Bedarf erzwingen (empfohlen für große Setups)
export ENABLE_TOOL_SEARCH=true
# Deaktivieren (zum früheren Verhalten zurückkehren)
export ENABLE_TOOL_SEARCH=false
Über den Kontext hinaus: Kostenoptimierung mit RouterLab
MCP Tool Search löst das Problem des Kontextvolumens („Input“) elegant. Sobald der Kontext bereinigt ist, stellt sich jedoch eine weitere Frage: Ist Claude Sonnet 3.5 wirklich für jeden Schritt des Prozesses erforderlich?
Hier kommt die Optimierung der Rechenleistung ins Spiel. Wenn Sie komplexe Workflows entwickeln, ermöglichen Lösungen wie RouterLab (eine in Europa gehostete OpenAI-kompatible API), noch weiter zu gehen.
Es geht nicht darum, Ihren Stack zu ersetzen, sondern Ihre Anfragen intelligent zu routen:
- ein Expertenmodell (teuer) für Planung und komplexen Code;
- ein schnelles und günstiges Modell für Tool-Auswahl oder einfache Aufgaben.
Das ist die logische Fortsetzung der Optimierung: Zuerst verschmutzen wir den Kontext dank MCP Tool Search nicht mehr. Danach zahlen wir mit intelligentem Routing nicht mehr den Höchstpreis für jeden Token.
Fazit
MCP Tool Search verwandelt das MCP-Protokoll von einer vielversprechenden Abstraktion in eine wirklich skalierbare Produktionslösung. Wir wechseln von einem Paradigma, in dem Tools den Kontext überfluten, zu einer Welt, in der Tools erst entdeckt werden, wenn sie benötigt werden.
Wenn Sie Claude Code verwenden, ist diese Funktion unsichtbar, aber unverzichtbar. Wenn Sie Tools auf MCP bauen, ist jetzt der richtige Zeitpunkt, eine echte Indexierungsstrategie umzusetzen. Die Richtung ist klar: Wir dumpen nicht mehr – wir entdecken.
Testen Sie die RouterLab-API
Gehen Sie von einem Artikel zu einer tatsächlichen Abfrage über: Erstellen Sie eine Testversion, rufen Sie einen Schlüssel ab und rufen Sie Modelle über eine OpenAI-kompatible API auf.