
Si vous utilisez Claude Code (l'agent CLI d'Anthropic) avec plusieurs serveurs MCP (Model Context Protocol), vous avez probablement déjà rencontré ce problème frustrant : votre prompt reste raisonnable, mais les descriptions d’outils explosent et mangent une partie énorme de la fenêtre de contexte.
Le symptôme est insidieux. Le modèle commence à raisonner avec moins d’espace, les réponses deviennent moins stables, et vous avez l’impression désagréable de « payer » des tokens pour des manuels techniques que vous n’utiliserez même pas dans la conversation actuelle.
Anthropic a récemment attaqué ce point de friction critique avec MCP Tool Search, une fonctionnalité qui bascule la gestion des outils vers le chargement à la demande (lazy loading). Voici pourquoi c’est un changement fondamental pour la scalabilité des agents AI.
Le problème : Quand les descriptions saturent le contexte
Dans l'architecture MCP, chaque serveur expose une liste d’outils avec leur nom, leurs paramètres, leurs schémas JSON et leurs descriptions. C’est très pratique pour que le modèle sache ce qui existe. Mais dans un environnement de production réaliste, on ne connecte jamais un seul serveur isolé. On a tendance à brancher tout un écosystème :
- Un serveur pour le système de fichiers (repo git)
- Un serveur Web pour la recherche
- Des serveurs DevOps (CI/CD, déploiement, logs)
- Des serveurs Métier (Base de données, Tickets Jira, CRM)
- Une multitude de scripts custom
Chaque serveur peut exposer des dizaines d’outils. Jusqu’ici, Claude Code fonctionnait en mode Eager Loading : toutes les définitions atterrissaient dans le contexte au démarrage. Résultat : votre « espace de travail mental » (raisonnement, plan, code) se retrouvait comprimé par des définitions inutiles.
C’est exactement l'anti-pattern que l'ingénierie logicielle moderne cherche à éviter : on ne charge pas toutes les dépendances d'une application au démarrage juste « au cas où ».
La solution : Du « tout charger » au « charger à la demande »
MCP Tool Search inverse cette dynamique. Au lieu de précharger toutes les descriptions d’outils, Claude Code indexe les outils pour les rendre "découvrables", et ne charge la définition complète que pour ceux qu’il va réellement appeler.
En termes d'architecture, c'est une bascule du Eager Loading vers le Lazy Loading. L’idée est simple : si votre catalogue contient 200 outils mais que la tâche actuelle n'en requiert que 3, seuls ces 3 outils doivent consommer votre précieux contexte.
Le seuil technique des 10%
Anthropic a implémenté ce comportement avec une intelligence pragmatique. Par défaut, Tool Search fonctionne en mode "auto". Le système surveille la taille des définitions d'outils :
- Si les descriptions occupent peu de place, elles sont préchargées (plus rapide).
- Si elles dépassent environ 10% de la fenêtre de contexte, Claude Code arrête le préchargement massif.
À ce stade, les outils passent en mode deferred (différé). Ils ne sont plus injectés dans le prompt système, mais deviennent accessibles via un mécanisme de recherche interne.
À quoi ressemble le flux côté modèle ?
Conceptuellement, le pipeline de raisonnement de l'agent évolue pour intégrer une étape de découverte :
- Réception : Claude reçoit votre prompt accompagné d'un index « léger » des outils disponibles.
- Tool Discovery : Si le besoin se fait sentir, il effectue une recherche pour identifier les outils pertinents.
- Chargement : Il charge la définition complète (schéma et paramètres) uniquement pour les outils sélectionnés.
- Exécution : Il appelle les outils et poursuit son raisonnement.
Vous perdez le « dump » initial de définitions, mais vous gagnez énormément de place pour la logique métier, le code produit et la gestion des cas limites.
Ce que ça change concrètement (et pourquoi vous allez le sentir)
1. Plus de contexte utile, moins de bruit
C’est le gain le plus immédiat. Quand le contexte est saturé, les LLM ont tendance à "oublier" des instructions du milieu de prompt ou à devenir génériques. En nettoyant le bruit technique, Tool Search rend le modèle plus attentif à vos contraintes spécifiques.
2. Une architecture enfin scalable
Avant, chaque ajout de serveur MCP était une pénalité. Vous hésitiez à ajouter ce serveur de documentation interne de peur de ralentir Claude. Avec Tool Search, vous pouvez brancher des serveurs d'observabilité ou de documentation « au cas où », sans payer systématiquement la taxe en tokens.
3. Une étape de recherche amortie
Chercher un outil ajoute certes une micro-étape (un round-trip), mais elle est largement amortie sur la durée d'une session. Moins de tokens envoyés à chaque tour de conversation et moins d’outils « similaires » qui parasitent la sélection rendent l'échange globalement plus performant et économique.
Configuration : Comment l'activer ?
Dans l’écosystème Claude Code, Anthropic expose une variable d'environnement pour contrôler ce comportement. Si vous gérez un gros setup MCP et que vous constatez encore du « tool dump » dans vos logs, c’est le premier endroit à vérifier :
# Pour laisser Claude gérer (comportement par défaut)
export ENABLE_TOOL_SEARCH=auto
# Pour forcer le chargement à la demande (recommandé pour les gros setups)
export ENABLE_TOOL_SEARCH=true
# Pour désactiver (retour à l'ancien comportement)
export ENABLE_TOOL_SEARCH=false
Au-delà du contexte : L'optimisation des coûts avec RouterLab
MCP Tool Search résout brillamment le problème du volume de contexte ("Input"). Mais une fois votre contexte nettoyé, une autre question se pose : est-ce que Claude Sonnet 3.5 est toujours le modèle nécessaire pour chaque étape du processus ?
C'est ici qu'intervient l'optimisation du "Compute". Si vous construisez des workflows complexes, des solutions comme RouterLab (API compatible OpenAI hébergée en Europe) permettent d'aller plus loin.
L'idée n'est pas de remplacer votre stack, mais de router intelligemment vos requêtes :
- Utiliser un modèle expert (coûteux) pour la planification et le code complexe.
- Utiliser un modèle rapide et économique pour la tool selection ou des tâches simples.
C'est la suite logique de l'optimisation : d'abord, on arrête de polluer le contexte avec MCP Tool Search ; ensuite, on arrête de payer le prix fort pour chaque token avec un routing intelligent.
Conclusion
MCP Tool Search transforme le protocole MCP d'une abstraction prometteuse en une solution réellement scalable pour la production. Nous passons d’un paradigme où les outils envahissent le contexte à un monde où les outils sont découverts seulement quand ils sont nécessaires.
Si vous utilisez Claude Code, c'est une fonctionnalité invisible mais indispensable. Si vous construisez des outils sur MCP, c'est le moment d’implémenter une vraie stratégie d'indexation. La direction est claire : on ne dump plus, on découvre.
Tester l’API RouterLab
Passez d’un article à une requête réelle : créez un essai, récupérez une clé et appelez les modèles depuis une API compatible OpenAI.