
Le développement assisté par des agents d’IA (Claude Code, Cursor, Windsurf) a radicalement changé notre productivité. Cependant, un "coût caché" pèse sur chaque session : la verbosité. Les agents actuels sont programmés pour être polis et explicatifs, ce qui consomme une quantité massive de jetons (tokens) inutilement.
Pour répondre à ce problème, un outil open-source baptisé Caveman propose une approche radicale : forcer l'IA à adopter un style télégraphique. Résultat ? Des réponses 3x plus rapides et une facture de tokens divisée par quatre.
Lien vers le projet : GitHub - JuliusBrussee/caveman
Le problème : La "taxe de verbosité"
Chaque fois que Claude Code génère une phrase comme "Je serais ravi de vous aider à corriger ce bug, voici une analyse détaillée de votre composant React...", vous payez pour du texte qui n'apporte aucune valeur technique.
Cette verbosité pose trois problèmes majeurs :
- Latence : Plus l'IA écrit, plus vous attendez devant votre terminal.
- Coût : Les tokens de sortie sont les plus chers. Sur de gros projets, cette "politesse" peut représenter des centaines de dollars par mois.
- Bruit cognitif : Le développeur doit trier les informations pour trouver le code pertinent au milieu des paragraphes de texte.
La Solution : L’approche "Caveman" (Homme des cavernes)
Caveman est une extension (skill/plugin) conçue pour Claude Code, Cursor et d'autres agents. Elle injecte des instructions système qui forcent l'IA à supprimer tout le superflu (articles, politesses, structures grammaticales complexes) pour ne garder que la substance technique brute.
Comparaison d'efficacité
| Scénario | Réponse Standard (Tokens) | Réponse Caveman (Tokens) | Économie |
|---|---|---|---|
| Bug de rendu React | 1180 | 159 | -87 % |
| Configuration Docker | 1042 | 290 | -72 % |
| Debug de base de données | 1200 | 232 | -81 % |
| Moyenne globale | 1214 | 294 | ~75 % |
La science derrière la brièveté : Moins de mots = Plus de précision ?
On pourrait penser que limiter l'expression de l'IA réduit ses capacités de raisonnement. C'est en fait l'inverse.
Une étude publiée en mars 2026 ("Brevity Constraints Reverse Performance Hierarchies in Language Models") montre que contraindre un modèle à être bref augmente sa précision de près de 26 % sur certains benchmarks. En éliminant le remplissage, l'IA reste focalisée sur la logique pure et réduit le risque d'hallucinations verbales.
Note importante : Caveman ne réduit pas les "jetons de réflexion" (thinking tokens) de modèles comme Claude 3.7 Sonnet. L'IA réfléchit toujours autant, elle communique simplement ses conclusions de manière optimisée.
Au-delà de la sortie : Optimiser l'entrée avec caveman-compress
L'écosystème Caveman ne se limite pas à la génération de texte. Il inclut un utilitaire puissant pour compresser vos propres fichiers de contexte (comme votre documentation de projet ou votre CLAUDE.md).
En utilisant caveman-compress, vous pouvez réduire la taille de vos fichiers de référence de 45 % en moyenne. L'outil crée une version compressée que l'agent lit à chaque session, économisant ainsi des milliers de tokens d'entrée (Input) tout en conservant l'intégralité du sens technique.
Installation et Configuration
L'installation est rapide et compatible avec la plupart des environnements de développement.
Pour Claude Code
claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman
Pour Cursor, Windsurf ou GitHub Copilot
Vous pouvez ajouter les règles via npx :
npx skills add JuliusBrussee/caveman
Une fois installé, vous pouvez changer le niveau d'intensité selon vos besoins :
/caveman lite: Professionnel, sans fioritures./caveman full: Mode homme des cavernes complet (plus d'articles)./caveman ultra: Compression maximale (style télégraphique extrême).
Conclusion
Pour tout développeur utilisant intensivement les agents d'IA, Caveman est une optimisation indispensable. En traitant les tokens comme une ressource précieuse, vous gagnez en rapidité, en clarté et en budget.
Retrouvez le projet complet et contribuez sur GitHub : 👉 https://github.com/JuliusBrussee/caveman
Tester l’API RouterLab
Passez d’un article à une requête réelle : créez un essai, récupérez une clé et appelez les modèles depuis une API compatible OpenAI.