Zurück zum Blog
AgentenTechnicalTechnischer Artikel

Claude Code: Wie Sie Ihren Token-Verbrauch um 75 % senken, ohne Präzision zu verlieren

Veröffentlicht 27 Apr. 20263 Min. gelesenStéphane

Zusammenfassung der Entscheidung

Entdecken Sie Caveman, eine Erweiterung, die KI zu einem telegrammartigen Stil zwingt und dadurch Redundanz, Latenz und Kosten drastisch reduziert.

ClaudeRAGTokens
Claude Code: Wie Sie Ihren Token-Verbrauch um 75 % senken, ohne Präzision zu verlieren

Die agentenbasierte KI-Entwicklung mit Claude Code, Cursor und Windsurf hat unsere Produktivität grundlegend verändert. Jede Sitzung hat jedoch einen versteckten Kostenfaktor: die Ausführlichkeit. Aktuelle Agenten sind darauf programmiert, höflich und erklärend zu sein, und verbrauchen dadurch unnötig viele Tokens.

Als Antwort auf dieses Problem verfolgt das Open-Source-Tool Caveman einen radikalen Ansatz: Die KI wird gezwungen, einen telegrammartigen Stil zu verwenden. Das Ergebnis? Antworten, die dreimal schneller sind, und eine durch vier geteilte Token-Rechnung.

Projektlink: GitHub – JuliusBrussee/caveman


Das Problem: die „Ausführlichkeitssteuer“

Jedes Mal, wenn Claude Code einen Satz wie „Ich helfe Ihnen gerne bei der Behebung dieses Fehlers. Hier ist eine ausführliche Analyse Ihrer React-Komponente …“ erzeugt, bezahlen Sie für Text, der keinen technischen Mehrwert bietet.

Diese Ausführlichkeit führt zu drei großen Problemen:

  • Latenz: Je mehr die KI schreibt, desto länger warten Sie vor Ihrem Terminal.
  • Kosten: Ausgabetokens sind am teuersten. Bei großen Projekten kann diese „Höflichkeit“ Hunderte Dollar pro Monat kosten.
  • Kognitive Belastung: Entwickler müssen die Informationen filtern, um den relevanten Code zwischen den Textabsätzen zu finden.

Die Lösung: der „Caveman“-Ansatz

Caveman ist eine Erweiterung (Skill/Plugin) für Claude Code, Cursor und andere Agenten. Sie fügt Systemanweisungen ein, die die KI zwingen, alles Überflüssige – Artikel, Höflichkeitsfloskeln und komplexe grammatische Strukturen – zu entfernen und nur die rohe technische Substanz zu behalten.

Effizienzvergleich

SzenarioStandardantwort (Tokens)Caveman-Antwort (Tokens)Einsparung
React-Rendering-Fehler1180159-87 %
Docker-Konfiguration1042290-72 %
Datenbank-Debugging1200232-81 %
Gesamtdurchschnitt1214294~75 %

Die Wissenschaft hinter der Kürze: Weniger Wörter = mehr Präzision?

Man könnte annehmen, dass eine Begrenzung des Ausdrucks die Denkfähigkeit der KI verringert. Tatsächlich ist das Gegenteil der Fall.

Eine im März 2026 veröffentlichte Studie („Brevity Constraints Reverse Performance Hierarchies in Language Models“) zeigt, dass die Vorgabe, sich kurz zu fassen, die Präzision bei bestimmten Benchmarks um fast 26 % erhöht. Wenn Fülltext entfällt, konzentriert sich die KI auf die reine Logik und verringert das Risiko sprachlicher Halluzinationen.

Wichtiger Hinweis: Caveman reduziert nicht die „Denktokens“ von Modellen wie Claude 3.7 Sonnet. Die KI denkt weiterhin genauso viel – sie kommuniziert ihre Schlussfolgerungen lediglich optimierter.


Nicht nur die Ausgabe: Eingaben mit caveman-compress optimieren

Das Caveman-Ökosystem beschränkt sich nicht auf die Texterzeugung. Es enthält auch ein leistungsfähiges Hilfsprogramm, um Ihre eigenen Kontextdateien (etwa Ihre Projektdokumentation oder CLAUDE.md) zu komprimieren.

Mit caveman-compress können Sie die Größe Ihrer Referenzdateien durchschnittlich um 45 % reduzieren. Das Tool erstellt eine komprimierte Version, die der Agent in jeder Sitzung liest. So sparen Sie Tausende Eingabetokens (Input), während der vollständige technische Sinn erhalten bleibt.


Installation und Konfiguration

Die Installation ist schnell erledigt und mit den meisten Entwicklungsumgebungen kompatibel.

Für Claude Code

bash
RouterLab
claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman

Für Cursor, Windsurf oder GitHub Copilot

Sie können die Regeln über npx hinzufügen:

bash
RouterLab
npx skills add JuliusBrussee/caveman

Nach der Installation können Sie die Intensität an Ihre Bedürfnisse anpassen:

  • /caveman lite: Professionell, ohne unnötige Ausschmückungen.
  • /caveman full: Vollständiger Höhlenmenschenmodus (mehr Artikel).
  • /caveman ultra: Maximale Kompression (extrem telegrammartiger Stil).

Fazit

Für Entwickler, die intensiv mit KI-Agenten arbeiten, ist Caveman eine unverzichtbare Optimierung. Wenn Sie Tokens als wertvolle Ressource behandeln, gewinnen Sie an Geschwindigkeit, Klarheit und Budget.

Das vollständige Projekt finden Sie auf GitHub und können dort beitragen: 👉 https://github.com/JuliusBrussee/caveman

Endpoint RouterLab

Testen Sie die RouterLab-API

Gehen Sie von einem Artikel zu einer tatsächlichen Abfrage über: Erstellen Sie eine Testversion, rufen Sie einen Schlüssel ab und rufen Sie Modelle über eine OpenAI-kompatible API auf.

https://api.routerlab.ch/v1

Besuchermessung

Darf Google Analytics Besuche auf öffentlichen Seiten messen? Ihre Entscheidung ist freiwillig und jederzeit änderbar.