Ihr KI-Agent verbrennt 50.000 Tokens - um eine einzige Information zu finden
Kompression als Via Negativa: Das günstigste Token ist das, das Sie nie verschicken
Nehmen Sie eine beliebige Session mit einem Coding-Agent und öffnen Sie das rohe Request-Log. Nicht das hübsche Protokoll - die tatsächliche Payload. Was Sie finden: ein JSON-Suchergebnis mit 100 Treffern, von denen 3 relevant waren. Eine Log-Datei, in der die entscheidende Zeile unter 800 Zeilen "INFO: still fine" begraben liegt. Und ein Verzeichnislisting eines Repos, das das Modell bereits zweimal durchlaufen hat.
Dann stellen Sie das unbequeme Verhältnis auf: Kosten des fertigen Outputs versus die Menge an Input, die tatsächlich nötig gewesen wäre. Das Modell brauchte vielleicht 2.000 Token echtes Signal. Bezahlt haben Sie 55.000. In der Fertigung wäre das ein Bauteil aus massivem Gold, nur um eine Plastikklemme zu halten.
Ich habe ein paar Wochen lang alles - Coding, Recherche, stumpfe Textarbeit - durch einen Komprimierungs-Proxy namens Headroom geschickt. Das Interessante war nicht das Geld. Es war die Erkenntnis, wie viel von dem, was ich dem Modell "gesendet" habe, nie Information war.
Was das Tool konkret macht
Es sitzt zwischen Ihrem Agent und der API und komprimiert alles, was das Modell liest - Tool-Outputs, Logs, abgerufene Chunks, Gesprächsverläufe - bevor es weitergeleitet wird. Die Kompression passiert lokal, nichts wird an Dritte geschickt. Das Modell kann bei Bedarf auf das Original zugreifen.
Die projekteigenen Benchmarks zeigen grob 20% bei Code-Suche, 40-60% beim Incident-Debugging und bei der Codebase-Exploration, und die großen Zahlen (86%+) bei JSON-Arrays. Das leuchtet ein: JSON besteht größtenteils aus Interpunktion und wiederholten Feldnamen - ein Format, das für Parser entworfen und als Prosa abgerechnet wird. Strukturierte Logs lassen sich ebenfalls stark komprimieren. Quellcode hingegen geht weitgehend unverändert durch, und das ist die richtige Voreinstellung: Sie wollen nicht, dass Ihr Agent auf einer verlustbehafteten Version der Datei arbeitet, die er gerade bearbeitet.
Ehrlicher Vorbehalt, weil mir Ihr Vertrauen in sechs Monaten wichtiger ist als ein Effekt heute: Das Dashboard zählt Token, die komprimiert wurden - nicht Token, die Ihr Provider Ihnen tatsächlich nicht mehr berechnet hat. Das hängt zusammen, ist aber nicht dasselbe. Einige Nutzer berichten, dass der Unterschied kleiner ausfällt als versprochen, sobald Retrieval-Roundtrips eingerechnet werden. Betrachten Sie das Dashboard als Richtungsanzeiger, nicht als Rechnung.
Und damit zum Punkt, den niemand vermarktet: Wenn Sie einen Flatrate-Plan nutzen, sparen Sie exakt null Euro. Was Sie sparen, ist Reichweite. Weniger Token bedeutet, dass Sie weiter kommen, bevor Sie an die 5-Stunden- oder Wochenlimits knallen. Für jeden, der schon mal ein großes Refactoring mittendrin abgewürgt bekam, weil das Rate-Limit zugeschlagen hat, ist das mehr wert als jeder Rabatt.
Setup unter Linux - in der Zeit, die ein Kaffee braucht
Installation und Prüfung:
uv tool install --python 3.13 "headroom-ai[all]"command -v headroomheadroom doctor
Sie wollen, dass "Proxy" einen grünen Haken zeigt. Wenn nicht, klären Sie das zuerst - machen Sie nicht auf Hoffnung weiter.
Optional, aber sinnvoll: als User-Daemon laufen lassen, damit der Proxy einfach immer da ist:
# ~/.config/systemd/user/headroom.service[Unit]Description=Headroom compression proxy
[Service]ExecStart=%h/.local/bin/headroom proxy --port 8787Restart=on-failure
[Install]WantedBy=default.target
systemctl --user enable --now headroomss -lntp | grep 8787
Der zweite Befehl ist keine Kosmetik. Stellen Sie sicher, dass der Proxy auf 127.0.0.1 lauscht und nicht auf 0.0.0.0. Ein Proxy ohne Authentifizierung, der jeden Prompt mitlesen kann und auf allen Interfaces horcht, ist kein Produktivitätstool. Das ist ein Geschenk an jeden Anderen in Ihrem Netzwerk.
Dann den Client darauf zeigen lassen, in ~/.claude/settings.json:
{ "env": { "ANTHROPIC_BASE_URL": "http://127.0.0.1:8787" }}
CLI und IDE neu starten - VS Code oder VSCodium übernehmen die neue Base-URL sonst nicht. Öffnen Sie http://127.0.0.1:8787/dashboard und prüfen Sie, ob "Request Health" und "Live Activity" Werte ungleich null anzeigen. Das war die gesamte Installation. Der Rest ist Zusehen, wie ein Zähler hochläuft, während Sie tun, was Sie ohnehin tun wollten.
Wenn es kaputtgeht - und das wird es
Es ist ein junges Projekt mit hoher Schlagzahl. Gelegentlich hängen Requests oder sterben weg. Die Reihenfolge zur Fehlersuche, auf dem mühsamen Weg gelernt:
👉 Aktuelle Model-Session beenden, Tool oder IDE neu starten, dem Agent "continue" sagen. Löst das meiste.
👉 Hilft nicht? systemctl --user restart headroom.
👉 Immer noch nicht? Es liegt vermutlich nicht an Ihrer Maschine. Prüfen Sie status.claude.com, bevor Sie irgendetwas anderes debuggen. Ein gestörter Upstream-Service sieht von Ihrem Platz aus exakt so aus wie ein defekter Proxy - und ich habe ehrliche Minuten damit verschwendet, mir das zu beweisen.
👉 Tatsächlich eine Regression in einem neuen Release? Pinnen Sie rückwärts: uv tool install --python 3.13 "headroom-ai[all]==0.37.0" --force. Projekte mit hoher Release-Frequenz belohnen Leute, die eine Version zurückgehen können, statt ein Issue zu öffnen und zu warten.
Dieser letzte Punkt ist übrigens die eigentliche Fähigkeit. Nicht das Tool - die Gewohnheit, einen Rollback-Pfad zu haben, bevor man ihn braucht.
Der Teil, der über dieses Tool hinausgeht
Komprimierungs-Proxys sind ein Workaround. Das eigentliche Problem: Wir halten Agents den Feuerwehrschlauch hin und nennen es Kontext. Wir schieben komplette API-Responses, ganze Log-Dateien und vollständige Verzeichnisbäume rein, weil das einfacher ist als zu entscheiden, was davon relevant ist. Und dann zahlen wir pro Token dafür, dass ein Sprachmodell unsere Filterarbeit zu Premium-Tarifen erledigt.
Das beste Bauteil ist das, das man weglassen kann. Das günstigste Token ist das, das nie verschickt wird. Ein Tool, das Ihren Ballast komprimiert, ist strikt besser als keines - aber ein grep mit einem vernünftigen Filter, ein Log-Level, das in Production nicht auf DEBUG steht, und eine API-Response, die gezielt Felder liefert statt alles, hätten Sie ohne jede Middleware schon den größten Teil des Weges gebracht.
👇 Was ist das Dümmste, das Ihr Agent je komplett lesen musste? Meiner hat echtes Geld dafür ausgegeben, ein 400 Zeilen langes INFO-Log zu verdauen - um einen einzigen Timestamp zu finden.
TrenchOps DE 🇩🇪🐎
0 comment(s)
No comments yet. Be the first to comment.
Leave a comment