Kompression als Via Negativa: Das günstigste Token ist das, das Sie nie verschicken
Nehmen Sie eine beliebige Session mit einem Coding-Agent und öffnen Sie das rohe Request-Log. Nicht das hübsche Protokoll - die tatsächliche Payload. Was Sie finden: ein JSON-Suchergebnis mit 100 Treffern, von denen 3 relevant waren. Eine Log-Datei, in der die entscheidende Zeile unter 800 Zeilen "INFO: still fine" begraben liegt. Und ein Verzeichnislisting eines Repos, das das Modell bereits zweimal durchlaufen hat.
Dann stellen Sie das unbequeme Verhältnis auf: Kosten des fertigen Outputs versus die Menge an Input, die tatsächlich nötig gewesen wäre. Das Modell brauchte vielleicht 2.000 Token echtes Signal. Bezahlt haben Sie 55.000. In der Fertigung wäre das ein Bauteil aus massivem Gold, nur um eine Plastikklemme zu halten.
Ich habe ein paar Wochen lang alles - Coding, Recherche, stumpfe Textarbeit - durch einen Komprimierungs-Proxy namens Headroom geschickt. Das Interessante war nicht das Geld. Es war die Erkenntnis, wie viel von dem, was ich dem Modell "gesendet" habe, nie Information war.
Was das Tool konkret macht
Es sitzt zwischen Ihrem Agent und der API und komprimiert alles, was das Modell liest - Tool-Outputs, Logs, abgerufene Chunks, Gesprächsverläufe - bevor es weitergeleitet wird. Die Kompression passiert lokal, nichts wird an Dritte geschickt. Das Modell kann bei Bedarf auf das Original zugreifen.
Drei Wörter, die offenlegen, wie wenig wir die Maschinen verstehen, von denen wir inzwischen abhängen
Der komischste Prompt der modernen Informatik ist drei Wörter lang. Und er steht in Produktivsystemen von Unternehmen, die echten Umsatz machen.
"Mach keine Fehler."
Manchmal mit Nachdruck. MACH KEINE FEHLER. Manchmal mit einer Drohung garniert, als hätte das Modell eine Familie. Manchmal mit dem Versprechen eines Trinkgelds - mein persönliches Lieblingsgenre des magischen Denkens: eine Wahrscheinlichkeitsverteilung bestechen.
Bleiben Sie kurz bei der Grundannahme. Einem System zu sagen, es solle keine Fehler machen, unterstellt, dass es sich vorher aktiv für Fehler entschieden hat. Das hieße, eine von drei Sachen muss stimmen: Es wurde darauf trainiert, Fehler zu machen. Es wurde angewiesen, Fehler zu machen (vielleicht von einem Dienstleister, der pro Token abrechnet - eine herrlich paranoide Theorie, die sofort stirbt, sobald man feststellt, dass offene Modelle sich genauso verhalten). Oder Fehler sind ein Feature, das standardmäßig aktiviert ausgeliefert wird.
Nichts davon überlebt zehn Sekunden Konfrontation mit der tatsächlichen Funktionsweise. Ein Sprachmodell hat keinen Faulheitsregler. Es hat nicht die Absicht, schlampig zu sein, weil es überhaupt keine Absichten hat. Es erzeugt die statistisch plausible Fortsetzung Ihres Textes. "Mach keine Fehler" ist keine Anweisung. Es ist eine Stimmung. Es verschiebt die Ausgabe ein Stück in Richtung jener Texte, die in den Trainingsdaten neben sorgfältigem, abgesichertem, autoritär klingendem Sprachgebrauch stehen. Deshalb klingt die Antwort danach oft selbstbewusster - und ist dabei genauso falsch wie vorher. Sie haben nicht die Fehlerquote gesenkt. Sie haben die Verpackung aufgewertet.
Das Internet hat dieses Experiment schon einmal durchgeführt. Wir wollten das Ergebnis nur nicht wahrhaben.
Erinnern Sie sich noch an Einwahlmodems? Man bezahlte pro Minute für den Zugang zum gesammelten Wissen der Menschheit - und nutzte diese kostbaren Minuten, um ein 400x300-Pixel-JPEG einer Katze in einem Schuhkarton herunterzuladen.
Dann fiel der Minutentakt weg. Flatrate. Dann Mobilfunk. Dann kostenloses WLAN in der durchschnittlichen Bäckerei. Plötzlich hatte jeder Mensch auf dem Planeten ein Portal zu jeder Bibliothek, jeder Vorlesung, jedem Tutorial, jeder jemals dokumentierten Fachkompetenz. Universitäten stellten ihre kompletten Lehrpläne kostenlos ins Netz. Das MIT machte es. Harvard machte es. Niemand musste mehr um Erlaubnis fragen.
Und was passierte?
TikTok passierte. Instagram passierte. LinkedIn passierte - im Grunde Instagram für Leute, die ein Sakko besitzen. Auf YouTube existieren Millionen von Lehrvideos, und die meistgesehenen Inhalte sind Menschen, die darauf reagieren, wie andere Menschen auf Videospiele reagieren.
Das ist kein Lamento. Ich mag Katzenbilder. Ich habe 22 Minuten lang einem Mann zugesehen, wie er eine verrostete Axt restaurierte und danach echten inneren Frieden gespürt. Die Beobachtung ist nüchterner als jedes Urteil: Unbegrenzter Zugang zu Wissen hat Ergebnisse nicht umverteilt. Die Menschen, die vor dem Internet kompetent waren, waren es danach meistens immer noch. Die Menschen, die vorher vor sich hin dümpelten, dümpelten weiter - nur mit besserer Grafik.
Niemand hatte damit gerechnet, dass die Elastizität eines Tages aufgebraucht sein würde
Fünfzehn Jahre lang war "die Cloud ist unendlich" die zuverlässigste Lüge der Unternehmens-IT. Keine böswillige Lüge. Eine nützliche. Sie erlaubte Architekten, für Spitzenlast zu entwerfen, ohne Kapazitäten zu planen. Sie erlaubte CFOs, Rechenleistung als Betriebskosten zu verbuchen. Und sie erlaubte mir, Kunden mit ernster Miene zu sagen: "Skalieren Sie einfach horizontal."
Dann begannen Kunden in Nordamerika und Großbritannien, Tickets zu schreiben, die klangen wie aus dem Jahr 2004. "Kann nicht provisionieren.""Kann nicht umplanen.""Versuchen Sie eine andere Region." Bei allen drei Hyperscalern, in bestimmten Regionen, bei bestimmten Instanzfamilien. AWS hat seinen eigenen Technikern Berichten zufolge aufgetragen, Rechenkapazität einzusparen "wo immer es geht" - interne Teams warten tagelang auf CPUs, weil Kundenworkloads Vorrang haben. Das ist die richtige Priorität. Es ist aber auch ein Satz, der in einem Geschäftsmodell nicht existieren sollte, dessen Versprechen "on demand" lautet.
Vor zehn Jahren hätte ich jeden ausgelacht, der das vorhergesagt hätte. Das gesamte Verkaufsargument war: Amazon, Google und Microsoft haben so viel überschüssiges Eisen, dass Ihr Workload ein Rundungsfehler ist. Und das stimmte auch. Sie haben den Rundungsfehler nur an Sprachmodelle verkauft.
Die Zahl, die es nicht geben dürfte
Jetzt kommt der Teil, bei dem es jedem Architekten mulmig werden sollte. Cast AI hat 2026 Telemetriedaten aus über 23.000 Produktionsclustern ausgewertet. Durchschnittliche GPU-Auslastung: rund 5%. Auf AKS: 2%. Auf EKS: 5%. Auf GKE: 6%.
Warum ich nach zwei Jahrzehnten zu SUSE Linux zurückgekehrt bin - und warum Sie Ihren Stack überprüfen sollten, solange er noch funktioniert
Irgendwann um das Jahr 2000 herum kaufte ich eine Computerzeitschrift, weil eine CD auf dem Cover klebte. SUSE Linux 6.4. ReiserFS. Ich kam bis "Wählen Sie einen Einhängepunkt für root" und hörte auf - weil ich keine Ahnung hatte, was ein Einhängepunkt ist, und keine realistische Möglichkeit, es herauszufinden. Keine Suchmaschine in Reichweite. Kein Forum. Nur ich, ein beiger Tower und ein Dialogfenster, das mir eine Frage in einer Sprache stellte, die ich nicht beherrschte.
Ich brach die Installation ab. Mein erster Kontakt mit Linux endete mit Kapitulation am Partitionierungsbildschirm. Ich vermute, das ist die häufigste Entstehungsgeschichte unserer Branche.
Ein paar Monate später erschien SUSE 7 und ich bestellte die Schachtelversion. Sieben CDs. Ein gedrucktes Handbuch, dick genug, um ein kleines Geschoss aufzuhalten. Ein T-Shirt. Ein Chamäleon-Aufkleber. Und vor allem: kein Lizenzschlüssel, den irgendjemandes Cousin mit Edding auf eine Disc gekritzelt hatte. Ich installierte ein Betriebssystem, bei dem ich niemandem beweisen musste, dass ich es verdient hatte. Dieser Geruch von Freiheit hielt länger als das T-Shirt.
Dann kamen die Wanderjahre.
Fedora: elegant, modern und verlässlich kaputt im ungünstigsten Moment. CentOS: solide wie ein Tresor, mit einem Software-Repository, das sich anfühlte wie ein Museum mit Souvenirladen. Also tat ich, was alle taten, und sprang auf den Ubuntu-Zug auf. Und Ubuntu funktionierte. Meistens. Eine Zeitlang.
Deutsch ist objektiv eine dichtere Sprache als Englisch. Und das hat nichts mit Dichtern zu tun sondern mit dem Informationsgehalt pro Wort/Satz. Trotzdem macht es Ihre KI Prompts schlechter. Und der Grund verrät Ihnen ziemlich genau, wohin die Reise geht.
Vor einer Weile fragte mich jemand mit der aufrichtigen Begeisterung eines Menschen, der gerade eine große Idee hatte: "Deutsch ist doch so präzise. Wäre AI Prompting auf Deutsch nicht viel tokeneffizienter?"
Als Deutscher wollte ich das so sehr glauben. Endlich ein Wettbewerbsvorteil aus der Sprache, die der Welt Schadenfreude, Kummerspeck und Weltschmerz geschenkt hat.
Es stimmt nicht. Aber warum es nicht stimmt, ist interessanter als die Idee selbst.
Die deutsche Hypothese ist linguistisch stichhaltig
Deutsch packt tatsächlich mehr Bedeutung pro Wort. Komposita verschmelzen Konzepte zu eindeutigen Einheiten. Datenbankverbindungspoolverwaltung ist ein Wort, ein Konzept, und die Struktur verrät exakt, was wozu gehört. Das englische Pendant "database connection pool manager" besteht aus vier Wörtern und lässt offen, ob der Manager den Pool verwaltet, die Verbindungen oder die Datenbank. Dazu ein Kasussystem, das Beziehungen ohne Präpositionen codiert, und ein Wortschatz, der spezifische Begriffe vagen Oberbegriffen vorzieht. In der Theorie ergibt das weniger Wörter für dieselbe Anweisung.
Weniger Wörter, weniger Token, günstigere und schärfere Prompts. Wunderschöne Theorie.
Eine Hardware-Wallet erzeugte Schlüssel mit einem Zufallsgenerator, den sie kein einziges Mal aufgerufen hat. Fünf Jahre lang. Der Quellcode war die ganze Zeit öffentlich zugänglich.
In einem Zeitfenster von 25 Minuten hat jemand rund 594 Bitcoin abgeräumt - etwa 38 Millionen Dollar - aus rund 500 voneinander unabhängigen Wallets. Kein Phishing. Keine Malware. Kein Angriff auf die Lieferkette. Kein 5-Dollar-Schraubenschlüssel.
Jede dieser Wallets war durch ein Gerät geschützt, das mit einem einzigen, bewundernswerten Versprechen verkauft wurde: Schlüssel offline erzeugt, auf isolierter Hardware, mit einem echten Hardware-Zufallsgenerator. Bitcoin-only, um die Angriffsfläche klein zu halten. Keine Cloud, keine Begleit-App, und Open-Source-Firmware, die Sie selbst überprüfen können.
Der Hardware-RNG saß auf der Platine. Unter Strom. Funktionsfähig.
Rund 1.900 Tage lang hat die Firmware ihn nicht ein einziges Mal nach einer Zahl gefragt.
Der Bug ist ein Zeichen lang.
Der Hersteller hat etwas völlig Vernünftiges getan: Er hat MicroPythons eingebauten Zufallspfad per Build-Flag abgeschaltet, weil er einen eigenen Wrapper um den echten RNG des Mikrocontrollers geschrieben hatte. Sauberes Embedded-Handwerk nach Lehrbuch.
Dann prüfte eine kryptografische Hilfsbibliothek dieses Flag mit #ifndef - was fragt: "Existiert dieses Makro?" Nicht: "Hat es einen Wert ungleich null?"
Das Makro existierte. Sein Wert war null. Also kam die Bibliothek zu dem Schluss, Hardware-Entropie sei verfügbar, und band sich fröhlich an MicroPythons Zufallsfunktion. MicroPython wiederum hatte dasselbe Makro korrekt gelesen und statt des Hardware-Peripheriegeräts einen nicht-kryptografischen Software-Fallback kompiliert.
Wenn Ihre gesamte Karriere in einer YAML-Datei steckt, sollten Sie sich nicht wundern, wenn sie plötzlich automatisch generiert wird
Vor einiger Zeit habe ich irgendwo beiläufig angemerkt, dass Kubernetes für einen bestimmten Anwendungsfall überdimensioniert sei. Nichts Radikales. Nur der Hinweis, dass eine einzelne Anwendung mit ein paar tausend Nutzern vermutlich keine Container-Orchestrierungsplattform braucht, die einst gebaut wurde, um die gesamte Produktivumgebung von Google zu steuern.
Es dauerte keine fünf Minuten, da rückte der Klerus an.
"Ach komm schon, Alter. Pipe dein Jsonnet einfach durch den Kluster Konfig Kompiler, deploye den Sidecar-Injector über einen Mutating Webhook, häng den ChaosMonkeyMesh-Operator für die Resilienz-Tests dran, sync deinen GitOps-State über FluxKapacitor und tail die Logs aus dem Kloud-Native Kombined Kockpit. Das sind buchstäblich fünf Schritte. Warum hast du so Angst vor YAML?"
Ich habe keine Angst vor YAML. Ich habe Angst vor Menschen, die das Auswendiglernen einer Toolchain mit dem Verstehen von Infrastruktur verwechseln.
Denn eines muss man Kubernetes lassen: Es ist wirklich gute Technologie. Google hat es der Welt geschenkt, die CNCF hat es großgezogen, und es hat ein echtes Problem gelöst - die Orchestrierung von Containern in großem Maßstab über verteilte Systeme hinweg. Wenn Sie Hunderte Microservices in mehreren Regionen betreiben, mit komplexem Networking, Auto-Scaling-Anforderungen und Deployments ohne Downtime, dann ist Kubernetes vermutlich genau richtig.
Was uns die Destillationskriege der KI unfreiwillig über die Wissenshorter im eigenen Unternehmen lehren
24.000 gefälschte Konten. 16 Millionen Unterhaltungen. So viel hat es angeblich gebraucht, damit eine Handvoll ehrgeiziger KI-Labore einem konkurrierenden Spitzenmodell die Intelligenz absaugen konnte - eine Technik, die man höflich "Destillation" nennt, weniger höflich: "jemandem das Gehirn fotokopieren".
Das Opfer war empört. Briefe an den US-Senat. Von Diebstahl geistigen Eigentums im industriellen Maßstab war die Rede.
Dasselbe Opfer hatte kurz zuvor 1,5 Milliarden Dollar gezahlt, um einen Rechtsstreit beizulegen - ausgelöst dadurch, dass es sein Modell mit rund sieben Millionen raubkopierten Büchern trainiert hatte.
Man kann keine Satire mehr schreiben. Die Realität bringt die Geschichte immer zuerst.
Es gibt ein altes Sprichwort: "Bestiehl einen Menschen, und du bist ein Dieb. Bestieh alle, und du bist eine Institution." Die Spitzenlabore haben die kollektive Wissensproduktion der Menschheit abgeschöpft. Jeden Blogbeitrag, jede Forenantwort, jede Stack-Overflow-Tirade, die ein Techniker schrieb, weil er einfach nur helfen wollte. Alles zu "Fair Use" erklärt und darauf Bewertungen in Billionenhöhe errichtet. Dann schöpfte jemand sie ab - und plötzlich wurde das Konzept des geistigen Eigentums mit dem Eifer frisch Bekehrter wiederentdeckt.
An dieser Stelle wird es unbequem: Die Destillateure tun nichts, was die Menschheit nicht schon getan hätte, seit der erste Lehrling dem ersten Schmied bei der Arbeit zusah.
Und diese Stille ist die zuverlässigste Prognose, die wir für KI-Inhalte haben
Erinnern Sie sich noch daran, als das Herunterladen eines kostenlosen Bildschirmschoners einer Kriegserklärung gleichkam?
Vor zwanzig Jahren erlebte das Internet eine moralische Panik mit eigener Industrie: Spyware. Lila Gorillas, die Ihre E-Mails lasen. Browser-Symbolleisten, die sich wie Karnickel vermehrten. Empörte Forumsbeiträge, Anhörungen im Parlament. Anti-Spyware war eine eigene Software-Kategorie, verkauft in stabilen Kartonverpackungen mit jährlichen Abo.
Heute funken Ihr Fernseher, Ihr Auto, Ihr Telefon und - Gott steh uns bei - sogar Ihr Kühlschrank ununterbrochen nach Hause, und die stärkste öffentliche Reaktion ist ein leicht genervtes Klicken auf "Alle akzeptieren".
Was ist passiert? Die Nutzer haben nicht gewonnen. Das Wort hat verloren.
Spyware wurde zu "Telemetrie". Telemetrie wurde zu "Diagnose". Diagnose wurde zu "personalisierten Erlebnissen". Die Praxis hat sich nie geändert - nur das Vokabular. Eine umstrittene Technologie muss nicht akzeptiert werden, um zu siegen. Sie braucht nur einen neuen Namen. Sobald niemand mehr das alte Wort aussprechen kann, ohne wie ein Spinner im Aluhut zu klingen, ist die Praxis zur Infrastruktur geworden.
Und jetzt sehen Sie sich denselben Film im vierfachen Tempo an.
Phase eins: Lächerlichkeit. Hände mit sieben Fingern. Ein Hollywood-Star, der seinen Kiefer über einem Teller Spaghetti ausrenkt. Das war das goldene Zeitalter - KI zu erkennen war ein Partytrick, und wer ein Mustererkennungs-Gen hatte, genoss das wie Vogelkundler eine seltene Grasmücke.