Was das Versprechen kostet

Weiterdenken mit ChatGPT

Die Welt liegt uns zu Füßen, denn wir stehen drauf – wir gehen drauf, für ein Leben voller Schall und Rauch. Wer heute ein Claude-Abo für 20 Dollar abschließt, kann Finanzanalysen erstellen, Code schreiben, juristische Dokumente entwerfen, Präsentationen bauen und Marktrecherchen in Minuten erledigen. Kein Studium, keine zehn Jahre Berufserfahrung, kein Team. Opus 4.6 koordiniert seit gestern sogar mehrere Agenten parallel, findet Sicherheitslücken in Quellcode und verarbeitet eine Million Tokens Kontext. Die schöne neue Wissensarbeit benötigt keine Wissensarbeiter mehr. Aber wenn ein Einzelner für 20 Dollar, bzw. 100 Dollar (Claude Pro), im Monat die Arbeit eines Teams erledigen kann, stellt sich eine Frage, die über das persönliche Hochgefühl hinausgeht: Wer bezahlt dafür – und wie lange noch?

Seitdem OpenAI im November 2022 ChatGPT veröffentlichte, hat die Branche jedes Quartal eine neue Sau durchs Dorf getrieben. Erst waren es die großen Sprachmodelle selbst, dann multimodale KI, dann Reasoning-Modelle, dann Agenten. Das Versprechen blieb stets dasselbe: Diesmal wird alles anders. Gestern hat Anthropic Opus 4.6 vorgestellt, ein Modell, das parallele Agententeams koordiniert, 500 Zero-Day-Schwachstellen in Open-Source-Code findet und Finanzanalysen liefert, für die ein Analyst Tage bräuchte. Mamas Versprechen, man könne alles werden, scheint damit auch für Sprachmodelle zu gelten. Die Frage ist, ob jemand dafür bezahlt.

Das Paradox der Rekordzahlen

Die Marktzahlen sind beeindruckend. Menlo Ventures beziffert den Enterprise-KI-Markt auf 37 Milliarden USD, ein Wachstum von 1,7 Milliarden auf 37 Milliarden seit 2023, schneller als jede Softwarekategorie zuvor. Gartner prognostiziert weltweite GenAI-Ausgaben von 644 Milliarden USD für 2025, ein Anstieg von 76,4 % gegenüber dem Vorjahr. OpenAI meldet einen annualisierten Umsatz von 13 Milliarden USD, Anthropic nähert sich 9 Milliarden. Konsumenten-Apps für generative KI sollen 2026 über 10 Milliarden USD Umsatz allein über In-App-Käufe generieren.

Hinter diesen Zahlen verbirgt sich eine systematische Unschärfe. Beide Unternehmen kommunizieren ihren Umsatz als annualisierte Laufrate, also den Umsatz eines einzelnen Monats multipliziert mit zwölf. Ed Zitron hat in einer Analyse dokumentiert, dass dies den tatsächlich gebuchten Jahresumsatz erheblich überzeichnet. Wer im Juli einen Monatsumsatz von einer Milliarde meldet, hat im Januar möglicherweise 400 Millionen gemacht. Die Differenz verschwindet hinter dem Wort »annualized«.

Die Verluste hinter den Versprechen

OpenAI erwartet bis 2028 operative Verluste von rund 74 Milliarden USD, etwa drei Viertel des prognostizierten Umsatzes. Die kumulierten Barmittelverluste bis 2029 sollen bei 115 Milliarden USD liegen. Profitabilität wird frühestens 2029 oder 2030 angestrebt, bei einem prognostizierten Jahresumsatz von 200 Milliarden USD. Sam Altman selbst bezifferte die Infrastrukturkosten der nächsten acht Jahre auf bis zu 1,4 Billionen USD. Die Bruttomarge liegt bei etwa 40 %, begrenzt durch variable Rechenkosten.

Anthropic positioniert sich als der sparsamere Konkurrent und plant, bis 2028 den Break-even zu erreichen. Das WSJ berichtet, die Cash-Burn-Rate soll 2026 auf ein Drittel des Umsatzes sinken und 2027 auf 9 %. OpenAI hält dagegen bei 57 % in beiden Jahren. Anthropic verbrennt damit bis zur Profitabilität etwa ein Vierzehntel dessen, was OpenAI verbrennt.

Andy Wu von der Harvard Business School bringt die Lage auf den Punkt: Die Kunden der Rechenzentren, also die Unternehmen, die Modelle trainieren oder betreiben, sind selbst nicht profitabel und haben kurzfristig keine Möglichkeit, genügend Umsatz zu generieren, um die Rechenkosten zu decken. Jedes Mal, wenn ein Nutzer ChatGPT eine Frage stellt, kostet das OpenAI reales Geld. Sam Altman scherzte einmal, dass »Bitte« und »Danke« in Prompts das Unternehmen Millionen koste. Wie sich diese Dynamik auf die Kostenstruktur ganzer Branchen auswirkt, habe ich in KI verändert die Kostenstruktur der Wissensarbeit beschrieben.

DeepSeek und die Effizienzfrage

Am 27. Januar 2025 verlor Nvidia an einem einzigen Tag 589 Milliarden USD an Marktkapitalisierung. Der Auslöser war DeepSeek R1, ein Reasoning-Modell aus Hangzhou, das mit OpenAIs o1 konkurriert, zu einem Bruchteil der Kosten. Das Trainingsbudget lag bei geschätzten 5,6 Millionen USD. Zum Vergleich: US-Unternehmen investieren Hunderte Millionen bis Milliarden in einzelne Modelle.

Ein Jahr später hat sich der Markt erholt. Nvidia erreichte als erstes Unternehmen eine Bewertung von 5 Billionen USD. Der erste Schock hatte jedoch eine bleibende Wirkung: Er validierte Test-Time-Scaling als Alternative zum reinen Brute-Force-Ansatz der Skalierung. Nicht das größere Modell gewinnt notwendigerweise, sondern das Modell, das effizienter denkt. DeepSeek bewies, dass ein Modell nicht durch mehr Parameter, sondern durch längeres Nachdenken während der Inferenz besser werden kann.

Das Jevons-Paradoxon, auf das Satya Nadella am selben Tag hinwies, ist dabei die relevantere Perspektive: Wenn die Nutzung einer Ressource effizienter wird, steigt die Gesamtnachfrage häufig. Günstigere Modelle führen nicht zu weniger Rechenleistungsbedarf, sondern zu mehr Anwendungsfällen. Die Frage, was Effizienz in diesem Kontext tatsächlich bedeutet und welche ökologischen Konsequenzen sie hat, habe ich in Green AI oder KI im Stromsparmodus ausführlicher behandelt.

Agenten: Das nächste große Versprechen

2025 wurde als »Jahr der Agenten« angekündigt. Opus 4.6 liefert mit seinen Agent Teams eine eindrucksvolle Demonstration: Mehrere Agenten arbeiten parallel, koordinieren sich eigenständig und teilen komplexe Aufgaben in Teilschritte auf. Scott White, Head of Product bei Anthropic, nennt es den Übergang zu »Vibe Working«.

Gartner sieht die Lage nüchterner. Über 40 % aller Agenten-Projekte werden bis Ende 2027 eingestellt, aufgrund eskalierender Kosten, unklaren Geschäftswerts oder unzureichender Risikokontrollen. Deloitte bestätigt, dass nur 11 % der befragten Unternehmen agentische Systeme produktiv einsetzen. 42 % entwickeln noch ihre Strategie, 35 % haben gar keine. Gartner schätzt, dass von Tausenden Anbietern, die heute »Agenten« vermarkten, nur etwa 130 tatsächlich agentische Fähigkeiten bieten. Den Rest nennt Gartner »Agent Washing«: umgelabelte Chatbots, RPA-Bots und Assistenten.

Das Muster erinnert an frühere Zyklen. PwC meldet, dass 79 % der befragten Führungskräfte angeben, bereits KI-Agenten einzusetzen. Gleichzeitig räumen 68 % ein, dass weniger als die Hälfte ihrer Mitarbeiter diese Agenten im Alltag tatsächlich nutzt. Die Adoption ist breit, aber nicht tief.

Was Opus 4.6 kann und was es nicht beweist

Opus 4.6 erreicht auf dem GDPval-AA-Benchmark, der wirtschaftlich relevante Wissensarbeit in Finanz- und Rechtsdomänen testet, einen Vorsprung von 144 Elo-Punkten gegenüber OpenAIs GPT-5.2 und 190 Punkten gegenüber seinem Vorgänger. Auf dem ARC-AGI-2-Benchmark, der Probleme misst, die für Menschen einfach und für KI schwer sind, springt der Score von 37,6 % auf 68,8 %. Es findet 500 Zero-Day-Schwachstellen in Open-Source-Code ohne spezifische Anweisungen.

Diese Zahlen sind technisch bemerkenswert. Sie sagen jedoch nichts darüber aus, ob Unternehmen bereit sind, für diese Fähigkeiten zu bezahlen, und vor allem: ob sie diese in bestehende Prozesse integrieren können. Die MIT-Studie, die 2025 Wellen schlug, kam zu dem Ergebnis, dass 95 % der generativen KI-Initiativen scheitern. Gartner ergänzt, dass CIOs 2025 ambitionierte interne Projekte zugunsten kommerzieller Standardlösungen zurückfahren, weil die Implementierung vorhersagbarer ist.

Die strukturelle Frage

Das Problem ist nicht die Fähigkeit der Modelle. Das Problem ist die Lücke zwischen dem, was ein Modell in einer Demonstration kann, und dem, was es in einem Unternehmensprozess zuverlässig und wirtschaftlich leisten muss. Davenport und Bean vom MIT Sloan Management Review formulieren es so: Wenn 2025 das Jahr war, in dem man erkannt hat, dass generative KI ein Wertrealisierungsproblem hat, dann wird 2026 das Jahr, in dem man etwas dagegen tut. Und sie sehen Parallelen zum Dotcom-Crash: die himmelhohen Bewertungen von Startups, der Fokus auf Nutzerwachstum statt Profit, der Medienhype, der kostspielige Infrastrukturausbau.

JP Morgan bringt die Arithmetik auf einen einfachen Nenner: Um eine lediglich zehnprozentige Rendite auf die bisherigen KI-Investitionen zu erwirtschaften, wären jährliche Einnahmen von 650 Milliarden USD erforderlich. Davon ist die Branche weit entfernt.

Fazit

Opus 4.6 ist ein technisch herausragendes Modell. Es koordiniert Agententeams, verarbeitet eine Million Tokens Kontext, debuggt Code mit weniger Anleitung als jedes andere Modell und liefert Finanzanalysen auf dem Niveau erfahrener Analysten. Mama hätte Freude.

Aber die Branche steht vor einer nüchternen Realität. Die Modelle werden besser, schneller als die Organisationen, die sie einsetzen sollen. Enterprise-Adoption hinkt der technischen Fähigkeit um zwei bis fünf Jahre hinterher. Die Verluste der Modellbauer sind beispiellos, die Bewertungen spekulativ und die Versprechen der Agentenrevolution überholen die Implementierung um Größenordnungen. Dass sich die angekündigte Revolution in der Praxis eher als Evolution der Spezialisierung erweist, überrascht nur diejenigen, die Keynotes für Marktanalysen halten.

Mama hat gesagt, ich kann alles werden. Mama hat nicht gesagt, dass jemand dafür bezahlt.