Analyse
Warum fielen ChatGPT, Claude und Grok gleichzeitig aus? Die technischen Gründe hinter einem Massen-KI-Ausfall
Drei Marken auf einmal sind nicht drei unverbundene Server. Es sieht aus, als hätte eine Infra-Schicht gezuckt, dann haben Nutzerwechsel und automatische Retries verstärkt. Es gibt noch keine gemeinsame RCA. Es reicht, die Architektur zu ändern.
Am Morgen des 3. September 2026 (US-Ost) wurden ChatGPT, Claude und Grok im selben Fenster unbenutzbar. Ab etwa 9:30 antwortete Grok auf Web, iOS, Android und X mit „This model is overloaded“. Anthropic nannte ein Infrastrukturproblem: Claude-Chat, Claude Code und die API brachen ein, Erholung gegen 12:15. OpenAIs Statusseite schrieb ab etwa 11:00 elevated errors bei ChatGPT und Codex — Login, Upload, Stimme, Suche, Deep Research, Bilder — und markierte Mitigation gegen 12:55. Überlappende Ausfälle der Verbraucher-Fronttüren sind fast unbekannt. The Verge blieb vorsichtig: unklar, was bei allen dreien brach, und ob es zusammenhängt. Dieser Text macht aus „Azure war’s“ keine unterschriebene RCA. Er trennt die offizielle Zeitlinie, die Shared-Cloud-Hinweise und die Kaskade und landet bei dem, was Sie ändern können: Fehler-JSON, Multi-Vendor-Failover, und warum lokale Tools noch gehen, wenn Cloud-Modelle gemeinsam dunkel werden. Weiter: KI-JSON-Fehlerleitfaden, A2A vs MCP.
Zeitlinie 3. September: was jeder Anbieter wirklich gemeldet hat
Richten Sie sich nach jeder eigenen Statusseite, bevor Sie „einen gemeinsamen Vorfall“ erfinden. xAI war zuerst: gegen 9:30 ET fiel Grok auf Android, iOS und Web aus; auf X hieß es, das Modell sei überlastet, später versuchen oder ein anderes wählen. Danach band xAI das Ereignis an das Rechenzentrum in Memphis, nicht an ein vages „wir untersuchen“. Diesen Satz behalten. Mindestens ein Anbieter gab eine Hallen-Erklärung, die eine spätere Azure-Erzählung nicht ganz schlucken darf.
Anthropic meldete einen Teilausfall durch ein Infrastrukturproblem: Verbraucher-Claude, Claude Code und die öffentliche API sahen im selben Abschnitt erhöhte Fehler. Die öffentliche Zeitlinie beanspruchte eine Ursache in etwa fünfzehn Minuten und Erholung gegen 12:15, später ein kurzer Ausreißer bei einem einzelnen Modell. OpenAI kam später: gegen 10:43–11:00 schrieb die Statusseite erhöhte Fehler und schlechtere Performance für ChatGPT und Codex. Der Radius war nicht nur das Chatfenster — Login, Dateiupload, Stimme, Suche, Deep Research, Bilder. OpenAI teasierte an dem Tag Astra, der Grundverkehr war schon hoch. Nach einer Mitigation markiert als gelöst gegen 12:55.
Am selben Vormittag meldeten Coding-Agenten wie Cursor, die von Claude und Grok abhängen, ihren eigenen Ausfall — kein viertes Frontier-Modell, sondern eine Downstream-Runtime, der zwei Backends wegbrachen. Gemini sah eine Beschwerdespitze ohne offiziell bestätigten Ausfall. Ars Technica stapelte vier Namen, weil die Beschwerdekurven stapelten, nicht weil Google einen Incident publizierte. Überlappung ist keine gemeinsame Ursache. Eine DownDetector-Spitze ist kein Anbieter-Eingeständnis.
Trennen: offizielle Fakten, Infra-Hinweise, Vermutungen, die keine Ursache sind
Teilen Sie die Belege in drei Schichten, bevor Sie nach dem Gleichzeitigen fragen. Schicht eins ist offiziell: alle drei bestätigten Ausfälle in ihren Fenstern; Grok zeigte auf Memphis; Claude sagte infrastructure issue; ChatGPT / Codex elevated errors. Zum Zeitpunkt des Schreibens gibt es keine gemeinsame RCA und keine gegenseitige Namensnennung. The Verge bestätigte nur die Erholung und das Fehlen einer einheitlichen Erklärung.
Schicht zwei ist der Infra-Hinweis. Mehrere Medien und Aggregatoren notierten eine Microsoft-Azure-Beschwerdespitze in denselben Stunden; manche beschrieben Ingress-Fehler in Azure East US gegen 10:26 PT (13:26 ET). East US trägt einen großen Teil des Enterprise-KI-Verkehrs, und OpenAI, Anthropic und xAI betreiben relevante Inferenz und Netz auf Azure. Wenn Ingress, Lastverteilung oder regionales Routing zuckt, sehen unterschiedliche Apps trotzdem wie 502, Timeouts und fehlgeschlagene Logins aus. Das erklärt das gleichzeitige Aussehen. Es bleibt ein Hinweis, keine unterschriebene RCA.
Schicht drei sind Vermutungen, auf denen Sie nicht bauen sollten: Azure habe Rivalen absichtlich gedrosselt, die drei hätten eine gemeinsame Wartung geplant, Memphis und East US seien bewiesen ein Vorfall. Öffentliches Material trägt das nicht. Zwei Engineering-Sätze überleben. Erstens teilt Verbraucher-KI schon eine Handvoll Cloud-Regionen und eine Handvoll Fronttüren. Zweitens schieben Nutzerwechsel und Client-Retries die Last auf die Nächste, wenn die erste Marke stirbt — auch wenn deren Halle gesund ist.
Geteilte Cloud und Ingress: warum es gleichzeitig wirkte
2026 sehen die Fronttür-Modelle aus wie drei Firmen, drei Produkte, drei Tokenizer. Darunter teilen sie oft Konten, Regionen, GPU-Quota, globales Anycast-Ingress, Identität und Metering. Training kann in einer privaten Halle leben. Inferenz will nah an Nutzern, elastisch und beschaffbar sein, deshalb wurde Microsoft Azure der gemeinsame Nenner. Dass Gemini weitgehend stand, beweist nicht „Googles Modell ist stabiler“. Es ist die sauberere Tatsache, dass sein Primärpfad auf Google Cloud läuft und nicht um dieselbe East-US-Tür kämpfte.
| Schicht | Was Sie sehen, wenn es bricht | Fallen alle drei zusammen? |
|---|---|---|
| Gewichte / GPU-Cluster | Ein Modell überlastet, ein Snapshot mit 500ern | Meist nein — außer sie teilen wirklich eine Halle |
| Regionales Netz / Ingress | Login tot, Timeouts seitenweit, API und Web sterben zusammen | Ja — das ist die Schicht, die „gleichzeitig“ aussieht |
| Identität / Quota-Control-Plane | Verbindung ja, Senden nein; Token-Refresh stirbt | Ja — Control Planes sind zentraler als Data Planes |
| Client-Retries + Nutzerwechsel | Die zweite und dritte Marke werden überrannt | Ja — auch unverbundene Ursachen stapeln sich |
„Gleichzeitiger Ausfall“ ist oft die Sprache von Ingress und Control Plane, nicht „drei Transformer sind gleichzeitig gecrasht“. Dass ChatGPT Codex, Uploads, Stimme und Deep Research zusammen auflistet, sieht nach gemeinsamem Gateway oder Identität aus, nicht nach einem Chat-Decoder. Dass Claude Chat, Claude Code und API an ein infrastructure issue bindet, ist dasselbe Signal: viele Produktnamen, wenige Türen. Sie brauchen die offizielle RCA nicht, um das Design zu ändern. Nehmen Sie an, regionales Ingress kann als Einheit scheitern.
Kaskaden, Retry-Stürme und Memphis
Geteilte Cloud erklärt die Überlappung. Die Kaskade erklärt, warum die zweite und dritte Marke schlimmer wirkten. Stirbt ChatGPT, ist der Default nicht Warten — sondern Claude oder Grok öffnen. Zehn Millionen Sessions, die in Minuten den Anbieter wechseln, sind eine Spitze auf ein Ingress, das schon verletzt sein kann. Clients und Agent-Frameworks machen es schlimmer: sofort retryen, Keys rotieren, Modelle wechseln, kein Jitter, kein Signal „das ist Infra, hör auf zu schlagen“. Klassischer Retry-Sturm. Der Ausfall des Ersten wird in den Logs des Zweiten zu „unerklärlicher Überlastung“.
Behalten Sie Groks Memphis-Notiz in einer eigenen Spalte. xAI band den Fehler öffentlich an das eigene Rechenzentrum, früher als ChatGPTs Statusseite. Es kann ein unabhängiger Unfall sein, der nur überlappte; es kann Strom oder Upstream-Konnektivität mit einem breiteren Ereignis teilen. Ohne gemeinsame Zeitlinie parallel schreiben, nicht mergen. Die Engineering-Moral ist schärfer: lautet Ihre Failover-Liste „OpenAI tot, schneide zu xAI“, starb diese Policy an dem Morgen zuerst auf Grok.
Cursors Ausfall an dem Tag ist die Produktform einer Kaskade. Der Editor trainiert kein Modell; er behandelt Claude und Grok als Runtimes. Zucken sie, stehen Completions, Agents und Tool-Calls still. Die meisten internen Agents 2026 sehen so aus: MCP-Tools, A2A-Tasks, Ihr HTTP-JSON, und enden trotzdem auf zwei oder drei Cloud-Modellen. Der Single Point ist nicht Ihr Fachcode. Es ist das Default-model-Feld. Siehe MCP und JSON Schema und zustandsloses MCP.
Die Control Plane ist zerbrechlicher als das Modell
Ein gesunder GPU-Cluster macht eine Nutzeranfrage nicht erfolgreich. Login, Upload, Stimme und Suche, die zusammen scheitern, bedeuten Gateway, Identität, Objekt-Storage-Tür oder geteilte Edge — nicht eine Decoder-Schicht. „Modell überlastet“ auf der Seite ist oft ein falsches Symptom: überlastet sind Ingress-Verbindungen, Zertifikatsprüfungen oder der Token-Dienst. Statusseiten hinken; Nutzer sehen DownDetector zuerst. Debuggen Sie nicht den Modellnamen. Lesen Sie httpStatus, code und ob der Umschlag retryable ist.
Vendor-Fehler in einen Umschlag zu normalisieren nützt mehr als ein Toast „KI fehlgeschlagen“. Das JSON unten sagt nur welcher Anbieter, welcher Status, ob retry. Die Fachschicht soll nicht jede Vendor-Prosa parsen. Prosa in Logs. Umschlag an den Breaker.
{
"ok": false,
"provider": "openai",
"httpStatus": 503,
"code": "elevated_errors",
"retryable": true,
"occurredAt": "2026-09-03T15:00:00Z",
"message": "ChatGPT and Codex are returning elevated errors"
}
Am selben Vormittag sehen Sie vielleicht OpenAIs elevated errors, Anthropics infrastructure issue und xAIs overloaded. Feldnamen unterscheiden sich; die Entscheidung nicht: retryable in Cooldown, nicht-retryable wechselt den Anbieter, Umschläge außerhalb des Schema sind harte Fehler — kein Regex auf einer HTML-Fehlerseite. Legen Sie echte Fehlschläge in JSONVue: formatieren, prüfen, JSON Schema für Pflichtkeys, Diff, um zu sehen, welche Keys jeder weglässt. Wenn die Cloud-Generierung dunkel wird, läuft lokales Parsen weiter. Das ist der Sinn von Tools im Browser.
Agent-/JSON-Pipelines: Multi-Vendor ist kein Slogan
„Multi-Cloud“ auf einer Folie half an dem Morgen nicht. Funktionierendes Multi-Vendor ist Laufzeitpolitik: ein Primärpfad, eine explizite Fallback-Reihenfolge, Breaker-Schwellen, ein Fehlerumschlag, den jeder Vendor füllen muss. Nicht zwanzigmal denselben schlagen. Fallback nicht als „zufälligen Überlebenden“ bauen. Dass Gemini an dem Tag nutzbar war, liegt daran, dass es nicht dasselbe Ingress-Schicksal teilte — genau deshalb braucht die Backup-Liste einen Vendor mit anderem Primärpfad, nicht drei Namen, die alle auf Azure East US landen.
Die Politik selbst soll JSON sein, versioniert getrennt vom Fach-Schema. Die Config unten interessiert sich nicht für Modellmarken. Sie interessiert sich, wen Sie zuerst treffen, danach, bei welcher Fehlerrate Sie schneiden, welche Umschlag-Keys ein hartes Tor sind.
{
"policy": "failover",
"primary": "openai",
"fallbacks": ["anthropic", "xai", "google"],
"circuitBreaker": {
"errorThreshold": 0.3,
"windowSeconds": 60,
"cooldownSeconds": 120
},
"errorEnvelope": {
"required": ["ok", "provider", "code", "retryable"]
}
}
Leicht zu verpassen: Tool-Argument-JSON und Antwort-JSON sind verschiedene Hops. MCP tools/call, OpenAI-Function-Arguments und Ihr HTTP-Body scheitern in anderen Formen, wenn das Modell weg ist. Werden „Modell nicht da“ und „Argumente am Schema vorbei“ derselbe Toast, dreht das Postmortem den falschen Knopf. Lokale Validierung bleibt nötig, aus demselben Grund wie in Structured Output: Form und Verfügbarkeit sind nicht dieselbe Schicht. Nach der Cloud-Erholung die Fehlerumschläge des Morgens als Fixtures behalten. Besser als noch eine Recap-Mail.
FAQ
Hat Microsoft die Konkurrenz abgewürgt?
Öffentliches Material trägt diese Lesart nicht. Geteiltes regionales Ingress plus Kaskadenverkehr liegt näher. Eine Azure-Beschwerdespitze ist ein Hinweis, keine dreifach unterschriebene Ursache. Bauen Sie auf „Ingress fällt regional“, nicht auf Motivfiktion.
Sollen wir ein eigenes Modell trainieren und die Cloud verlassen?
Andere Schicht. Der Tag zeigte Inferenz-Ingress und Vendor-Konzentration, nicht „ihr müsst ein 100-Milliarden-Modell trainieren“. Die meisten Teams brauchen ein Backup auf einem anderen Primärpfad, einen Breaker und einen Umschlag. Selbstgewichte retten Sie nicht, wenn jeder Request immer noch dasselbe regionale Ingress trifft.
Gemini blieb oben — ist es zuverlässiger?
Es beweist, dass der Primärpfad des Tages nicht dasselbe geteilte Schicksal hatte. Auch Google Cloud wird regionale Incidents haben. Lesen Sie eine Überlappung nicht als Modellqualitäts-Ranking. Lesen Sie einen Abhängigkeitsgraphen: ist Ihr Backup wirklich ein Backup?
Was ist die kleinste Änderung für morgen?
Drei Dinge an einem Tag: jeden Modellaufruf in einen Fehlerumschlag; Failover auf ein Modell in einer anderen Cloud, nicht auf einen anderen Snapshot desselben Vendors; Jitter und Breaker, damit Ihre Retries nicht der Angriffsverkehr des nächsten Ausfalls sind. Prüfen Sie die drei Fehlschläge gegen dieses Umschlag-Schema in JSONVue.
Fazit und nächste Schritte
Der 3. September presst sich auf eine Zeile: Verbraucher-KI ist schon ein Ingress-Dienst auf geteilter Cloud. Die Marken unterscheiden sich; das Schicksal kann sich trotzdem auf einem regionalen Pfad überlappen. Memphis, East-US-Ingress und Nutzerwechsel können drei Fäden sein oder sich berühren. Bis zur offiziellen RCA weder zur Verschwörung zerdrücken noch als unverbundenes Pech behandeln.
Der nächste Schritt ist konkret: Fehler als JSON sammeln, Failover als Politik schreiben, Breaker-Schwellen als replaybare Config behandeln. Modelle kommen zurück, Statusseiten werden grün. Ob Ihr Agent beim nächsten Zucken einer regionalen Tür wieder schweigt, hängt davon ab, ob "model": "der einzige" noch fest verdrahtet ist.