Разбор
Почему ChatGPT, Claude и Grok упали вместе? Технические причины массового сбоя ИИ
Три бренда сразу — это не три несвязанных сервера. Похоже, дрогнул один слой инфраструктуры, а переключения пользователей и авторетраи усилили. Совместного RCA ещё нет. Менять архитектуру уже достаточно оснований.
Утром 3 сентября 2026 (восточное время США) ChatGPT, Claude и Grok стали недоступны в одном окне. Примерно с 9:30 Grok отвечал «This model is overloaded» в вебе, iOS, Android и X. Anthropic назвал проблему инфраструктуры: чат Claude, Claude Code и API деградировали, восстановление около 12:15. Страница OpenAI с ~11:00 писала elevated errors у ChatGPT и Codex — логин, загрузки, голос, поиск, Deep Research, картинки — и mitigation около 12:55. Перекрытие фронтовых моделей почти не встречалось. The Verge осторожен: непонятно, что сломалось у всех трёх и связано ли это. Текст не делает из «виноват Azure» подписанный RCA. Он разделяет официальную хронологию, улики общего облака и каскад, и приземляется на то, что вы можете сменить: JSON ошибок, failover, и почему локальные инструменты живы, когда облачные модели гаснут вместе. Дальше: гид ошибок JSON ИИ, A2A vs MCP.
Хронология 3 сентября: что реально сообщил каждый вендор
Сверьтесь со статус-страницами, прежде чем выдумывать «общий инцидент». xAI был первым: около 9:30 ET Grok упал на Android, iOS и вебе; в X писали, что модель перегружена — позже или другая модель. Затем xAI связал событие с дата-центром в Мемфисе, а не с туманным «разбираемся». Эту фразу оставьте. Хотя бы один вендор дал объяснение уровня зала, которое поздний нарратив Azure не должен проглотить целиком.
Anthropic сообщил о частичном сбое из-за инфраструктуры: потребительский Claude, Claude Code и публичное API дали повышенные ошибки в том же отрезке. Публичная хронология заявила причину примерно за пятнадцать минут и восстановление около 12:15, позже короткий всплеск на одной модели. OpenAI позже: около 10:43–11:00 статус писал elevated errors и деградацию ChatGPT и Codex. Радиус не только чат — логин, загрузка файлов, голос, поиск, Deep Research, картинки. В тот день OpenAI тизерил Astra, базовый трафик уже был высоким. После mitigation инцидент пометили решённым около 12:55.
Тем же утром агенты вроде Cursor, зависящие от Claude и Grok, сообщили о своём сбое — не четвёртая frontier-модель, а downstream-рантайм, потерявший два бэкенда. У Gemini был всплеск жалоб без официально подтверждённого дауна. Ars Technica сложил четыре имени, потому что сложились кривые жалоб, а не потому что Google опубликовал инцидент. Перекрытие — не один корень. Пик DownDetector — не признание вендора.
Разделить: официальные факты, улики инфры, догадки, которые не корень
Разложите улики на три слоя, прежде чем спрашивать, почему одновременно. Слой один — официальный: все трое подтвердили сбои в своих окнах; Grok указал на Memphis; Claude сказал infrastructure issue; ChatGPT / Codex — elevated errors. На момент текста нет совместного RCA и нет взаимных обвинений. The Verge подтвердил только восстановление и отсутствие единого объяснения.
Слой два — улика инфры. Несколько изданий и агрегаторов отметили всплеск жалоб на Microsoft Azure в те же часы; часть описала сбои ingress в Azure East US около 10:26 PT (13:26 ET). East US несёт большую долю корпоративного ИИ-трафика, и OpenAI, Anthropic и xAI гоняют на Azure заметный inference и сеть. Если дрогнут ingress, балансировка или региональный роутинг, разные приложения всё равно выглядят как 502, таймауты и упавший логин. Это объясняет, почему казалось одновременно. Это всё ещё улика, не подписанный RCA.
Слой три — догадки, на которых нельзя строить: Azure якобы специально душил конкурентов, трое сговорились на совместное обслуживание, Memphis и East US доказанно один инцидент. Публичные материалы это не держат. Остаются две инженерные фразы. Первая: потребительский ИИ уже сидит на горстке облачных регионов и горстке входных дверей. Вторая: когда падает первый бренд, переключения и клиентские ретраи толкают нагрузку на следующего — даже если его зал здоров.
Общее облако и ingress: почему казалось одновременным
В 2026 фронтовые модели выглядят как три компании, три продукта, три токенизатора. Ниже они часто делят аккаунты, регионы, GPU-квоту, глобальный anycast-ingress, идентичность и биллинг. Обучение может жить в своём зале. Inference хочет быть рядом с пользователем, эластичным и закупаемым — поэтому Microsoft Azure стал общим знаменателем. Что Gemini в основном устоял — не доказательство, что «модель Google стабильнее». Это более чистый факт: её основной путь идёт по Google Cloud и не дрался за ту же дверь East US.
| Слой | Что видно, когда ломается | Падают все трое? |
|---|---|---|
| Веса / GPU-кластер | Одна модель перегружена, один снапшот даёт 500 | Обычно нет — если только зал правда общий |
| Региональная сеть / ingress | Логин мёртв, таймауты по сайту, API и веб умирают вместе | Да — это слой, который выглядит «одновременно» |
| Идентичность / квота (control plane) | Коннект есть, отправить нельзя; refresh токена мёртв | Да — control plane централизованнее data plane |
| Клиентские ретраи + переключения | Второй и третий бренды получают удар | Да — даже несвязанные корни складываются |
«Одновременный сбой» чаще язык ingress и control plane, а не «три трансформера рухнули разом». Что ChatGPT перечислил Codex, загрузки, голос и Deep Research вместе, похоже на общий шлюз или слой идентичности, не на один декодер чата. Что Claude связал чат, Claude Code и API одним infrastructure issue — тот же сигнал: много имён продукта, мало дверей. Официальный RCA не обязателен, чтобы менять дизайн. Достаточно допустить, что региональный ingress падает как единица.
Каскады, шторм ретраев и Memphis
Общее облако объясняет перекрытие. Каскад объясняет, почему второй и третий выглядели хуже. Когда ChatGPT мёртв, дефолт — не ждать, а открыть Claude или Grok. Десятки миллионов сессий, меняющих вендора за минуты, — это спайк в ingress, который уже может быть ранен. Клиенты и Agent-фреймворки хуже: сразу ретрай по таймауту, ротация ключей, смена модели, без jitter, без сигнала «это инфра, не бейте». Классический шторм ретраев. Сбой первого в логах второго становится «необъяснимой перегрузкой».
Заметку Grok про Memphis держите в отдельной колонке. xAI публично связал сбой со своим дата-центром, раньше статус-страницы ChatGPT. Это может быть независимая авария, лишь наложившаяся; может делить электричество или апстрим с более широким событием. Пока нет совместной хронологии — пишите параллельно, не сливайте. Инженерный вывод острее: если ваш failover — «OpenAI умер, режем на xAI», тем утром эта политика умерла сначала на Grok.
Сбой Cursor в тот день — продуктовая форма каскада. Редактор не учит модель; он считает Claude и Grok рантаймами. Когда они дрожат, вместе встают дополнения, агенты и вызовы инструментов. Большинство внутренних агентов 2026 так и выглядят: MCP-инструменты, задачи A2A, ваш HTTP JSON, и всё равно упираются в две-три облачные модели. Единая точка не в бизнес-коде. Она в поле model по умолчанию. См. MCP и JSON Schema и stateless MCP.
Control plane хрупче самой модели
Здоровый GPU-кластер не делает запрос успешным. Логин, загрузка, голос и поиск, падающие вместе, значат шлюз, идентичность, вход object storage или общий edge — не один слой декодера. «Модель перегружена» на экране часто ложный симптом: перегружены соединения ingress, проверка сертификатов или сервис токенов. Статус-страницы отстают; пользователи сначала видят DownDetector. При разборе не смотрите только имя модели. Читайте httpStatus, code и retryable ли конверт.
Нормализовать ошибки вендоров в один конверт полезнее тоста «ИИ упал». JSON ниже говорит только кто, какой статус и можно ли ретраить. Бизнес-слой не должен парсить прозу каждого. Проза — в логи. Конверт — в автомат.
{
"ok": false,
"provider": "openai",
"httpStatus": 503,
"code": "elevated_errors",
"retryable": true,
"occurredAt": "2026-09-03T15:00:00Z",
"message": "ChatGPT and Codex are returning elevated errors"
}
Тем же утром можно увидеть elevated errors OpenAI, infrastructure issue Anthropic и overloaded xAI. Имена полей разные; решение одно: retryable — в охлаждение, не-retryable — смена вендора, конверт мимо Schema — жёсткий фейл, не regex по HTML-странице ошибки. Живые фейлы кладите в JSONVue: формат, проверка, JSON Schema на обязательные ключи, Diff — какие ключи кто опустил. Когда облачная генерация гаснет, локальный разбор жив. В этом смысл инструментов в браузере.
Пайплайны Agent / JSON: мультивендор — не слоган
«Мультиклауд» на слайде тем утром не помог. Рабочий мультивендор — политика рантайма: основной путь, явный порядок fallback, пороги автомата и один конверт ошибки, который заполняет каждый. Не бейте одного двадцать раз. Не делайте fallback «случайный выживший». Gemini был доступен, потому что не делил ту же судьбу ingress — именно поэтому в запасном списке нужен вендор с другим основным путём, а не три имени, все на Azure East US.
Сама политика должна быть JSON, версионироваться отдельно от бизнес-схемы. Конфиг ниже не знает торговых марок моделей. Ему важно, кого бить первым, кого дальше, при какой доле ошибок резать и какие ключи конверта — жёсткая калитка.
{
"policy": "failover",
"primary": "openai",
"fallbacks": ["anthropic", "xai", "google"],
"circuitBreaker": {
"errorThreshold": 0.3,
"windowSeconds": 60,
"cooldownSeconds": 120
},
"errorEnvelope": {
"required": ["ok", "provider", "code", "retryable"]
}
}
Легко пропустить: JSON аргументов инструмента и JSON финального ответа — разные хопы. MCP tools/call, function arguments OpenAI и ваше HTTP-тело падают по-разному, когда модели нет. Если «модель недоступна» и «аргументы мимо Schema» становятся одним тостом, разбор крутит не ту ручку. Локальная валидация всё ещё нужна, по той же причине, что в Structured Output: форма и доступность — разные слои. Когда облако вернётся, оставьте утренние конверты как фикстуры. Это лучше ещё одного письма-рекапа.
FAQ
Microsoft специально душил конкурентов?
Публичные материалы это не держат. Ближе общее региональное ingress плюс каскадный трафик. Всплеск жалоб Azure — улика, не корень с тремя подписями. Стройте на «ingress падает по региону», не на вымышленном мотиве.
Срочно учить свою модель и уходить из облака?
Другой слой. День показал ingress инференса и концентрацию вендоров, а не «надо учить стомиллиардную модель». Большинству команд нужен запас на другом основном пути, автомат и один конверт. Свои веса не спасут, если каждый запрос всё ещё бьёт в тот же региональный ingress.
Gemini устоял — он надёжнее?
Это доказывает, что основной путь того дня не был на той же общей судьбе. У Google Cloud тоже будут региональные инциденты. Не читайте одно перекрытие как рейтинг качества модели. Читайте граф зависимостей: ваш запас — правда запас?
Какое минимальное изменение на завтра?
Три вещи за день: единый конверт ошибки на каждый вызов модели; failover на модель в другом облаке, не на другой снапшот того же вендора; jitter и автомат, чтобы ваши ретраи не стали атакующим трафиком следующего сбоя. Сверьте три фейла с этой схемой конверта в JSONVue.
Итог и следующие шаги
3 сентября сжимается в одну строку: потребительский ИИ уже ingress-сервис на общем облаке. Торговые марки разные; судьба всё равно может пересечься на одном региональном пути. Memphis, East US ingress и переключения пользователей могут быть тремя нитями или касаться. До официального RCA не мните их в заговор и не считайте несвязанной неудачей.
Дальше конкретно: собирать фейлы как JSON, писать failover как политику, считать пороги автомата воспроизводимым конфигом. Модели вернутся, статусы позеленеют. Замолчит ли ваш агент снова при следующем дрожании региональной двери, зависит от того, прошито ли ещё "model": "единственный".