The August 17 outage
В августе GitHub пережил два крупных сбоя: 6‑го и 17‑го число сервисы, включая сайт, аутентификацию, Actions, API, Pull Requests, Issues и Copilot, были недоступны почти восемь часов. Причиной стал резкий рост нагрузки, превысивший возможности центрального дата‑центра в США, где ключевой компонент не смог масштабироваться. Восстановление потребовало перераспределения трафика, изоляции проблемного оборудования и поэтапного возврата сервисов; ошибки в Copilot‑службах даже вызвали бесконечные повторные попытки клиентов, усугубив нагрузку.
В ответ компания ускорила инвестиции в ёмкость: за последние месяцы добавили более 3 млн процессорных ядер, 120 петабайт высокоскоростного хранилища и значительный сетевой ресурс, перенёс часть нагрузки в Azure (сейчас 58 % платформенного трафика обслуживается там). Были введены ограничения на повторные запросы, бюджеты таймаутов и пересмотрены низкоприоритетные оповещения, чтобы избежать каскадных сбоев. Тем не менее, рост активности — 2,9 млрд коммитов в месяц и 24 млн новых репозиториев — требует дальнейших архитектурных изменений, чтобы гарантировать надёжность, без которой разработчики не могут создавать и выпускать программное обеспечение.