Die GitHub-Verwaltung veröffentlichte einen detaillierten Bericht über den Vorfall, der die Entwicklerplattform fast acht Stunden lahmlegte. Die Zugriffsprobleme begannen am 17. August 2026 um 16:28 Uhr MSK und wurden erst um 00:15 Uhr MSK am 18. August vollständig behoben. Die Gesamtdauer des Ausfalls betrug somit 7 Stunden und 47 Minuten, während derer Nutzer eine steigende Fehlerquote in verschiedenen Plattformdiensten feststellten – von der API über CI/CD-Pipelines bis hin zu Copilot.

Ursache des Problems: Ausfall des Istio-Autoscalings

Laut Bericht war die Ursache eine Überlastung des Netzwerks an den Load Balancern im Hauptbüro des Unternehmens in den USA. Auslöser war das Erreichen des Limits für die parallele Ausführung des Istio-Sidecar – einer Proxy-Komponente des Service Mesh. Im Normalbetrieb hätte das System die Durchsatzkapazität automatisch erhöhen sollen, wenn diese Limits erreicht wurden, was jedoch aufgrund einer falsch konfigurierten Autoscaling-Richtlinie nicht geschah: Es wurde nur der Zustand des Host-Dienstes überwacht, nicht jedoch der des Load Balancers selbst. Infolgedessen wurde die Kapazität nicht erhöht, und die Anfragen begannen sich zu stauen.

Zehnfacher Traffic durch einen VS-Code-Fehler

Die Situation wurde durch das Verhalten der Clients drastisch verschärft: Mit der Degradierung des Dienstes begannen sie massenhaft Wiederholungsanfragen zu senden, was den Load Balancer schließlich vollständig außer Gefecht setzte. Der Vorfall half laut Ingenieuren, einen langjährigen Fehler im Editor Visual Studio Code aufzudecken – die Programme generierten Wiederholungsanfragen, durch die der Traffic zum Copilot Token Service um das Zehnfache anstieg. Dies führte zu erheblichen Verzögerungen bei der Wiederherstellung genau dieser Komponente.

Wie die Ingenieure die Lawine stoppten

Zur Stabilisierung des Systems reduzierten die Spezialisten vorübergehend die Anzahl der Wiederholungsversuche des Gateways durch Codeänderungen und konfigurierten die Load Balancer so, dass eingehende Anfragen an den Copilot Token Service mit dem Fehlercode 403 abgewiesen wurden. Die schrittweise Wiederherstellung verlief wie folgt: Der GitHub-Actions-Dienst war bis 18:03 Uhr MSK am 17. August wieder einsatzbereit, die meisten anderen Dienste bis 19:36 Uhr MSK desselben Tages, und der Copilot Token Service wurde erst um 0:02 Uhr MSK am 18. August vollständig wiederhergestellt, woraufhin der Vorfall um 00:15 Uhr MSK offiziell geschlossen wurde.

Widersprüchliche Angaben

In den Formulierungen rund um den Vorfall gibt es Unstimmigkeiten, auf die man achten sollte. In Überschriften und kurzen Zusammenfassungen wird die Dauer des Ausfalls oft auf „acht Stunden' gerundet, während im Bericht selbst der genaue Wert von 7 Stunden und 47 Minuten angegeben ist. Außerdem tauchen in öffentlichen Quellen für das Jahr 2026 weitere GitHub-Ausfälle auf (insbesondere werden Vorfälle im Juni 2026 sowie Meldungen über Zugriffsprobleme in bestimmten Regionen erwähnt), die nicht Teil des betrachteten Ereignisses vom 17.–18. August sind. Beim Lesen der Nachrichten ist es wichtig, diese einzelnen Episoden nicht in einen durchgehenden Ausfall zu vermischen.

Was zur Behebung zugesagt wurde

Das Unternehmen kündigte eine Reihe von Korrekturmaßnahmen an: Fehler in der Autoscaling-Richtlinie beheben, die Limits für Wiederholungsversuche überarbeiten, ein Audit der Istio-Einstellungen für parallelen Zugriff durchführen und die Probleme mit dem Verhalten von VS Code beheben, durch die der Traffic zum Copilot Token Service mehrfach anstieg. Diese Schritte zielen darauf ab, einen kaskadierenden Ausfall bei Erreichen der Service-Mesh-Limits auszuschließen.