NapseflowNapseflow
Numérique

GitHub attribue (encore) sa panne du 17 août à un problème de capacité

Next.ink · mis à jour il y a 10 j

GitHub a été victime lundi d’une panne globale qui a entraîné une interruption de service de plus de 7 heures. Dans son post-mortem, la plateforme invoque une nouvelle fois un problème de capacité, dû à l’explosion du volume de requêtes découlant des pratiques liées à l’IA générative.

Durée et impact

La panne majeure de GitHub le 17 août 2026 a duré 7 heures et 47 minutes, affectant presque tous les services de la plateforme. Selon Vlad Fedorov, directeur technique de GitHub, cette interruption a touché l’authentification, l’accès aux dépôts, les pull requests (demandes de fusion de code) et les fonctions d’IA générative comme Copilot. L’entreprise, propriété de Microsoft, a reconnu avoir « laissé tomber » les développeurs qui tentaient de livrer du code ce jour-là. Cette panne s’ajoute à une série d’incidents similaires, dont une autre panne majeure le 6 août 2026 et des dysfonctionnements répétés depuis le début de l’année. GitHub avait déjà présenté des excuses aux développeurs en avril 2026 pour des problèmes de fiabilité et de perte de confiance.

Cause technique

La panne du 17 août a été causée par un pic de trafic que les infrastructures de GitHub n’ont pas pu absorber. Ce problème est survenu dans un datacenter situé dans le centre des États-Unis, au niveau d’un composant critique appelé pod sidecar Istio. Ce terme désigne un élément technique utilisé pour gérer le trafic réseau entre différents services. La congestion est apparue car ce pod avait atteint ses limites de concurrence, et une politique de mise à l’échelle automatique mal configurée a empêché une adaptation correcte. Cette défaillance s’est propagée en cascade, affectant quatre nœuds HAProxy (des serveurs qui répartissent le trafic) et provoquant des échecs d’authentification ainsi qu’une latence généralisée. Les équipes de GitHub ont tenté de rétablir le service en isolant l’infrastructure concernée et en suspendant HAProxy, mais des erreurs ont déclenché une boucle de nouvelles tentatives côté client, aggravant la situation.

Problème de Copilot

Le service Copilot, une fonction d’IA générative de GitHub, est resté interrompu plusieurs heures après la résolution de la panne principale. Une partie du trafic défaillant avait été redirigée vers un autre datacenter, situé dans le nord de la Virginie, où il a été traité avec succès. Cependant, des réponses tardives à un point de terminaison interne ont déclenché un bug latent (un problème caché dans le code) dans l’éditeur de code VS Code, développé par Microsoft. Ce bug a amplifié le trafic d’environ dix fois, retardant encore la restauration du service de tokens de Copilot. GitHub a dû atténuer ce comportement avant de pouvoir rétablir le service en toute sécurité.

Croissance explosive

GitHub a expliqué que la panne est liée à une augmentation massive du nombre de requêtes, passant de 1,4 milliard de commits (sauvegardes de modifications de code) par mois en avril 2026 à 2,9 milliards en août 2026. Cette croissance s’explique par l’essor des outils de développement et de l’IA générative, qui sollicitent davantage les infrastructures. En août 2026, GitHub a enregistré 130 millions de pull requests et 2,9 milliards de commits. Pour faire face à cette demande, l’entreprise a ajouté plus de 3 millions de cœurs CPU, 120 pétaoctets de stockage haute vitesse et une capacité réseau supplémentaire. Malgré ces efforts, GitHub affirme avoir été limité par la capacité électrique de ses infrastructures existantes.

Migration vers Azure

Depuis octobre 2025, GitHub a annoncé sa migration progressive vers Azure, l’infrastructure cloud de Microsoft. Cette migration s’est accélérée depuis avril 2026, avec une augmentation significative de la charge prise en charge par Azure. En mai 2026, Azure supportait 12 % des opérations de GitHub, contre 58 % en août 2026. Cependant, cette migration pose un défi : GitHub entre en concurrence avec d’autres services de Microsoft pour les ressources disponibles sur Azure, notamment ceux liés à l’IA. Face à cette situation, GitHub envisage désormais une stratégie multi-cloud, c’est-à-dire l’utilisation de plusieurs fournisseurs de cloud, dont AWS (Amazon Web Services), pour absorber l’explosion des usages liés à l’IA.

Ce que ça pourrait changer

Pour éviter de nouvelles pannes, GitHub a mis en place plusieurs optimisations. L’entreprise prévoit de corriger ses politiques de mise à l’échelle automatique, de renforcer les limites des nouvelles tentatives pour éviter les effets boule de neige, et de résoudre les problèmes liés à **VS Code**. Elle s’engage également à surveiller plus efficacement les mécanismes d’équilibre de charge et de bascule pour répartir la charge entre les serveurs. Ces difficultés pourraient favoriser l’essor de **Origin**, une nouvelle plateforme de développement lancée par Cursor (racheté par SpaceX) en août 2026. Origin se présente comme une alternative synchronisée à GitHub, offrant une solution potentielle aux développeurs en quête de fiabilité.

Sujets complémentaires

Ce contenu a été généré par intelligence artificielle à partir de l'article source. Il peut contenir des erreurs ou imprécisions.