AI & computing › Generatieve AI & synthetische media
ChatGPT, Claude en Grok vielen donderdag binnen uren na elkaar uit
Op donderdag 3 september gingen de AI-chatbots van OpenAI, Anthropic en xAI binnen een paar uur tijd plat. Elk bedrijf noemt een eigen technische oorzaak, maar waarom drie grote AI-diensten vrijwel gelijktijdig uitvielen, blijft onduidelijk.
Binnen een paar uur alle grote chatbots plat
Donderdagochtend 3 september gingen kort na elkaar de belangrijkste AI-chatbots ter wereld plat. OpenAI meldde dat ChatGPT en de programmeertool Codex vanaf 7:43 uur Amerikaanse westkusttijd (16:43 uur Nederlandse tijd) voor een deel van de gebruikers niet meer werkten. Om 8:17 uur was het probleem verholpen, aldus een woordvoerder tegen Wired. Bij Anthropic ging het mis met de modellen achter chatbot Claude: vanaf 6:23 uur kregen gebruikers foutmeldingen bij Claude Mythos 5.1, Claude Fable 5.1 en Claude Opus 5. Het bedrijf meldde snel dat het de oorzaak had gevonden en een oplossing had doorgevoerd; om 9:16 uur was de storing officieel voorbij. Kort na negen uur kampte ook het nieuwere model Claude Sonnet 5 even met problemen. Bij xAI, het AI-bedrijf van Elon Musk, viel chatbot Grok compleet uit vanaf 6:30 uur. Moederbedrijf SpaceX meldde later dat de oorzaak lag bij een stroomstoring in het eigen datacenter in Memphis. Pas om 10:05 uur was het verkeer weer normaal. Ook gebruikers van Google Gemini meldden die ochtend problemen, maar Google bevestigde geen storing op zijn eigen statuspagina.
Geen gedeelde oorzaak, wel gelijktijdig
Dat drie grote AI-diensten binnen een paar uur tijd uitvallen, doet vermoeden dat er één gemeenschappelijke boosdoener is. Vaak wijst zoiets op problemen bij een grote clouddienst of contentleverancier die meerdere bedrijven tegelijk bedient. Grote partijen als Cloudflare, Amazon Web Services en Microsoft Azure meldden die dag echter geen enkele storing. OpenAI spreekt zelf van een interne routeringsfout: het systeem dat inkomende verzoeken naar de juiste server stuurt, functioneerde niet goed. Anthropic wilde tegenover Wired niet inhoudelijk reageren op de oorzaak. xAI wees naar het eigen datacenter. Er is dus geen bewijs dat de storingen met elkaar te maken hebben, ondanks de opvallende timing. SpaceX bood in een verklaring nog wel excuses aan aan impacted compute partners, een verwijzing naar het compute-partnerschap dat het bedrijf in mei aankondigde met Anthropic en xAI voor extra rekenkracht.
Waarom een storing van een paar uur ertoe doet
Voor gebruikers die AI-chatbots inmiddels dagelijks gebruiken voor werk, van programmeren tot tekstproductie, betekent zo'n storing een directe onderbreking. Bedrijven als OpenAI en Anthropic draaien hun modellen op een omvangrijke compute-infrastructuur: enorme clusters van gespecialiseerde chips, verspreid over datacenters van henzelf en van cloudpartners. Eén verkeerd geconfigureerde routeringsregel of een stroomstoring in één datacenter kan dan al genoeg zijn om duizenden gebruikers tegelijk buiten te sluiten. Techbedrijven bouwen daarom aan failover-systemen die automatisch overschakelen naar reservecapaciteit zodra een onderdeel uitvalt, en investeren in redundantie om zulke uitval te voorkomen. Toch laat het feit dat drie onafhankelijke bedrijven op dezelfde ochtend met problemen kampten vooral zien hoe kwetsbaar de onderliggende infrastructuur van de AI-industrie nog is, ook al is de exacte oorzaak van elke storing apart te verklaren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nu miljoenen mensen en bedrijven dagelijks op AI-chatbots leunen voor werk, wordt de betrouwbaarheid van de onderliggende techniek net zo belangrijk als die van stroom of internet. Deze storingen laten zien dat zelfs de grootste AI-bedrijven kwetsbaar blijven voor kleine technische fouten of stroomproblemen in één datacenter. Naarmate bedrijven en overheden afhankelijker worden van AI-diensten, zal de druk toenemen om die infrastructuur net zo robuust te maken als klassieke internetdiensten.
- Routeringsfout
- Een fout in het systeem dat bepaalt naar welke server een digitaal verzoek wordt gestuurd, waardoor verzoeken vastlopen of niet aankomen.
- Statuspagina
- Een webpagina waarop een bedrijf live bijhoudt of zijn diensten normaal werken of kampen met een storing.
- Compute-partnerschap
- Een afspraak tussen bedrijven om gezamenlijk gebruik te maken van rekenkracht en datacenters, vaak nodig omdat AI-modellen enorme hoeveelheden rekenkracht vergen.
- Datacenter
- Een gebouw vol servers en computers waar digitale diensten, waaronder AI-modellen, daadwerkelijk draaien.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.