AI & computingAI-gestuurde wetenschappelijke ontdekkingen

Wiskundigen eisen bewijs dat OpenAI hun werk niet heeft gebruikt

· Bijgewerkt 10 september 2026, 13:22 · 2 min leestijd

AI-gestuurde wetenschappelijke ontdekkingen
Beeld: The Verge

Een tweede wiskundige beschuldigt OpenAI van oneerlijkheid over de herkomst van de data achter zijn recente wiskundige doorbraken. Volgens hoogleraar Andreas Thom gaf het bedrijf ontwijkende antwoorden op de vraag of zijn gesprekken met ChatGPT zijn gebruikt om de modellen te trainen.

OpenAI pronkt sinds vorige maand met tien opzienbarende wiskundige resultaten, waaronder een mogelijke doorbraak in een van de zeven beroemde millenniumprijsproblemen. Maar de triomf wordt overschaduwd door groeiende twijfel in de wiskundige wereld over waar de trainingsdata van OpenAI's modellen precies vandaan komt.

Wiskundige Andreas Thom, hoogleraar aan de TU Dresden, vertelde op het sociale netwerk Mastodon dat hij vermoedt dat zijn eigen gesprekken met ChatGPT hebben bijgedragen aan een van OpenAI's resultaten. Dat resultaat ging over zogeheten non-sofische groepen, een onderwerp waarin Thom en collega Gábor Kun gespecialiseerd zijn. OpenAI erkende zelf al dat het voortbouwde op eerder werk van de twee, en paste zijn publicatie stilletjes aan nadat critici wezen op het ontbreken van correcte bronvermelding.

Vreemd gedetailleerde kennis

Wat Thom extra achterdochtig maakte, was hoe gedetailleerd OpenAI's model de specifieke technieken beheerste die hij en Kun hadden gebruikt. Volgens Thom waren dat niet de meest voor de hand liggende aanpakken op dat moment. Hij mailde daarom twee OpenAI-onderzoekers, Sébastien Bubeck en de Harvard-statisticus Mark Sellke, met de vraag of zijn interacties met ChatGPT deel uitmaakten van de trainingsdata of anderszins toegankelijk waren voor het redeneerproces van het model.

Het antwoord stelde hem niet gerust. Volgens Thom ging het alleen over de vraag of zijn gesprekken direct raadpleegbaar waren, niet over de vraag of ze ooit in de enorme databergen zijn beland waarmee OpenAI zijn modellen verbetert. "Geen enkele nuancering, uitleg of bewijs werd gegeven", schreef hij. "Ik beschouw dit op zijn zachtst gezegd als oneerlijkheid."

Onrust na eerdere rel over Navier-Stokes

Thoms kritiek volgt kort op een vergelijkbare rel rond wiskundige Tristan Buckmaster, hoogleraar aan de New York University. Die vroeg zich af of zijn gebruik van OpenAI's programmeertool Codex heeft bijgedragen aan het bedrijf se claim een oplossing te hebben gevonden voor een variant van de Navier-Stokesvergelijkingen, die het gedrag van stromende vloeistoffen beschrijven. Buckmaster werkte in een persoonlijke hoedanigheid samen met Levent Alpöge, onderzoeker bij concurrent Anthropic.

In zijn aankondiging ontkende OpenAI stellig dat het specifieke gebruikersdata had geraadpleegd, maar sloot het niet uit dat gedeïdentificeerde gegevens indirect hebben bijgedragen aan het verbeteren van de modellen. Precies die formulering irriteert Thom. "Deïdentificatie kan een naam verwijderen, maar niet de intellectuele inhoud van een wiskundig idee", aldus de hoogleraar.

Wetenschappers voelen zich machteloos

Thom benadrukt dat onderzoekers zelf niet kunnen achterhalen of hun werk in de trainingsdata is beland. "Alleen OpenAI heeft de relevante gegevens daarvoor." Als het bedrijf ontkent, vindt hij dat het de plicht heeft dat te bewijzen door de gebruikte datasets openbaar te maken.

Meerdere onderzoekers zeggen tegen The Verge bang te zijn dat dit soort incidenten wiskundigen ertoe aanzet hun onderzoek geheim te houden, uit angst dat een tech­gigant er met de eer vandoor gaat zodra er geruchten over een doorbraak circuleren. OpenAI heeft nog niet gereageerd op vragen hierover.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze rel raakt de kern van hoe AI-bedrijven aan hun trainingsdata komen en of gebruikers daar controle over houden. Als wetenschappers hun eigen onderzoek niet meer veilig met AI-chatbots kunnen bespreken zonder risico te lopen dat het wordt 'gerecycled', kan dat de open uitwisseling van kennis in de wetenschap juist afremmen.

Trainingsdata
De teksten, code en andere informatie waarmee een AI-model wordt getraind om patronen te herkennen en antwoorden te genereren.
Non-sofische groepen
Een geavanceerd begrip uit de groepentheorie, een deelgebied van de wiskunde dat bepaalde oneindige wiskundige structuren beschrijft die niet goed door eindige structuren kunnen worden benaderd.
Millenniumprijsprobleem
Een van zeven beroemde onopgeloste wiskundige raadsels waarvoor het Clay Mathematics Institute een miljoen dollar beloning uitlooft aan wie een oplossing vindt.
Navier-Stokesvergelijkingen
Een set natuurkundige vergelijkingen die beschrijven hoe vloeistoffen en gassen stromen, essentieel in onder meer weersvoorspelling en luchtvaarttechniek.
Deïdentificatie
Het verwijderen van namen of andere herkenbare kenmerken uit data, zodat niet meer te herleiden is van wie de informatie oorspronkelijk afkomstig was.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over AI-gestuurde wetenschappelijke ontdekkingen