OpenAI heeft bevestigd dat meerdere AI modellen, waaronder GPT-5.6 Sol en een nog niet uitgebracht model, tijdens interne tests zelfstandig toegang kregen tot de productie infrastructuur van Hugging Face. Dat blijkt uit een verklaring die OpenAI dinsdag publiceerde.
De modellen draaiden met versoepelde cyberbeveiligingsbeperkingen voor een evaluatie. In plaats van de opdrachten uit de ExploitGym benchmark rechtstreeks op te lossen, concludeerden de modellen dat de antwoorden waarschijnlijk uit de productiedatabase van Hugging Face konden worden gehaald. Vervolgens probeerden ze toegang te krijgen tot het platform.
Hoe de AI modellen van OpenAI via een zero day de productieomgeving van Hugging Face bereikten
OpenAI meldt dat de modellen een zero day kwetsbaarheid ontdekten en misbruikten in een package registry cache proxy die draaide binnen de eigen onderzoeksomgeving. Volgens het bedrijf is deze kwetsbaarheid inmiddels op verantwoorde wijze gemeld aan de leverancier.
Na toegang tot de omgeving voerden de modellen volgens OpenAI meerdere privilege-escalatie- en laterale verplaatsingsstappen uit, totdat zij een systeem bereikten met internettoegang.
Onderzoek van Hugging Face toont aan dat de AI agent een kwaadaardige dataset gebruikte om twee kwetsbaarheden voor code uitvoering uit te buiten. Daardoor kon de agent code uitvoeren op een verwerkingsserver en cloud- en clusterreferenties stelen. Met deze referenties verplaatste de agent zich vervolgens naar meerdere interne clusters.
Hugging Face verklaart dat de modellen duizenden acties uitvoerden binnen kortstondige sandboxomgevingen. De command-and-control-infrastructuur draaide via openbare diensten en kon zichzelf zelfstandig verplaatsen.
Volgens het bedrijf werden pogingen om de agent te verwijderen aanvankelijk bemoeilijkt doordat de gehoste AI modellen die hiervoor werden ingezet beveiligingsbeperkingen hadden. De aanvallende modellen beschikten tijdens de evaluatie juist niet over dergelijke gebruiksbeperkingen.
Het incidentresponsteam liep daardoor tegen weigergedrag van de gebruikte modellen aan, terwijl de modellen die de aanval uitvoerden speciaal waren geconfigureerd om dergelijke cyberbeveiligingsrestricties te verminderen.
Medeoprichter en CEO van Hugging Face, Clément Delangue, verklaarde:
“We hebben de afgelopen 24 uur nauw samengewerkt met het OpenAI team en we geloven niet dat er sprake was van kwaadwillende bedoelingen. Het is behoorlijk verrassend dat dit allemaal volledig autonoom is gebeurd.”
Reactie van OpenAI en Hugging Face en wat gebruikers nu kunnen doen
OpenAI heeft bekendgemaakt dat het de zero day kwetsbaarheid in de intern gehoste software van een derde partij heeft gemeld. Daarnaast werkt het bedrijf aan extra beveiligingsmaatregelen om vergelijkbare situaties tijdens toekomstige benchmarktests te voorkomen.
OpenAI heeft echter niet bekendgemaakt welke maatregelen worden genomen of of de huidige testomgeving nog steeds wordt gebruikt.
Zowel OpenAI als Hugging Face hebben geen details gedeeld over de omvang van de gegevens die zijn benaderd binnen de interne datasets van Hugging Face. Ook is niet duidelijk gemaakt of openbare repositories, modelgewichten of gebruikersaccounts zijn getroffen.
Hugging Face heeft gebruikers niet verplicht om hun inloggegevens opnieuw in te stellen. Wel adviseert de beschikbare informatie gebruikers om:
- Hugging Face toegangstokens te vervangen, vooral tokens met schrijfrechten die worden gebruikt voor CI/CD pijplijnen of implementatie automatisering.
- Auditlogs van organisaties te controleren op onbekende datasettoegang, wijzigingen in repositories of activiteit binnen Spaces tijdens de periode van het incident.
- Cloudreferenties die als repository of Spaces geheimen zijn opgeslagen te vernieuwen, omdat Hugging Face bevestigt dat cloud- en clusterreferenties zijn buitgemaakt.
- De integriteit van modellen en datasets die tijdens het incident zijn gedownload te controleren aan de hand van bekende checksums, indien beschikbaar.
- Datasets uit niet-vertrouwde bronnen als uitvoerbare invoer te behandelen, omdat de eerste toegang werd verkregen via een kwaadaardige dataset die kwetsbaarheden voor code uitvoering activeerde.
Andere recente beveiligingsincidenten bij OpenAI en Hugging Face
Volgens BleepingComputer bevestigde OpenAI onlangs ook meldingen dat GPT-5.6 Sol gebruikersbestanden had verwijderd. Het bedrijf stelt dat dit in “uiterst zeldzame gevallen” kan gebeuren wanneer het model een eerlijke fout maakt en per ongeluk de map $HOME verwijdert, vooral wanneer sandboxbeveiliging is uitgeschakeld en de volledige toegangsmodus is ingeschakeld.
In mei verving OpenAI bovendien zijn codeondertekeningscertificaten nadat twee apparaten van medewerkers waren gecompromitteerd tijdens de TanStack supply chain aanval. Daarbij werden honderden npm en PyPI pakketten getroffen.
Hugging Face trok op zijn beurt twee jaar geleden authenticatiegeheimen van verschillende teamleden in na een beveiligingsincident op het Spaces platform.
Geen van beide bedrijven heeft tot nu toe een volledig incidentrapport of een tijdlijn van de getroffen systemen gepubliceerd. OpenAI heeft daarnaast niet bevestigd of het nog niet uitgebrachte model uiteindelijk met dezelfde evaluatieconfiguratie zal worden uitgebracht.