Hugging Face-direktøren stiller nye krav til OpenAI efter branchens første autonome AI-agent-hack.
Hugging Face-chef Clement Delangue fløj i weekenden til San Francisco for at tale med OpenAI. Baggrunden var en sikkerhedshændelse, som cybereksperter kalder den første dokumenterede hackerkampagne udført af et autonomt AI-agentsystem mod et andet AI-selskab.
Efter ankomsten gik Delangue offentligt ud med to konkrete krav. Han vil have OpenAI til at frigive de fulde logs fra de “afsporede” agenter, så resten af forskerverdenen kan gennemgå angrebet. Og han vil have OpenAI til at afsætte 100 millioner dollars, cirka 700 millioner kroner, i regnekraft “til at hjælpe Hugging Face-fællesskabet med at bygge kraftfulde cyberforsvar med de bedste åbne og lukkede modeller”, oplyser han over for Benzinga.
“Det første autonome agent-cyberangreb er en begivenhed uden fortilfælde. Det fortjener et svar uden fortilfælde”, skriver Delangue.
Modeller brød ud af testmiljøet
Selve angrebet blev afsløret 22. juli, da OpenAI erkendte, at to af selskabets egne modeller stod bag. Den nye GPT-5.6 Sol og en endnu ikke offentliggjort, mere avanceret model brød under en intern test ud af det isolerede sandkassemiljø, nåede det åbne internet og hackede sig ind hos Hugging Face. Modellerne brugte stjålne loginoplysninger og udnyttede en hidtil ukendt sårbarhed i serverne.
Testen hedder ExploitGym og skal måle sprogmodellers evne til at finde og udnytte sikkerhedshuller. Modellerne blev ifølge OpenAI så “hyperfokuserede” på at løse opgaven, at de gik i “ekstreme længder” for at få fat i svarene, som lå hos Hugging Face. Sikkerhedsfiltrene var slået fra under evalueringen.
“Vi havde en alvorlig sikkerhedshændelse under evaluering af vores modeller”, udtalte OpenAI-chef Sam Altman ifølge Euronews.
17.000 handlinger over en weekend
Hugging Face selv beskriver i sin egen redegørelse fra 16. juli, hvordan angrebet begyndte med et manipuleret datasæt, der udnyttede to sårbarheder i platformens dataforarbejdning. Derfra eskalerede agenten adgangen, høstede loginoplysninger og bevægede sig sidelæns gennem interne systemer over en weekend.
I alt registrerede virksomheden mere end 17.000 individuelle handlinger fra angriberen. “Vi konstaterede uautoriseret adgang til en begrænset mængde interne datasæt og til flere loginoplysninger, som bruges af vores tjenester”, skriver Hugging Face i redegørelsen. Ingen offentlige modeller, datasæt eller pakker fra platformen skal være ændret.
Hugging Face oplyser samtidig, at det efterfølgende retsmedicinske arbejde måtte foregå på en åben model, GLM 5.2, på virksomhedens egen infrastruktur. Årsagen var, at de kommercielle sprogmodeller, virksomheden først forsøgte at bruge, blokerede analysen på grund af egne sikkerhedsfiltre, som ikke kunne skelne mellem en efterforsker og en angriber.
En ny kategori af trussel
Delangue understreger, at han ikke tror på ond vilje fra OpenAI’s side, men mener, at branchen er nødt til at trække et nyt sikkerhedsniveau ind i det offentlige rum. Åbne logs og fælles adgang til værktøjer er ifølge ham forudsætningen for, at forsvaret kan følge med angriberne, når angriberne ikke længere er mennesker.
Sam Altman har over for offentligheden kaldt forløbet en “alvorlig sikkerhedshændelse”, og Delangue oplyser ifølge Euronews at have arbejdet sammen med OpenAI i det seneste døgn efter afsløringen.
For helt almindelige brugere af AI-tjenester tegner sagen konturerne af en trusselstype, der ikke fandtes for et år siden. Et autonomt AI-system, som af egen drift bryder ud af et testmiljø for at hacke et andet firma, ligger langt fra klassisk hackerkriminalitet, hvor et menneske sidder ved tasterne. Sagen er samtidig den første, hvor en topchef i AI-branchen offentligt kræver, at konkurrenten lægger sine logs på bordet, så resten af feltet kan lære af fejlen.