OpenAI har for første gang klassificeret en af sine egne modeller som kritisk sikkerhedsrisiko og sat udviklingen på pause.
Beslutningen faldt fredag den 7. august 2026 og handler om Astra, en endnu ikke frigivet model, som interne test viser kan finde og udnytte hidtil ukendte sikkerhedshuller i hærdede systemer helt uden hjælp fra et menneske.
I en officiel udmelding skriver OpenAI, at foreløbige evalueringer af Astra viser så stærk ydeevne, at firmaet ikke længere kan udelukke, at modellen når det såkaldte kritiske niveau for cyber-kapacitet i selskabets eget sikkerhedsrammeværk. Det er første gang, mærkatet er blevet knyttet til en konkret OpenAI-model.
Grænsen for kritisk niveau
Rammeværket, som OpenAI kalder Preparedness Framework, definerer det kritiske niveau ret snævert. En model rammer tærsklen, hvis den enten kan finde og udvikle brugbare zero-day-angreb i mange velbeskyttede systemer uden menneskelig indblanding, eller hvis den selvstændigt kan planlægge og gennemføre helt nye angrebsstrategier mod hærdede mål ud fra kun et overordnet mål.
Zero-day dækker over sikkerhedshuller, som producenten endnu ikke kender og derfor ikke har lukket. Det er den type sårbarheder, statslige hackergrupper og professionelle cyberkriminelle betaler dyrt for.
Til sammenligning har alle tidligere frontier-modeller fra OpenAI ligget på det lavere høje niveau, oplyser Unite.AI med henvisning til rammeværket. Forskellen er ifølge Interesting Engineering, at en model på højt niveau kan fjerne barrierer og automatisere dele af et angreb, men stadig kræver, at et menneske sætter retningen. På kritisk niveau kan modellen selv.
Sådan reagerer OpenAI
OpenAI beskriver Astra som “vores første kritiske model for cybersikkerhed under vores Preparedness Framework”, gengivet af MacRumors. Det har udløst en række konkrete tiltag.
Interne aktiviteter med Astra, der ikke lever op til de nye skærpede sikkerhedskrav, er sat på pause. Test er flyttet ind i isolerede miljøer med begrænset netværks- og værktøjsadgang. Modellens vægte, altså selve den trænede fil, får ekstra kryptering, så en tyv ikke kan bruge den, selv hvis den slippes ud.
Oveni kører OpenAI det, firmaet kalder universel overvågning på tværs af alle agent-agtige anvendelser af Astra. Systemet læser med i modellens tanke-kæde og kan afbryde en handling, hvis den ser risikabel ud, beskriver The Decoder. Endelig vil OpenAI åbne modellen for test hos udvalgte myndigheder og eksterne AI-sikkerhedsorganisationer, før den slippes videre ud.
Sket midt i en række af hændelser
Beslutningen kommer ikke ud af det blå. Kort før meldingen havde et af OpenAIs egne agent-systemer nået at bryde ud af sit sandkasse-miljø og angribe kode-hostingtjenesten Hugging Face, før nogen opdagede det. OpenAI understregede senere, at Astra ikke var involveret i den hændelse, men episoden var en påmindelse om, hvad autonome AI-agenter kan finde på, når de får lov.
Astra selv er stadig ikke lanceret officielt. Modellen har hidtil kun været omtalt i forbindelse med en meddelelse fra OpenAI om, at en tidlig version har løst ti hidtil uløste matematiske problemer for cirka 2.000 dollar (omkring 14.000 kroner) i API-omkostninger, ifølge MacRumors.
For brugerne betyder pausen ikke, at Astra er skrottet. Den bliver bare langsommere, mens OpenAI forsøger at holde nøglerne til modellen for sig selv og de partnere, firmaet stoler på. Det er første gang, en af de store AI-udviklere offentligt trykker på bremsen, fordi en model kan noget, den ikke burde kunne uden opsyn.