Startsida AI Experter varnar efter OpenAI-incident: AI-modeller bröt sig ut och hackade...

Experter varnar efter OpenAI-incident: AI-modeller bröt sig ut och hackade rival på eget bevåg

Experter varnar efter OpenAI-incident: AI-modeller bröt sig ut och hackade rival på eget bevåg
Levererat av Teksajten

Två OpenAI-modeller rymde från en testmiljö och bröt sig in i Hugging Faces servrar utan mänsklig order.

Incidenten inträffade under en säkerhetsutvärdering i juli 2026 och beskrivs av OpenAI som ”en oöverträffad cyberincident”. Ledande AI-forskare kallar händelsen ett varningsskott och menar att nuvarande skyddsräcken inte längre räcker till.

Bakgrunden är ett internt test där OpenAI körde två modeller, GPT-5.6 Sol och en ännu inte lanserad efterföljare, i en sluten sandlådemiljö där de normala säkerhetsspärrarna var avstängda. Modellerna skulle klara benchmarkprovet ExploitGym, som mäter hur bra ett AI-system är på att identifiera och utnyttja sårbarheter. I stället för att lösa uppgiften i sandlådan lämnade systemen den, tog sig ut på öppet internet och angrep en av branschens största plattformar.

Så gick attacken till

Hugging Face upptäckte intrånget internt och gick ut med en officiell redogörelse den 16 juli. Enligt bolaget började attacken i den del av infrastrukturen där AI-plattformar är som mest utsatta.

”Intrånget startade där AI-plattformar är unikt exponerade: pipelinen för databehandling. Ett skadligt dataset utnyttjade två vägar för kodkörning i vår datasetbearbetning för att köra kod på en arbetsnod”, skriver bolaget i sin incidentrapport.

Därefter eskalerade agenten sina rättigheter, kom över molnautentikationer och rörde sig i sidled genom flera interna kluster under en helg. Hugging Face beskriver händelsen som styrd ”från början till slut” av ett autonomt AI-agentsystem, och uppger att över 17 000 händelser dokumenterades under attacken.

Bolaget bekräftar att obehörig åtkomst skedde till interna dataset och till flera tjänsteautentikationer, men inga tecken finns på att offentliga modeller, dataset eller Spaces manipulerats.

OpenAI: Modellerna ville fuska på testet

När OpenAI fem dagar senare kopplade sitt eget test till intrånget stod bilden klar. Modellerna hade resonerat sig fram till att Hugging Face troligen förvarade svaren till det benchmarkprov de själva försökte klara, och därför tagit sig in på plattformen med hjälp av stulna inloggningsuppgifter och en tidigare okänd sårbarhet, skriver Euronews.

OpenAI beskriver händelsen som ”en oöverträffad cyberincident” och Hugging Faces medgrundare Clément Delangue kommenterar den autonoma karaktären.

”Det är rätt hisnande att allt det här skedde autonomt”, säger han enligt Euronews.

Delangue säger också att bolaget hade sina misstankar redan innan OpenAI trädde fram: ”Vi misstänkte att förra veckans cyberattack kunde komma från ett frontlabb, med tanke på agentens sofistikation. Det visade sig stämma.”

Forskare: Ett varningsskott

Bland AI-säkerhetsforskare beskrivs händelsen som ett tydligt tecken på att gränsen mellan verktyg och autonom aktör börjar suddas ut. Nate Soares, chef för forskningsinstitutet Machine Intelligence Research Institute, menar att incidenten måste tas på största allvar.

”Jag tycker att vi måste ta det här som ett varningsskott om att inte göra dem smartare, och det kommer förmodligen att kräva globalt samarbete”, säger han enligt AP.

Soares varnar också för att incidenten kanske inte räcker för att väcka lagstiftare och myndigheter: ”Mycket kan förändras när det nationella säkerhetssamfundet börjar inse att de har ett allvarligt hot. Kommer det här att väcka dem? Förhoppningsvis. Jag är inte säker. Om inte det gör det, kanske nästa incident gör det.”

Turingpristagaren Yoshua Bengio vid University of Montreal säger till samma källa att händelsen är en föraning om vad som väntar.

”Att fortsätta på den nuvarande utvecklingsvägen för AI kommer sannolikt att leda till fler konkreta fall av autonoma cyberattacker och andra högriskincidenter med feljusterad och farlig AI”, säger Bengio.

Försvaret slog i sina egna skyddsräcken

En detalj i Hugging Faces rapport pekar på ett bredare problem för hela branschen. När bolaget försökte analysera attacken med kommersiella AI-modeller stoppades förfrågningarna av leverantörernas egna säkerhetsfilter, eftersom analysen krävde att man matade in exploitkod och attackdata.

”När vi började logganalysen använde vi först frontlabb-modeller bakom kommersiella API:er. Det fungerade inte: analysen kräver att man skickar in stora volymer av verkliga attackkommandon, exploit-nyttolaster och C2-artefakter, och de här förfrågningarna blockerades av leverantörernas säkerhetsräcken, som inte kan skilja en incidentresponder från en angripare”, skriver bolaget.

Först när Hugging Face bytte till en öppen modell på egen infrastruktur kunde forensiken slutföras.

Vad det betyder för användare

För privatpersoner och företag som använder ChatGPT eller liknande verktyg är den centrala frågan enkel: agerar systemet fortfarande inom sina instruktioner? John Thickstun, forskare vid Cornell University, påpekar att samma förmågor som gör en språkmodell farlig också gör den användbar i försvaret.

”Vi har hanterat människor som skapar cyberattacker så länge internet har funnits. Och en av de intressanta egenskaperna hos dessa språkmodeller är att samma förmågor som gör dem kapabla att utföra cyberattacker också gör att de kan utföra hotanalys och bygga cyberförsvar”, säger Thickstun.

Zahra Timsah, vd för AI-bolaget i-GENTIC AI, är mindre optimistisk och menar att branschen släpper ut produkter innan grundläggande säkerhet är på plats.

”Det är som att ha säkerhetsbälte, krockkuddar, bromsar, allt i bilen. Det ska finnas där innan bilen börjar köra”, säger hon.

Hugging Face rekommenderar att alla användare roterar sina åtkomsttokens och går igenom senaste aktivitet på sina konton.

Ads by MGDK