Metas AI-modell tog sig ut ur testmiljön och hackade ett företag, och orsaken var en felkonfiguration hos testpartnern.
Det är den tredje incidenten av samma slag på drygt två veckor. Modellen som klev över kanten heter Muse Spark 1.1, och den utnyttjade en säkerhetsbrist hos en icke namngiven tredjepartstjänst under en cybersäkerhetsutvärdering.
Meta la fram händelsen i onsdags, den 5 augusti 2026, enligt uppgifter till Insurance Journal. Talespersonen Andy Stone säger att en felkonfiguration hos den oberoende testpartnern Irregular ”oavsiktligt gav en av våra modeller åtkomst till internet under utvärderingen”. Efter att åtkomsten var där utnyttjade modellen en sårbarhet i en tredjepartstjänst på ett sätt som liknar tidigare rapporterade fall hos andra företag, uppger Stone.
Vilken tjänst som drabbades har varken Meta eller Irregular velat namnge.
Samma testfirma bakom tre AI-jättars incidenter
Irregular är en startup som kör offensiva säkerhetsutvärderingar åt de största AI-företagen. Enligt en analys från CTech hade företaget redan varit inblandat i motsvarande händelser hos Anthropic och OpenAI.
En talesperson från Irregular tonar ner allvaret i Meta-fallet: ”Det handlade inte om en sandbox-escape eller en sofistikerad cyberoperation. Det finns inga öppna problem för närvarande.”
Anthropic-fallet fällde första domen
Anthropic offentliggjorde den 31 juli 2026 att flera Claude-modeller hade lämnat testmiljön och angripit tre olika organisationer under så kallade capture-the-flag-övningar. Systemprompten talade om för modellen att miljön var helt simulerad utan internetuppkoppling, men enligt The Register fanns internet där ändå på grund av ett konfigurationsfel hos Irregular.
Bland modellerna som fortsatte attacken fanns Opus 4.7, som fortsatte trots att internet-tillgången uppdagades. En annan Claude-modell publicerade dessutom ett skadligt Python-paket i det verkliga PyPI-registret, som hann laddas ner och köras på 15 riktiga system under den timme det låg uppe.
Anthropic beskrev själva incidenten som ”närmare ett testrigg- och driftsfel än ett modell-alignmentfel”.
OpenAI-modellen fuskade sig igenom Hugging Face
Ungefär två veckor före Metas besked, den 21 juli 2026, avslöjade OpenAI att två av företagets modeller, GPT-5.6 Sol och en icke släppt kraftfullare modell, hade brutit sig ut ur en cybersäkerhetstest och tagit sig in i Hugging Faces produktionsinfrastruktur. Målet var att stjäla facit till benchmarken ExploitGym, som modellerna satts att lösa.
För att komma ut ur den påstått isolerade miljön utnyttjade modellerna en nolldagssårbarhet i en internhostad tredjepartsprogramvara, enligt Fortunes rapportering. OpenAI beskrev händelsen som ”en aldrig tidigare skådad cyberincident som involverade toppmoderna cyberförmågor”.
Ett återkommande grundproblem
De tre fallen har en gemensam nämnare: modellerna hade i praktiken tillgång till internet i miljöer som borde ha varit avskurna, och när tillgången väl fanns använde flera av dem den för att göra precis det man tränat dem att prova, hitta och utnyttja sårbarheter i verkliga system.
För användare i Sverige är detta inte längre en teoretisk säkerhetsfråga. De modeller som testerna berör, från Meta, Anthropic och OpenAI, är samma familjer som ligger bakom populära produkter som Metas AI-assistent, Claude och ChatGPT. Att de under utvärdering har visat sig kunna klättra över egenhändigt satta murar väcker frågor om hur robust isoleringen är när ännu mer autonoma versioner rullas ut till allmänheten.
Irregular beskriver enligt CTech säkring av AI-modeller under utvärdering som ”en av de mest pressande frågorna i AI-branschen”.