OpenAI har afbrudt en koordineret kampagne, der skulle udtrække “protected reasoning” fra virksomhedens AI-modeller. Det skriver OpenAI i en sikkerhedsopdatering dateret 30. september 2026. Ifølge OpenAI begyndte den tidligste aktivitet i første uge af juli 2026 og toppede 24. og 25. juli, før kampagnen blev “fuldt afbrudt” 28. juli.
Se OpenAIs officielle oplysninger.
Hvad angriberne forsøgte at få fat i
“Protected reasoning” beskrives af OpenAI som modellens interne arbejdsnoter, altså den del af processen, der normalt ikke vises i det endelige svar. Hvis man kan udtrække den, kan det ifølge OpenAI gøre det lettere at kopiere eller forbedre en anden model ved systematisk at bruge output eller ræsonnement som træningsdata. OpenAI kalder metoden for “adversarial distillation”: Uautoriseret udnyttelse af en models svar eller ræsonnement til at genskabe dens evner i en anden model.

OpenAI understreger, at operatørerne ikke brød kryptering, ikke kompromitterede en database og ikke fik direkte adgang til lagrede brugersamtaler. I stedet manipulerede de interaktioner med modellerne, så skjult ræsonnement kunne blive gengivet i en form, som blev synlig for den, der spurgte. Det er, ifølge OpenAI, ikke et problem, der kun gælder OpenAI, men en bredere udfordring for avancerede AI-systemer.
Omfanget i juli: 16.000 forsøg og et større netværk
OpenAI beskriver blandt andet et forsøg, hvor angribere kopierede krypteret ræsonnement fra én samtale og bad en model i en anden samtale om at dekryptere og afskrive det skjulte indhold. Aktiviteten startede 1. juli ved lav volumen. Den 24. og 25. juli registrerede OpenAI “high-volume spikes” med 16.000 forespørgsler, der brugte et relevant udtræksmønster, fordelt på over 4.000 brugere.
Efter yderligere undersøgelse fandt OpenAI beslægtet aktivitet på tværs af en klynge på mere end 15.000 brugere, som virksomheden siger, den afbrød helt 28. juli. OpenAI præciserer i en fodnote, at tallene dækker forsøg på udtræk, ikke nødvendigvis vellykkede udtræk.
Hvem OpenAI peger på, og hvad de ændrede
OpenAI skriver, at det er uklart, om alle operatører stammer fra én aktør. Men virksomheden tilskriver en “kerneklynge” af aktiviteten til personer associeret med Moonshot AI, udvikleren bag Kimi.
Som svar har OpenAI kombineret kontohåndhævelse, tekniske kontroller og samarbejde med partnere. Det omfatter forbud eller begrænsning af svigagtige konti, strammere tilmeldings- og infrastrukturkontroller samt udvidet overvågning af relaterede netværk. OpenAI siger også, at de har styrket beskyttelsen af skjult ræsonnement på tværs af brugere, workspaces, organisationer og modelfamilier, blandt andet ved at lukke en vej, hvor en person med adgang til en anden brugers krypterede ræsonnement kunne “replaye” det og få indholdet ud. Derudover er der tilføjet checks, som kan tilbageholde streamet output, der ellers kunne afsløre ræsonnement.
OpenAI har delt fund via Frontier Model Forum samt relevante kanaler til myndigheder og oplyser, at arbejdet fortsætter, også hos partnere og cloud-udbydere.
OpenAI beskriver et forsøg på at kopiere modellernes evner, ikke et indbrud i en database med brugersamtaler. Det er den forskel, der afgør, hvad sagen handler om.
Aktører i artiklen








