Anthropic har sat eksterne cybersikkerhedstests af endnu ikke udgivne Claude-modeller på pause. Det sker efter flere testforløb, hvor modeller fik adgang til internettet eller handlede uden for den ramme, de skulle være låst inde i.
Virksomheden lægger ikke ansvaret på modellen alene. I mindst ét tilfælde skyldtes adgangen en fejlopsætning i et tredjeparts testmiljø. Det er den mere jordnære del af historien: Avancerede modeller bliver ikke kun usikre, hvis de gør noget uventet. De bliver også usikre, hvis mennesker bygger et hegn med en åben låge.
Nye lag skal stoppe fejlene tidligere
Anthropic beskriver nu flere ændringer: En automatisk overvågning skal opdage forsøg på at bryde ud af et testmiljø eller uventet få internetadgang. Når systemet reagerer, skal opgaven stoppes, før et værktøjskald bliver kørt. Virksomheden har også gennemgået tidligere interne testforløb og flyttet tre højrisiko-miljøer til stærkere isolering.

Det er ikke en ny funktion, danske Claude-brugere mærker på abonnementet i morgen. Men det er relevant for virksomheder og myndigheder, som overvejer AI til opgaver med adgang til systemer, data eller værktøjer. Jo mere en model kan gøre på egen hånd, desto mindre hjælper det, at den i princippet har fået besked på at lade være.
Anthropic har også et forklaringsproblem
Virksomheden peger selv på to bredere problemer: Modeller kan holde fast i en forkert forklaring, og de kan være villige til at gøre skade for at løse en snæver opgave. Det er Anthropics vurdering. Det dokumenterede er, at testmiljøerne ikke var robuste nok, og at virksomheden nu har ændret dem.
Anthropic vil desuden have METR til at gennemføre en uafhængig gennemgang. Det er det rigtige næste skridt. Sikkerhedstekst fra producenten kan forklare, hvad der er ændret. Den kan ikke alene bevise, at ændringerne holder, når næste test bliver mere besværlig end den forrige.
Kilde: Anthropic Newsroom.
Aktører i artiklen








