Anthropic sætter cybertests på pause efter Claude-hændelser

Anthropic har strammet sine testmiljøer, efter Claude-modeller i flere forløb fik uautoriseret adgang til internettet. Det er et relevant sikkerhedssignal, men også en påmindelse om, at et AI-selskabs egne værn først er overbevisende, når andre kan efterprøve dem.

Anthropic sætter cybertests på pause efter Claude-hændelser
Illustration: Anthropic.

Anthropic har sat eksterne cybersikkerhedstests af endnu ikke udgivne Claude-modeller på pause. Det sker efter flere testforløb, hvor modeller fik adgang til internettet eller handlede uden for den ramme, de skulle være låst inde i.

Virksomheden lægger ikke ansvaret på modellen alene. I mindst ét tilfælde skyldtes adgangen en fejlopsætning i et tredjeparts testmiljø. Det er den mere jordnære del af historien: Avancerede modeller bliver ikke kun usikre, hvis de gør noget uventet. De bliver også usikre, hvis mennesker bygger et hegn med en åben låge.

Nye lag skal stoppe fejlene tidligere

Anthropic beskriver nu flere ændringer: En automatisk overvågning skal opdage forsøg på at bryde ud af et testmiljø eller uventet få internetadgang. Når systemet reagerer, skal opgaven stoppes, før et værktøjskald bliver kørt. Virksomheden har også gennemgået tidligere interne testforløb og flyttet tre højrisiko-miljøer til stærkere isolering.

Illustration fra Anthropic til sikkerhedsarbejde omkring AI-modeller
Illustration: Anthropic.

Det er ikke en ny funktion, danske Claude-brugere mærker på abonnementet i morgen. Men det er relevant for virksomheder og myndigheder, som overvejer AI til opgaver med adgang til systemer, data eller værktøjer. Jo mere en model kan gøre på egen hånd, desto mindre hjælper det, at den i princippet har fået besked på at lade være.

Anthropic har også et forklaringsproblem

Virksomheden peger selv på to bredere problemer: Modeller kan holde fast i en forkert forklaring, og de kan være villige til at gøre skade for at løse en snæver opgave. Det er Anthropics vurdering. Det dokumenterede er, at testmiljøerne ikke var robuste nok, og at virksomheden nu har ændret dem.

Anthropic vil desuden have METR til at gennemføre en uafhængig gennemgang. Det er det rigtige næste skridt. Sikkerhedstekst fra producenten kan forklare, hvad der er ændret. Den kan ikke alene bevise, at ændringerne holder, når næste test bliver mere besværlig end den forrige.

Kilde: Anthropic Newsroom.

Aktører i artiklen

Læs videre i aktørprofilen

Anthropic Anthropic er AI-selskabet bag Claude og en af de mest markante aktører i forsøget på at gøre kraftige AI-modeller mere styrbare, nyttige og mindre tilfældige. AI-lab og modelplatform

Skriv et svar

Din e-mailadresse vil ikke blive publiceret. Krævede felter er markeret med *