Anthropic vandmærker Claude-tekst for at leve op til EU’s AI-lov

Fremtidige Claude-modeller får et usynligt tekst-vandmærke, der kan bruges til at vurdere sandsynligheden for, at Claude har været med til at skrive en tekst. Anthropic siger, at kvaliteten ikke ændrer sig, men at metoden har klare begrænsninger, især på korte tekster.

Anthropic vandmærker Claude-tekst for at leve op til EU’s AI-lov
Illustration: Genereret med OpenAI.

Fremtidige versioner af AI-chatbotten Claude kommer til at skrive med et indbygget, usynligt vandmærke i teksten. Ifølge udvikleren Anthropic skal vandmærket gøre det muligt at vurdere, hvor sandsynligt det er, at Claude har været involveret i at skrive en given tekst. Ændringen bliver indført som led i, at Anthropic og flere andre store AI-udbydere vil efterleve EU AI Act.

I praksis betyder det ikke, at teksten får et synligt mærke eller en note. Vandmærket ligger i måden, modellen vælger ord på. Store sprogmodeller producerer tekst et ord ad gangen og vælger løbende mellem flere plausible næste ord. Når flere ord passer lige godt, afgøres valget normalt af tilfældighed. Anthropic beskriver, at vandmærket opstår ved at ændre kilden til den tilfældighed: I stedet for en “vilkårlig” tilfældig generator bruger modellen en hemmelig nøgle og de foregående ord til at afgøre, hvilket af de plausible ord der vælges.

Pointen er, at teksten stadig læses som normalt, men at nogen med adgang til nøglen kan teste, om ordsekvensen passer til det mønster, Claude ville lave, og dermed give en sandsynlighed for Claude-medvirken. Anthropic understreger, at metoden ikke tvinger modellen til at vælge mærkelige ord, den ellers ikke ville bruge. Den ændrer heller ikke, ifølge virksomhedens egne tests, kreativitet, læsbarhed eller kvalitet. Som støtte peger Anthropic på resultater fra Googles DeepMind, som i forbindelse med SynthID-Text ikke fandt statistisk signifikante forskelle i brugerbedømmelser mellem vandmærket og ikke-vandmærket tekst.

Begrænsningen er også tydelig: Vandmærket kan kun sige noget om sandsynligheden for, at Claude har været med. Det kan ikke bevise, at en tekst er menneskeskrevet, og det kan ikke identificere andre AI-modeller, der bruger en anden nøgle eller metode. Og på korte tekstbidder virker det dårligere, fordi der er for få “lav-indsats” ordvalg at måle mønsteret på. Jo længere tekst, desto bedre grundlag for at vurdere Claude’s rolle.

For danske læsere er kompromiset enkelt: Vandmærkning kan gøre det lettere for platforme, redaktioner og undervisere at tjekke mistanke om AI-hjælp, men det bliver ikke et endeligt bevis. Det er især relevant for dem, der skal håndtere længere tekster, hvor sandsynligheds-vurderingen faktisk kan få vægt, mens korte opslag og enkelte afsnit stadig vil være svære at afgøre sikkert.

Aktører i artiklen

Læs videre i aktørprofilen

Anthropic Anthropic er AI-selskabet bag Claude og en af de mest markante aktører i forsøget på at gøre kraftige AI-modeller mere styrbare, nyttige og mindre tilfældige. AI-lab og modelplatform

Skriv et svar

Din e-mailadresse vil ikke blive publiceret. Krævede felter er markeret med *