Google har lanceret to nye AI-modeller: Gemini 3.8 Flash og Gemini 3.8 Flash Cyber. Ifølge Google skal 3.8 Flash være deres bedste model til ræsonnement og kodning til dato, men stadig køre med samme hastighed og “lav pris” som Gemini 3.7 Flash, der kom for tre uger siden.
Den praktiske ændring for udviklere er, at 3.8 Flash i højere grad forsøger at løse opgaver ved at tage flere interne “tænke-skridt” og ved at bruge værktøjer flere gange i træk. Google beskriver det som, at modellen “arbejder hårdere”. Konsekvensen kan være, at modellen på komplekse opgaver bruger flere tokens for at få højere kvalitet, især hvis man vælger højere “effort levels” i opsætningen. Tokens er den måleenhed, der typisk ligger til grund for afregning i API’er, så flere tokens kan i praksis betyde højere omkostning pr. opgave, selv hvis prisniveauet pr. token er uændret.

Google fremhæver en række benchmark-resultater som dokumentation for forbedringerne. På DeepSWE v1.1 (langstrakt software engineering) hævder Google, at 3.8 Flash slår de fleste større “frontier”-modeller i at løse komplekse ingeniøropgaver autonomt fra start til slut, men til en brøkdel af prisen. På HLE-Verified oplyser Google en score på 54,9%, som skal vise bedre multi-step ræsonnement på tværs af naturvidenskab, humaniora og professionelle domæner. Google nævner også fremgang på Vals Finance Agent V2 og Harvey’s Legal Agent Benchmark.
Gemini 3.8 Flash Cyber er målrettet cybersikkerhed, og Google peger på, at træning i cybersikkerhed har været med til at løfte modellens generelle kodning og ræsonnement. Begge varianter bygger ifølge Google på samme grundlæggende “intelligens”, men er tilpasset forskellige driftsmiljøer.
Google skriver, at udviklere, der primært jagter regne-effektivitet, kan skrue ned for effort eller fortsætte med Gemini 3.7 Flash, som fortsat understøttes. For danske teams er 3.8 Flash mest relevant, hvis man betaler pr. token og kan veksle lidt højere tokenforbrug til færre fejl, færre iterationer og bedre kode på første forsøg. Det afgørende bliver, om gevinsten i praksis kan måles i jeres egne opgaver, ikke i Googles benchmarks.
Kilde: Google Models & Research.
Aktører i artiklen








