Multi-turn-angreb brød AI-modeller 88%

En enkelt ondsindet besked er sjældent nok til at få en sprogmodel

En enkelt ondsindet besked er sjældent nok til at få en sprogmodel til at bryde sine egne regler. Men stil den samme model en række tilsyneladende uskyldige spørgsmål i forlængelse af hinanden, og noget andet sker. Cisco har testet 15 førende AI-modeller med netop den metode, og resultatet er markant: multi-turn-angreb, hvor angrebet bygges op over flere beskeder i en samtale, lykkedes op til 88 procent af gangene. Det er data, der blev fremlagt på VB Transform 2026, og det rammer lige ind i den måde, mange virksomheder i dag bygger og tester deres AI-agenter på.

Angrebsmetode

Sådan bygges et angreb over flere beskeder

Multi-turn-angreb udnytter noget helt grundlæggende ved, hvordan sprogmodeller fungerer: de holder styr på kontekst gennem en samtale, og de er indrettet til at være hjælpsomme og til at følge tråden fra tidligere beskeder. Et angreb starter typisk med en neutral, legitim-lydende forespørgsel. Derefter bygges der gradvist videre, besked for besked, hvor hver enkelt besked isoleret set ser harmløs ud, men hvor summen af beskederne leder modellen hen mod et svar, den aldrig ville have givet, hvis spørgsmålet var stillet direkte på én gang.

Ciscos test af de 15 modeller viste, at denne fremgangsmåde er markant mere effektiv end den klassiske metode, hvor man forsøger at omgå en models sikkerhedsforanstaltninger med en enkelt, skarpt formuleret besked. Med op til 88 procents succesrate på tværs af modellerne demonstrerer testen, at samtalens forløb i sig selv er et angrebsflade, ikke bare indholdet af den enkelte besked.

Testmetode

Single-turn-test giver et falsk billede af sikkerheden

Det er her problemet for virksomheder for alvor bider sig fast. Størstedelen af den sikkerhedstestning, der i dag udføres på AI-modeller og AI-agenter, er single-turn-test: man sender én besked, vurderer svaret, og konkluderer, om modellen er sikker eller ej. Ciscos data viser, at den tilgang systematisk overser den reelle trussel, fordi den slet ikke tester det scenarie, hvor risikoen faktisk opstår.

En model, der består alle single-turn-tests med glans, kan stadig være sårbar over for et angreb, der bygges op over ti eller femten beskeder. Det betyder, at mange virksomheder i dag går rundt med en falsk tryghed om, hvor modstandsdygtige deres AI-løsninger reelt er, fordi deres testregime aldrig har afdækket den type angreb, der rent faktisk virker.

Agent-risiko

Over halvdelen af virksomhederne har allerede oplevet en agent-hændelse

Tallene fra Cisco står ikke alene som et teoretisk problem. En undersøgelse fra VentureBeat viser, at 54 procent af virksomhederne allerede har oplevet en sikkerhedshændelse eller et nærved-tilfælde relateret til en AI-agent. Det er over halvdelen, og det sker på et tidspunkt, hvor mange virksomheder stadig er i gang med at rulle agent-baserede løsninger ud i produktion, ikke efter årevis af moden drift.

Det fortæller noget vigtigt: risikoen er ikke hypotetisk eller fremtidig. Den materialiserer sig allerede nu, i takt med at flere virksomheder giver AI-agenter adgang til systemer, data og handlemuligheder, de tidligere kun gav til mennesker med begrænset og kontrolleret adgang.

Risikoen er ikke hypotetisk eller fremtidig. Den materialiserer sig allerede nu, i takt med at flere virksomheder giver AI-agenter adgang til systemer, data og handlemuligheder, de tidligere kun gav til mennesker med begrænset og kontrolleret adgang.

Red-teaming

Sådan tester virksomheder reelt mod multi-turn-angreb

Vi arbejder med større AI-projekter for danske virksomheder, fra problemafklaring til drift, og det billede, Ciscos data tegner, matcher det, vi ser i praksis: red teaming af AI-systemer skal simulere hele samtaler, ikke enkeltstående beskeder. Et solidt testregime bygger angrebsscenarier op over flere trin, ligesom en reel angriber ville gøre, og det tester specifikt, om modellen kan manipuleres til at glide væk fra sine retningslinjer undervejs i en dialog.

Det kræver en anden testinfrastruktur end den, mange organisationer allerede har liggende. Automatiserede test-suiter, der kun sender enkeltbeskeder og måler svar isoleret, skal suppleres eller erstattes af scenariebaseret testning, hvor en simuleret bruger fører en flertrins-samtale med modellen og forsøger at eskalere gradvist. Det er mere ressourcekrævende end single-turn-test, men det er den eneste metode, der reelt afdækker den sårbarhed, Ciscos tal viser.

Adgangsstyring

Adgang skal begrænses, ikke bare overvåges

Ud over bedre testning peger data på et strukturelt behov: AI-agenter bør have skarpt afgrænsede identiteter og adgangsrettigheder, ligesom man ville give en ny medarbejder adgang efter princippet om mindste privilegium. En agent, der kun kan udføre de handlinger, den faktisk skal bruge til sin opgave, begrænser skadesomfanget markant, selv hvis et multi-turn-angreb lykkes med at manipulere dens svar.

Ephemere sandkasser, altså isolerede, midlertidige miljøer der oprettes til en enkelt opgave og nedlægges bagefter, er en anden konkret mekanisme. De forhindrer, at en kompromitteret samtale får varig adgang til systemer eller data ud over den enkelte session. Kombineret med runtime-kontrol, der kan gribe ind og stoppe en agent midt i en handling, hvis adfærden afviger fra det forventede, giver det et forsvar i flere lag frem for én enkelt sikkerhedsforanstaltning ved samtalens start.

Løbende drift

Modellens adfærd ændrer sig, og overvågningen skal følge med

Den sidste pointe i Ciscos data er måske den vigtigste for virksomheder, der allerede har AI-agenter i drift: en model, der er sikker i dag, er ikke nødvendigvis sikker om seks måneder. Modeller opdateres, finjusteres og ændrer adfærd, og nye angrebsteknikker udvikles løbende. Det betyder, at sikkerhedstestning ikke kan være en engangsøvelse, man udfører før lancering og derefter glemmer.

Vedvarende overvågning af, hvordan en model reelt opfører sig i produktion, herunder løbende stikprøver med multi-turn-scenarier, bliver dermed en driftsopgave på linje med patch-håndtering og logning. For virksomheder, der allerede har mærket konsekvenserne, som de 54 procent i VentureBeats undersøgelse har, er den løbende overvågning ikke en ekstra udgift man kan spare væk. Det er den forsikring, der afgør, om næste multi-turn-angreb bliver opdaget, før det gør skade, eller bagefter.

01 / 01

Et øjeblik…

Henter spørgsmål…

1 / 4

Vælg ydelse

Henter ydelser…