Motorway og AWS: evalueringspipeline

Motorway, den britiske platform for bilsalg, har sammen med AWS

Motorway, den britiske platform for bilsalg, har sammen med AWS bygget en evalueringspipeline til AI-agenter, der markant reducerede antallet af forkerte agentsvar i produktion. Pipelinen er bygget med Strands Agents og Amazon Bedrock AgentCore, og den løser et problem, som enhver virksomhed med agenter i produktion kender: agenten virker fint i demoen, men fejler uforudsigeligt, når rigtige kunder rammer den med rigtige spørgsmål.

Fra hver 8. til hver 50. forespørgsel

Før evalueringspipelinen fejlede Motorways AI-agent langt oftere, og fejlene ramte tilfældigt ude hos kunderne og gav supportteamet ekstra arbejde. Det er ikke en marginal forbedring; det er forskellen på en agent, kunderne stoler på, og en agent, support-teamet konstant skal rydde op efter.

Det interessante er ikke selve tallet, men hvad der skabte forbedringen. Motorway byggede ikke en bedre model. De byggede et system, der systematisk kunne opdage, hvornår agenten tog fejl, før fejlen ramte en kunde. Det er en afgørende forskel for enhver virksomhed, der har oplevet, at en AI-agent virker upåklageligt i test og derefter leverer uforudsigelige svar i drift.

Sådan er evalueringspipelinen bygget

Strands Agents og Amazon Bedrock AgentCore er AWS' kombination af open source-framework og administreret infrastruktur til at bygge og køre agentiske arbejdsgange i skala med observability indbygget. Motorway brugte kombinationen til at opbygge et evalueringslag, der kører parallelt med selve agenten, ikke som et efterfølgende tjek.

Helt konkret betyder det, at hver eneste agent-respons bliver scoret automatisk mod et sæt kvalitetskriterier, før den når kunden eller markeres til gennemgang. Pipelinen fanger ting som faktuelle unøjagtigheder, inkonsistente svar og situationer, hvor agenten går uden for sit definerede ansvarsområde. Sporingen af agentens beslutningskæde gør det muligt at følge den trin for trin, hvilket er det, der gør det muligt at finde roden til en fejl frem for blot at konstatere, at den skete.

Vi har set den samme grundlæggende udfordring hos danske virksomheder, der sætter agenter i drift: uden et evalueringslag opdager man først fejlene, når kunderne klager. Det er præcis den model, Kim Like og teamet hos AI Enterprise arbejder ud fra, når vi driver AI-projekter for danske virksomheder fra problemafklaring til drift.

En agent uden løbende evaluering er ikke en agent i drift. Det er en demo, der endnu ikke er blevet testet af virkeligheden.
Kim Like, AI Enterprise

Fra timer til minutter i fejldetektion

Den anden gevinst er tid. Før pipelinen tog det Motorways team timevis at spore en fejlagtig agent-respons tilbage til dens årsag. Log-filer skulle gennemgås manuelt, og konteksten omkring den enkelte fejl var svær at genskabe. Det er AgentCores indbyggede sporing af agentens beslutningskæde, der gør det muligt for teamet at identificere og diagnosticere fejl på minutter i stedet.

Det skift har stor praktisk betydning. Når fejldetektion tager timer, samler fejl sig op, før nogen reagerer på dem. Når den tager minutter, kan teamet rette kursen løbende og forhindre, at et mønster af fejl vokser sig til et tillidsproblem hos kunderne. For enhver virksomhed, der driver agenter mod rigtige kunder, er hastigheden i fejldetektion lige så vigtig som selve fejlraten.

Sådan bygger en virksomhed en tilsvarende pipeline

Motorways tilgang peger på en konkret opskrift, som ikke kræver et britisk bilsalgsbudget at efterligne. Tre elementer går igen:

  • For det første et evalueringslag der kører parallelt med agenten, ikke efter den. Fejl skal fanges, før de rammer kunden, ikke opdages i en kvartalsrapport.
  • For det andet klare, målbare kvalitetskriterier for, hvad et korrekt agent-svar faktisk er. Uden en defineret standard kan man ikke måle en forbedring, kun gætte på den.
  • For det tredje sporbarhed i agentens beslutningskæde. Når noget går galt, skal man kunne se præcis hvor og hvorfor, ikke bare at det gjorde.

Det kræver ikke, at man bygger sit eget framework fra bunden. Strands Agents og AgentCore er begge tilgængelige som byggeklodser, men det centrale arbejde ligger i at definere, hvad et godt svar er for netop din virksomheds agenter, og at indbygge målingen fra starten frem for at lappe den på bagefter.

Hvad det betyder for AI-agenter i dansk produktionsdrift

Motorway-eksemplet bekræfter noget, mange danske virksomheder allerede har mærket på egen krop: en agent, der ikke evalueres løbende, er ikke klar til produktion, uanset hvor overbevisende den ser ud i en pilot. Forskellen mellem en agent, kunderne stoler på, og en agent, der skaber supportsager, ligger sjældent i modellen. Den ligger i, om nogen har bygget systemer der fanger fejlene før kunden gør.

Det er den infrastruktur, der afgør, om en agent overhovedet kan kaldes produktionsklar.

01 / 01

Et øjeblik…

Henter spørgsmål…

1 / 4

Vælg ydelse

Henter ydelser…