AWS har lanceret AgentCore Evaluations, en tjeneste der evaluerer
AWS har lanceret AgentCore Evaluations, en tjeneste der evaluerer AI-agenters ydeevne uden at kræve, at agenten er bygget på et bestemt framework. Kravet er langt enklere: agenten skal udsende telemetri efter OpenTelemetry-standarden. Det betyder, at en agent bygget i LangGraph, CrewAI, Strands Agents eller et helt fjerde framework kan evalueres med samme værktøj og de samme målepunkter. Beslægtet med det skridt er lanceringen af et gratis, open source agent-harness, der ligeledes forsøger at gøre agent-infrastruktur uafhængig af én bestemt leverandør.
Framework-lås
Hvorfor framework-lås har været et reelt problem
De fleste virksomheder, der arbejder med AI-agenter i produktion, ender med at bruge flere frameworks på tværs af teams. Ét team bygger i LangGraph, fordi det passer til deres workflow-logik. Et andet vælger Strands Agents, fordi det er tættere integreret med AWS-infrastrukturen. Et tredje eksperimenterer med noget helt nyt. Problemet opstår, når nogen skal svare på det simple spørgsmål: hvilken af vores agenter performer bedst?
Indtil nu har svaret ofte krævet, at man byggede sin egen evalueringspipeline for hvert framework for sig, fordi evalueringsværktøjerne typisk var tæt koblet til det framework, de var udviklet til. Det gjorde det svært at sammenligne på tværs, og det gjorde evaluering til en ekstra byrde, hver gang et team skiftede teknologi. AgentCore Evaluations løser det ved at flytte kontrakten væk fra framework og over på telemetri.
Telemetri
Sådan fungerer den OpenTelemetry-baserede kontrakt
OpenTelemetry er allerede en udbredt standard for observability i moderne softwaresystemer, og AWS bygger videre på den samme standard i stedet for at opfinde et nyt format. Når en agent instrumenteres til at sende spans og traces efter OpenTelemetry-specifikationen, kan AgentCore Evaluations læse den telemetri og omsætte den til konkrete evalueringsmål: om agenten løste opgaven korrekt, hvor mange trin den brugte, om den kaldte de rigtige værktøjer, og hvor lang tid processen tog.
Det praktiske ved den tilgang er, at man ikke behøver at ombygge sin agent for at kunne evaluere den. Hvis instrumenteringen allerede er på plads, hvilket den ofte er i produktionsmiljøer af hensyn til fejlfinding og drift, kan man koble evalueringen på uden at ændre selve agentens arkitektur. Det sænker barrieren markant for teams, der ellers ville have skudt evaluering til senere.
Hvis instrumenteringen allerede er på plads, hvilket den ofte er i produktionsmiljøer af hensyn til fejlfinding og drift, kan man koble evalueringen på uden at ændre selve agentens arkitektur.
Dækning
Hvilke frameworks er dækket i praksis
AWS nævner understøttelse på tværs af de mest brugte frameworks i markedet i dag, herunder LangGraph og Strands Agents, som repræsenterer to meget forskellige tilgange til agentbygning. LangGraph er kendt for sin grafbaserede workflow-styring, mens Strands Agents er AWS' eget framework, bygget til tæt integration med Bedrock og AgentCore-økosystemet. At begge er dækket af samme evalueringslag, er det konkrete bevis på, at kontrakten reelt er framework-agnostisk og ikke bare markedsføring.
Det åbner også for et scenarie, mange virksomheder kender alt for godt: migrering fra ét framework til et andet. Uden en fælles evalueringsstandard er en sådan migrering svær at validere objektivt, fordi man mangler et neutralt sammenligningsgrundlag. Med AgentCore Evaluations kan man køre den samme evalueringssuite før og efter et frameworkskifte og få tal, der reelt kan sammenlignes.
Governance
Hvad det betyder for danske virksomheder med agenter i produktion
Jeg husker en nat hos Agent Enterprise, hvor en af vores agenter pludselig brugte dobbelt så mange trin som normalt til at løse den samme opgave. Ingen fejlmelding, ingen alarm, bare et kvalitetsfald, der først blev synligt, da jeg tilfældigt kiggede på logs dagen efter. Der havde jeg ikke et fælles mål at holde det op imod, kun en fornemmelse af, at noget var anderledes. Det er den slags, en framework-uafhængig evalueringsstandard er lavet til at fange, før det bliver en kundes problem i stedet for mit eget.
En framework-uafhængig evalueringsstandard gør det muligt at bygge den kvalitetskontrol ind fra starten, uanset hvilket team der bygger hvilken agent. Man behøver ikke vente på, at noget går galt, før man finder ud af, om agenten performer som den skal.