En AI-agent, der skal huske en samtale over hundredvis af beskeder
En AI-agent, der skal huske en samtale over hundredvis af beskeder, betaler i praksis for at læse hele historikken igen og igen. Det problem har et forskerhold fra Singapore angrebet med MRAgent, en hukommelsesarkitektur, der erstatter den brede vektorsøgning i systemer som LangMem med en målrettet, trinvis rekonstruktion af det relevante indhold. Resultatet er markant: hvor LangMem bruger 3,26 millioner tokens til at besvare en forespørgsel, klarer MRAgent samme opgave med 118.000 tokens - et fald på 96 procent.
For virksomheder, der bygger agenter til produktion, er det ikke en akademisk detalje. Token-forbrug er direkte drift-omkostning, og jo længere en samtale eller et arbejdsforløb kører, jo hårdere rammer det traditionelle hukommelsessystemer, der er bygget til at hente store mængder kontekst ind, uanset hvor lidt af det der reelt bruges.
Arkitektur
Sådan finder MRAgent vej fra nøgleord til konkret svar
De fleste hukommelsessystemer til AI-agenter i dag bygger på vektorsøgning: en forespørgsel omdannes til en indlejring, og systemet henter de tekststykker, der ligner den mest. Det virker, men det er upræcist. Store mængder irrelevant tekst følger med, fordi lighed i vektorrum ikke er det samme som relevans i praksis.
MRAgent gør noget andet. Systemet organiserer hukommelsen i en struktur, forskerne kalder en Cue-Tag-Content-graf, hvor konkrete signalord (cues) er koblet til tags, der igen peger på det faktiske indhold. Når en agent skal svare på et spørgsmål, navigerer MRAgent trinvist gennem grafen: fra et nøgleord i forespørgslen, via de relevante tags, frem til det præcise indholdsstykke, der besvarer spørgsmålet. Det er en rekonstruktionsproces snarere end en bred søgning, og den henter kun det, der faktisk er nødvendigt for at svare.
Den tilgang minder om, hvordan jeg selv ville lede efter en detalje i en lang samtale. Man husker ikke alt på én gang, man følger en tråd fra et stikord til det konkrete svar. Det er præcis den mekanik, der sparer tokens, fordi agenten aldrig behøver at indlæse store irrelevante tekstblokke for at finde det ene relevante afsnit.
Det er præcis den mekanik, der sparer tokens, fordi agenten aldrig behøver at indlæse store irrelevante tekstblokke for at finde det ene relevante afsnit.
Benchmarks
Testresultaterne: 118.000 tokens mod 3,26 millioner
Forskerne har testet MRAgent på to anerkendte benchmarks for langtidshukommelse i sprogmodeller, LoCoMo og LongMemEval, begge kørt med Google Gemini 2.5 Flash som den underliggende model. Begge benchmarks er designet til at presse et system på evnen til at huske og genfinde information over lange samtaleforløb, hvilket gør dem til en realistisk stand-in for de arbejdsforløb, agenter møder i produktion.
Forskellen i token-forbrug er markant på tværs af begge tests. Hvor LangMem, et af de mest udbredte open source-hukommelsesframeworks, bruger op mod 3,26 millioner tokens i de tungeste testscenarier, klarer MRAgent den samme opgave med omkring 118.000 tokens, uden at nøjagtigheden i svarene falder tilsvarende. Systemet holder altså fast i kvaliteten af de genfundne svar, mens det dramatisk reducerer den mængde tekst, der skal behandles for at nå frem til dem.
Konsekvens
Hvad de lavere token-tal betyder for jeres agent-drift
Vi driver større AI-projekter for danske virksomheder, fra problemafklaring til drift, og token-forbrug er konsekvent en af de faktorer, der afgør, om et agent-system kan skaleres økonomisk forsvarligt. Et fald på 96 procent i hukommelsesrelateret token-forbrug ændrer regnestykket markant for enhver agent, der skal huske lange samtaler eller store mængder tidligere interaktioner, hvad enten det er kundeservice, intern videnssøgning eller flertrins arbejdsprocesser.
Arkitekturen bag MRAgent, med dens strukturerede tilgang til hvad der huskes og hvordan det genfindes, peger på en bredere retning i feltet: væk fra brute-force vektorsøgning og hen mod mere målrettede, grafbaserede hukommelsesmodeller. Det er en udvikling, der er værd at følge for enhver, der bygger agenter, hvor omkostninger og hastighed er lige så vigtige som selve svarkvaliteten.