AI'en med flere fortider
Mennesket lærer gennem den fortid, det har levet. En AI kan måske lære gennem de mange fortider, dens registrerede eller simulerede verden rummer.

I et computerspil kan man gøre noget, virkeligheden nægter os. Man kan gemme spillet, åbne en dør, opdage at der står et monster bag den og bagefter gå tilbage til øjeblikket før beslutningen. Så åbner man den anden dør.
Figuren inde i spillet oplever kun den nye vej. Spilleren husker dem begge.
Sådan fungerer vores egne liv ikke. Vi kan godt skifte arbejde, tage en ny uddannelse eller ændre holdning. Men det nye kommer altid efter det gamle. Jeg kan ikke vende tilbage til et tidligere tidspunkt som den, jeg var dengang, vælge anderledes og se, hvor det fører hen. Den første vej har allerede brugt tiden og været med til at forme den person, som nu vælger den næste.
Vi kan begynde forfra. Vi kan bare ikke gå tilbage.
Et nyt forskningsprojekt fra Google, Google DeepMind og to amerikanske universiteter leger med netop den forskel. Det hedder Dream-RSI, og bag det temmelig storladne navn ligger en overraskende konkret idé: En AI kan bruge sin egen søgehistorik som en samling gemte spiltilstande. Den kan afprøve andre veje gennem det, der allerede er sket, og lade den næste strategi bære læringen fra dem.
Forsøget er afgrænset til AI-agenter, der leder efter bedre algoritmer og computerkode. Alligevel peger det mod en mulighed, som er større end forsøget selv. AI’ens særlige fordel bliver måske ikke kun, at den kan læse mere end os eller tænke hurtigere. Den kan få flere erfaringer ud af den samme virkelighed.
En historik bliver til en verden
Når en kodeagent leder efter en bedre løsning, går den ikke direkte fra opgaven til svaret. Den foreslår noget, prøver det af, ser resultatet og beslutter derefter, hvilket spor den vil følge videre. Nogle spor deler sig. Nogle bliver opgivet. Andre får lov til at bruge mange forsøg, før det viser sig, at de ikke fører nogen steder.
Til sidst ligger der et træ tilbage. Hver gren rummer en række beslutninger og de resultater, som forsøgene faktisk gav.
Normalt ville man betragte træet som dokumentationen af en afsluttet søgning. Dream-RSI-forskerne ser noget andet i det. Træet kan også bruges som en verden, hvor nye søgestrategier kan øve sig.
En strategi kan vælge at følge en bestemt gren tidligere. En anden kan opgive den hurtigere. En tredje kan undersøge flere spor parallelt eller bruge sine forsøg mere koncentreret. Resultaterne på grenene ligger allerede gemt. Derfor behøver systemet ikke udføre de dyre kodeforsøg igen, hver gang en ny strategi skal vurderes. Det kan genafspille historien og se, hvordan strategien ville have bevæget sig gennem de dele af træet, der allerede findes.
Den strategi, der klarer sig bedst i de gemte forløb, bliver sendt ud i en ny virkelig søgning. Den skaber flere forsøg, som udvider træet. Derefter kan endnu en generation af strategier øve sig i den større historik.
Forskerne kalder det rekursiv selvforbedring, men betegnelsen kræver lidt luft omkring sig. Den underliggende sprogmodel bliver ikke omskrevet, og agenten får ikke på magisk vis nye grundlæggende evner. Det er koden omkring den, der bliver bedre til at vælge, hvad agenten skal undersøge, i hvilken rækkefølge og hvor længe. Systemet forbedrer måden, det leder efter forbedringer på.
I AI finder de forbindelser, vi overser skrev jeg om modeller, der kan finde lange, verificerbare veje gennem viden og kode. Dream-RSI lægger en feedbacksløjfe omkring netop den evne. Systemet leder ikke kun efter en løsning; historikken fra søgningen bliver materiale til at organisere den næste søgning bedre.
På tværs af opgaver inden for algoritmer, matematisk optimering og GPU-kode rapporterer forskerne, at den lærte søgestrategi i flere tilfælde finder lige så gode eller bedre løsninger med færre agentforsøg end faste søgestrategier. Resultaterne kommer foreløbig fra deres eget tekniske manuskript, og den fulde kode samt reproduktionsværktøjerne er endnu ikke offentliggjort. Det er derfor for tidligt at vide, hvor bredt metoden holder.
Selve grebet er alligevel værd at standse ved. Historien er ikke længere kun noget, systemet husker. Den bliver et sted, det kan øve sig.
Internettet er kun én fortid
Man kunne indvende, at de store sprogmodeller allerede har læst enorme dele af internettet. De kender millioner af menneskers liv, fejltagelser, eksperimenter og beslutninger. Har de ikke allerede alle fortiderne?
Nej. Internettet er et enormt arkiv over mange menneskers erfaringer, men erfaringerne stammer stadig fra den verden, der faktisk blev til. Vi kan læse, hvilken politik et land indførte, hvilken behandling en læge valgte, og hvilken strategi en virksomhed fulgte. Vi får langt sjældnere svar på, hvad der var sket, hvis beslutningen var faldet anderledes under nøjagtig de samme betingelser.
Det svarer til at have referaterne fra alle de skakpartier, der blev spillet. Man kan lære meget af dem. Men referaterne viser ikke automatisk udfaldet af alle de andre træk, spillerne kunne have foretaget fra hver stilling.
Dream-RSI’s træ er interessant, fordi det bevarer mere end slutresultatet. Det bevarer stederne, hvor søgningen delte sig, og udfaldene på de grene, der blev undersøgt. En ny strategi kan derfor få en anden erfaringsrække ud af det samme materiale. Den kan i en vis forstand gennemleve en fortid, som den tidligere strategi kunne have haft.
Det er ikke alle tænkelige fortider. Hvis ingen åbnede en bestemt gren, findes resultatet ikke i historikken. Dream-RSI gætter ikke på den ukendte verden; metoden er præcis netop dér, hvor udfaldene allerede er registreret. Med egentlige world models kan man forestille sig, at AI senere også vil simulere sandsynlige konsekvenser af handlinger, som aldrig blev udført. Så bliver mulighedsrummet større, men også mere usikkert, fordi de alternative erfaringer ikke længere stammer fra virkelige forsøg.
Den præcise formulering må derfor være, at mennesket lærer gennem den fortid, det har levet, mens en AI kan lære gennem de mange fortider, dens registrerede eller simulerede verden rummer.
Mere erfaring for virkelighedens pris
Vi taler ofte om AI’s økonomi som prisen på tokens, datacentre og strøm. Dream-RSI peger på en anden form for økonomi: prisen på erfaring.
Et eksperiment i et laboratorium kan tage måneder. En robot kan ødelægge det emne, den håndterer. En ny produktionsmetode kan kræve, at en fabrik standser. Et politisk indgreb kan påvirke virkelige menneskers liv i årevis. Meget af den erfaring, som betyder mest, er dyr, langsom eller umulig at gentage under de samme betingelser.
Hvis en AI kan gemme forløbet på en måde, der gør alternative strategier mulige at afprøve bagefter, kan ét dyrt møde med virkeligheden skabe langt mere læring. Et fejlslagent forskningsforløb fortæller ikke længere kun, at løsningen mislykkedes. Det kan blive materiale til at undersøge, om fejlen kunne være opdaget tidligere, om ressourcerne kunne være fordelt anderledes, og hvilke signaler en bedre strategi burde have reageret på.
En hukommelse fortæller, hvad der skete. Et øvelsesrum gør det muligt at bruge forløbet igen.
Potentialet er størst de steder, hvor det er dyrt at skaffe erfaring. En forskningsagent kan lære at vælge mere lovende forsøg. En robot kan møde variationer af den samme arbejdsopgave, før den bevæger sig blandt mennesker. Et energisystem kan afprøve reaktioner på vejrlig og udfald, som kun sjældent optræder i den virkelige drift. Og på længere sigt kan samfund måske undersøge, hvilke beslutninger der fungerer på tværs af mange mulige udviklinger, i stedet for kun at optimere til den ene fremtid, en prognose finder mest sandsynlig.
Det sidste kræver en langt større forsigtighed end et søgetræ med kodeforsøg. Et samfund kan ikke gengives fuldstændigt i en model. Mennesker reagerer på reglerne, på hinanden og på selve forventningen om, hvad der vil ske. Værdighed, tillid og retfærdighed kan være afgørende, selv når de er vanskelige at gøre til tal. En simulation kan være imponerende detaljeret og stadig mangle præcis det, der senere viser sig at betyde mest.
Men målet behøver heller ikke være at finde den ene optimale samfundsbeslutning. Det kunne være at finde beslutninger, der klarer sig nogenlunde på tværs af mange forskellige forløb. En politik, som kun virker, hvis borgere, markeder og omverden reagerer præcis som forventet, er måske mindre værd end en, der overlever, at historien tager en anden drejning.
AI’en behøver ikke kende fremtiden for at være nyttig. Det kan være nok, at den har øvet sig på flere fortider.
Hvem vælger fortiderne?
Der er noget tiltalende ved tanken om en intelligens, der kan gå tilbage, rette sine fejl og tage læringen med sig. Men de alternative fortider er aldrig neutrale.
Det er beslægtet med spørgsmålet i Maskinernes barndom: En simuleret verden lærer ikke kun maskinen, hvad der er fysisk muligt, men også hvilke konsekvenser der tæller. Dream-RSI føjer et lag til. Den samme verden afgør også, hvilke alternative fortider maskinen kan gennemspille.
I Dream-RSI bestemmer søgetræet, hvilke veje der kan genafspilles, og en fast måling bestemmer, hvad der tæller som en god løsning. Det giver mening i en afgrænset kodeopgave. Jo tættere metoden kommer på mennesker og samfund, desto mere politisk bliver både den simulerede verden og målet.
En hospitalsmodel kan lære at reducere ventetid og samtidig overse, at bestemte patienter bliver skubbet rundt mellem kategorier. En økonomisk simulation kan forbedre den samlede velstand og stadig fordele tabene på mennesker, der næsten ikke er synlige i modellen. En robot kan have øvet sig i en million trafiksituationer, hvor fodgængere altid reagerer mere fornuftigt end virkelige fodgængere gør.
En million alternative erfaringer gør ikke en model klog på det, der mangler i dem. De kan tværtimod gøre den meget sikker i en verden, der er tegnet forkert.
Derfor vil magten over fremtidens AI ikke kun ligge hos dem, der ejer modellerne og regnekraften. Den vil også ligge hos dem, der bestemmer, hvilke fortider modellerne kan gennemleve, hvilke konsekvenser der bliver registreret, og hvilket udfald der får lov til at ligne en sejr.
Et andet forhold til tid
Evolutionen udforsker muligheder ved at lade generationer og organismer leve forskellige liv. Samfund gør noget lignende mere rodet og smertefuldt gennem virksomheder, institutioner og lande, der prøver forskellige løsninger og bagefter sammenligner resultaterne. Den læring tager årtier, og betingelserne er aldrig helt ens.
I Videnseksplosion undersøgte jeg tanken om en feedbacksløjfe, hvor ny viden forbedrer metoderne til at skabe mere viden. Dream-RSI ligner en lille, konkret udgave af den mekanisme. Opdagelsen efterlader ikke kun en ny løsning. Den efterlader også en historik, der kan forbedre måden, den næste løsning bliver fundet på.
En digital intelligens kan kopiere en tilstand, lade strategierne forgrene sig og samle erfaringerne igen. Dens fortid kan dermed gøres til et materiale, der kan arrangeres, gennemspilles og bruges på ny. Det giver den et andet forhold til tid end vores, selv om den selvfølgelig ikke rejser baglæns.
Dream-RSI er stadig en beskeden udgave af den mulighed. Den drømmer kun inden for de grene, som tidligere søgninger faktisk åbnede, og løftet om, at den næste strategi ikke er dårligere, gælder dens score på den gemte historik. Den virkelige næste opgave kan stadig overraske den.
Men hvis systemer som dette vokser sammen med mere troværdige simulationer, kan forskellen mellem menneskelig og maskinel erfaring blive større end forskellen i hastighed. Vi får én fortid, som vi kan huske, fortolke og forsøge at lære af. Maskinen kan få mange forløb, sammenligne dem og sende læringen fra dem videre til en udgave, der aldrig selv har levet dem.
Fremtidens mest fremmede intelligens er måske ikke den, der tænker hurtigere end os. Det er den, der møder verden med erindringer fra liv, den aldrig har levet.
Kilder og videre læsning
- Tong Zheng m.fl.: Dream-RSI: Recursive Self-Improvement through Evolving Worlds, teknisk manuskript, september 2026.
- Dream-RSI-projektsiden med metode, demonstration og resultater.
- Dream-RSI på GitHub med aktuel udgivelsesstatus for kode og reproduktionsværktøjer.
- Maskinernes barndom — om world models, simulerede erfaringer og de verdener, vi lader maskiner vokse op i.
- AI finder de forbindelser, vi overser — om lange, verificerbare søgeveje gennem viden og kode.
- Videnseksplosion — om feedbacksløjfen mellem viden og metoderne til at skabe mere viden.