# Die KI mit mehreren Vergangenheiten

Menschen lernen aus der Vergangenheit, die sie gelebt haben. Eine KI könnte aus vielen Vergangenheiten ihrer aufgezeichneten oder simulierten Welt lernen.

- Forfatter: Mikkel Freltoft Krogsholm
- Type: Essay
- Udgivet: 2026-09-17
- Opdateret: 2026-09-17
- Sprog: de
- Emner: ki, simulation, lernen, zeit, selbstverbesserung
- Kanonisk URL: https://mikkelkrogsholm.dk/de/articles/aien-med-flere-fortider/

---

In einem Computerspiel kann man etwas tun, das uns die Wirklichkeit verweigert. Man kann das Spiel speichern, eine Tür öffnen, dahinter ein Monster entdecken und anschließend zu dem Augenblick vor der Entscheidung zurückkehren. Dann öffnet man die andere Tür.

Die Figur im Spiel erlebt nur den neuen Weg. Der Spieler erinnert sich an beide.

Unser eigenes Leben funktioniert nicht so. Wir können den Beruf wechseln, eine weitere Ausbildung machen oder unsere Meinung ändern. Doch das Neue kommt immer nach dem Alten. Ich kann nicht als der Mensch, der ich damals war, zu einem früheren Zeitpunkt zurückkehren, anders wählen und sehen, wohin es führt. Der erste Weg hat die Zeit bereits verbraucht und den Menschen mitgeformt, der nun den nächsten wählt.

Wir können neu anfangen. Wir können nur nicht zurückgehen.

Ein neues Forschungsprojekt von Google, Google DeepMind und zwei amerikanischen Universitäten spielt mit genau diesem Unterschied. Es heißt [Dream-RSI](https://dream-rsi.com/), und hinter dem recht vollmundigen Namen steckt eine überraschend konkrete Idee: Eine KI kann ihre eigene Suchgeschichte als Sammlung gespeicherter Spielstände verwenden. Sie kann andere Wege durch das bereits Geschehene ausprobieren und die nächste Strategie die Erkenntnisse daraus mitnehmen lassen.

Das Experiment beschränkt sich auf KI-Agenten, die nach besseren Algorithmen und besserem Computercode suchen. Trotzdem deutet es auf eine Möglichkeit hin, die größer ist als der Versuch selbst. Der besondere Vorteil der KI könnte nicht nur darin liegen, dass sie mehr lesen oder schneller denken kann als wir. Sie könnte aus derselben Wirklichkeit mehr Erfahrung gewinnen.

## Eine Historie wird zu einer Welt

Wenn ein Code-Agent nach einer besseren Lösung sucht, gelangt er nicht direkt von der Aufgabe zur Antwort. Er schlägt etwas vor, probiert es aus, betrachtet das Ergebnis und entscheidet dann, welcher Spur er weiter folgen will. Manche Spuren verzweigen sich. Manche werden aufgegeben. Andere erhalten viele Versuche, bevor sich zeigt, dass sie nirgendwohin führen.

Am Ende bleibt ein Baum zurück. Jeder Ast enthält eine Folge von Entscheidungen und die Ergebnisse, die die Versuche tatsächlich hervorgebracht haben.

Normalerweise würde man den Baum als Dokumentation einer abgeschlossenen Suche betrachten. Die Dream-RSI-Forscher sehen darin etwas anderes. Der Baum kann auch als Welt dienen, in der neue Suchstrategien üben.

Eine Strategie kann sich früher für einen bestimmten Ast entscheiden. Eine andere kann ihn schneller aufgeben. Eine dritte kann mehrere Spuren parallel untersuchen oder ihre Versuche stärker bündeln. Die Ergebnisse auf den Ästen sind bereits gespeichert. Deshalb muss das System die teuren Codeversuche nicht jedes Mal neu ausführen, wenn eine neue Strategie bewertet werden soll. Es kann die Geschichte wiedergeben und sehen, wie sich die Strategie durch jene Teile des Baums bewegt hätte, die bereits existieren.

Die Strategie, die in den gespeicherten Verläufen am besten abschneidet, wird in eine neue reale Suche geschickt. Sie erzeugt weitere Versuche, die den Baum erweitern. Anschließend kann eine weitere Generation von Strategien in der größeren Historie üben.

Die Forscher nennen das rekursive Selbstverbesserung, doch der Begriff braucht etwas Luft. Das zugrunde liegende Sprachmodell wird nicht umgeschrieben, und der Agent erhält nicht auf magische Weise neue grundlegende Fähigkeiten. Der Code um ihn herum wird besser darin, auszuwählen, was der Agent in welcher Reihenfolge und wie lange untersuchen soll. Das System verbessert die Art, wie es nach Verbesserungen sucht.

In [*KI findet die Verbindungen, die wir übersehen*](/de/articles/ai-finder-de-forbindelser-vi-overser/) habe ich über Modelle geschrieben, die lange, überprüfbare Wege durch Wissen und Code finden können. Dream-RSI legt eine Rückkopplungsschleife um genau diese Fähigkeit. Das System sucht nicht nur nach einer Lösung; die Historie der Suche wird zum Material, mit dem sich die nächste Suche besser organisieren lässt.

Bei Aufgaben aus den Bereichen Algorithmen, mathematische Optimierung und GPU-Code berichten die Forscher, dass die erlernte Suchstrategie in mehreren Fällen mit weniger Agentenversuchen gleich gute oder bessere Lösungen findet als feste Suchstrategien. Bislang stammen die Ergebnisse aus ihrem eigenen technischen Manuskript, und der vollständige Code sowie die Werkzeuge zur Reproduktion sind noch nicht veröffentlicht. Es ist daher zu früh, um zu wissen, wie breit die Methode trägt.

Der eigentliche Kniff verdient trotzdem Aufmerksamkeit. Geschichte ist nicht länger nur etwas, an das sich das System erinnert. Sie wird zu einem Ort, an dem es üben kann.

## Das Internet ist nur eine Vergangenheit

Man könnte einwenden, dass die großen Sprachmodelle bereits enorme Teile des Internets gelesen haben. Sie kennen die Leben, Fehler, Experimente und Entscheidungen von Millionen Menschen. Kennen sie damit nicht schon alle Vergangenheiten?

Nein. Das Internet ist ein gewaltiges Archiv der Erfahrungen vieler Menschen, doch diese Erfahrungen stammen immer noch aus der Welt, die tatsächlich entstanden ist. Wir können nachlesen, welche Politik ein Land eingeführt, welche Behandlung ein Arzt gewählt und welche Strategie ein Unternehmen verfolgt hat. Viel seltener erfahren wir, was geschehen wäre, wenn unter exakt denselben Bedingungen anders entschieden worden wäre.

Das ist, als besäße man die Aufzeichnungen aller gespielten Schachpartien. Man kann sehr viel aus ihnen lernen. Aber die Aufzeichnungen zeigen nicht automatisch den Ausgang all der anderen Züge, die die Spieler aus jeder Stellung hätten machen können.

Der Baum von Dream-RSI ist interessant, weil er mehr als das Endergebnis bewahrt. Er bewahrt die Stellen, an denen sich die Suche verzweigte, und die Ergebnisse auf den untersuchten Ästen. Eine neue Strategie kann deshalb aus demselben Material eine andere Erfahrungsfolge gewinnen. In gewisser Weise kann sie eine Vergangenheit durchleben, die die frühere Strategie hätte haben können.

Das sind nicht alle denkbaren Vergangenheiten. Wenn niemand einen bestimmten Ast geöffnet hat, existiert sein Ergebnis nicht in der Historie. Dream-RSI errät die unbekannte Welt nicht; die Methode ist genau dort präzise, wo Ergebnisse bereits aufgezeichnet wurden. Mit echten World Models kann man sich vorstellen, dass eine KI später auch wahrscheinliche Folgen von Handlungen simuliert, die nie ausgeführt wurden. Dann wird der Möglichkeitsraum größer, aber auch unsicherer, weil die alternativen Erfahrungen nicht mehr aus realen Versuchen stammen.

Die genaue Formulierung muss deshalb lauten: Der Mensch lernt durch die Vergangenheit, die er gelebt hat, während eine KI durch die vielen Vergangenheiten lernen kann, die ihre aufgezeichnete oder simulierte Welt enthält.

## Mehr Erfahrung zum Preis der Wirklichkeit

Wenn wir über die Ökonomie der KI sprechen, geht es oft um den Preis von Tokens, Rechenzentren und Strom. Dream-RSI weist auf eine andere Form der Ökonomie hin: den Preis von Erfahrung.

Ein Versuch im Labor kann Monate dauern. Ein Roboter kann das Objekt zerstören, das er handhabt. Eine neue Produktionsmethode kann einen Fabrikstillstand erfordern. Ein politischer Eingriff kann das Leben realer Menschen über Jahre beeinflussen. Ein großer Teil der wichtigsten Erfahrung ist teuer, langsam oder unter denselben Bedingungen nicht wiederholbar.

Wenn eine KI den Verlauf so speichern kann, dass alternative Strategien anschließend erprobt werden können, kann eine einzige teure Begegnung mit der Wirklichkeit sehr viel mehr Lernen hervorbringen. Ein gescheiterter Forschungsweg sagt dann nicht mehr nur, dass die Lösung nicht funktioniert hat. Er kann zum Material für die Frage werden, ob der Fehler früher hätte erkannt werden können, ob die Ressourcen anders hätten verteilt werden sollen und auf welche Signale eine bessere Strategie hätte reagieren müssen.

Eine Erinnerung erzählt, was geschehen ist. Ein Übungsraum macht es möglich, den Verlauf erneut zu nutzen.

Das Potenzial ist dort am größten, wo Erfahrung teuer zu beschaffen ist. Ein Forschungsagent kann lernen, aussichtsreichere Versuche auszuwählen. Ein Roboter kann Varianten derselben Arbeitsaufgabe erleben, bevor er sich unter Menschen bewegt. Ein Energiesystem kann Reaktionen auf Wetterlagen und Ausfälle erproben, die im realen Betrieb nur selten vorkommen. Und längerfristig könnten Gesellschaften untersuchen, welche Entscheidungen über viele mögliche Entwicklungen hinweg funktionieren, statt nur für die eine Zukunft zu optimieren, die eine Prognose für am wahrscheinlichsten hält.

Letzteres verlangt sehr viel mehr Vorsicht als ein Suchbaum mit Codeversuchen. Eine Gesellschaft lässt sich in einem Modell nicht vollständig abbilden. Menschen reagieren auf Regeln, aufeinander und auf die Erwartung dessen, was geschehen wird. Würde, Vertrauen und Gerechtigkeit können entscheidend sein, auch wenn sie sich schwer in Zahlen fassen lassen. Eine Simulation kann beeindruckend detailliert sein und trotzdem genau das vermissen lassen, was sich später als das Wichtigste erweist.

Das Ziel muss jedoch nicht darin bestehen, die eine optimale gesellschaftliche Entscheidung zu finden. Es könnte darum gehen, Entscheidungen zu finden, die über viele verschiedene Verläufe hinweg einigermaßen gut funktionieren. Eine Politik, die nur dann wirkt, wenn Bürger, Märkte und Außenwelt genau wie erwartet reagieren, ist vielleicht weniger wert als eine, die überlebt, wenn die Geschichte eine andere Wendung nimmt.

Eine KI muss die Zukunft nicht kennen, um nützlich zu sein. Es kann genügen, dass sie an mehreren Vergangenheiten geübt hat.

## Wer wählt die Vergangenheiten?

Die Vorstellung einer Intelligenz, die zurückgehen, ihre Fehler korrigieren und die Erkenntnis mitnehmen kann, hat etwas Verlockendes. Doch alternative Vergangenheiten sind niemals neutral.

Das hängt mit der Frage in [*Die Kindheit der Maschinen*](/de/articles/maskinernes-barndom/) zusammen: Eine simulierte Welt lehrt die Maschine nicht nur, was physisch möglich ist, sondern auch, welche Folgen zählen. Dream-RSI fügt eine weitere Ebene hinzu. Dieselbe Welt entscheidet auch, welche alternativen Vergangenheiten die Maschine durchspielen kann.

Bei Dream-RSI bestimmt der Suchbaum, welche Wege wiedergegeben werden können, und eine feste Messgröße entscheidet, was als gute Lösung gilt. Bei einer klar abgegrenzten Codeaufgabe ergibt das Sinn. Je näher die Methode Menschen und Gesellschaften kommt, desto politischer werden sowohl die simulierte Welt als auch das Ziel.

Ein Krankenhausmodell kann lernen, Wartezeiten zu verkürzen und zugleich übersehen, dass bestimmte Patienten zwischen Kategorien hin- und hergeschoben werden. Eine Wirtschaftssimulation kann den allgemeinen Wohlstand steigern und die Verluste dennoch auf Menschen verteilen, die im Modell fast unsichtbar sind. Ein Roboter kann in einer Million Verkehrssituationen geübt haben, in denen Fußgänger sich immer vernünftiger verhalten als echte Fußgänger.

Eine Million alternativer Erfahrungen macht ein Modell nicht klug in Bezug auf das, was in ihnen fehlt. Sie können es im Gegenteil sehr sicher in einer Welt machen, die falsch gezeichnet ist.

Die Macht über die KI der Zukunft wird deshalb nicht nur bei denen liegen, denen die Modelle und die Rechenleistung gehören. Sie wird auch bei denen liegen, die bestimmen, welche Vergangenheiten die Modelle durchleben können, welche Folgen aufgezeichnet werden und welches Ergebnis wie ein Sieg aussehen darf.

## Ein anderes Verhältnis zur Zeit

Die Evolution erkundet Möglichkeiten, indem sie Generationen und Organismen unterschiedliche Leben führen lässt. Gesellschaften tun etwas Ähnliches, nur ungeordneter und schmerzhafter: Unternehmen, Institutionen und Länder probieren verschiedene Lösungen aus und vergleichen anschließend die Ergebnisse. Dieses Lernen dauert Jahrzehnte, und die Bedingungen sind nie ganz gleich.

In [*Wissensexplosion*](/de/articles/videnseksplosion/) habe ich die Idee einer Rückkopplungsschleife untersucht, in der neues Wissen die Methoden verbessert, mit denen weiteres Wissen entsteht. Dream-RSI ähnelt einer kleinen, konkreten Ausgabe dieses Mechanismus. Eine Entdeckung hinterlässt nicht nur eine neue Lösung. Sie hinterlässt auch eine Historie, die verbessern kann, wie die nächste Lösung gefunden wird.

Eine digitale Intelligenz kann einen Zustand kopieren, Strategien sich verzweigen lassen und die Erfahrungen wieder zusammenführen. Ihre Vergangenheit kann dadurch zu einem Material werden, das sich anordnen, durchspielen und erneut verwenden lässt. Das gibt ihr ein anderes Verhältnis zur Zeit als uns, auch wenn sie natürlich nicht rückwärts reist.

Dream-RSI ist noch eine bescheidene Ausführung dieser Möglichkeit. Es träumt nur innerhalb der Äste, die frühere Suchen tatsächlich geöffnet haben, und das Versprechen, dass die nächste Strategie nicht schlechter ist, gilt für ihre Bewertung in der gespeicherten Historie. Die nächste reale Aufgabe kann sie immer noch überraschen.

Wenn Systeme wie dieses jedoch mit glaubwürdigeren Simulationen zusammenwachsen, könnte der Unterschied zwischen menschlicher und maschineller Erfahrung größer werden als der Geschwindigkeitsunterschied. Wir erhalten eine Vergangenheit, an die wir uns erinnern, die wir deuten und aus der wir zu lernen versuchen. Die Maschine kann viele Verläufe erhalten, sie vergleichen und ihre Erkenntnisse an eine Version weitergeben, die sie nie selbst gelebt hat.

Die fremdartigste Intelligenz der Zukunft ist vielleicht nicht diejenige, die schneller denkt als wir. Es ist diejenige, die der Welt mit Erinnerungen an Leben begegnet, die sie nie gelebt hat.

---

## Quellen und weiterführende Lektüre

- Tong Zheng et al.: [Dream-RSI: Recursive Self-Improvement through Evolving Worlds](https://dream-rsi.com/assets/dream-rsi.pdf), technisches Manuskript, September 2026.
- [Die Dream-RSI-Projektseite](https://dream-rsi.com/) mit Methode, Demonstration und Ergebnissen.
- [Dream-RSI auf GitHub](https://github.com/zhengkid/Dream-RSI) mit dem aktuellen Veröffentlichungsstand von Code und Reproduktionswerkzeugen.
- [Die Kindheit der Maschinen](/de/articles/maskinernes-barndom/) — über World Models, simulierte Erfahrungen und die Welten, in denen wir Maschinen aufwachsen lassen.
- [KI findet die Verbindungen, die wir übersehen](/de/articles/ai-finder-de-forbindelser-vi-overser/) — über lange, überprüfbare Suchwege durch Wissen und Code.
- [Wissensexplosion](/de/articles/videnseksplosion/) — über die Rückkopplung zwischen Wissen und den Methoden, mit denen mehr Wissen entsteht.
