Essay
9 Min. Lesezeit

Als die Geschichten Hände bekamen

KI-Agenten erhalten Identität, Mandate, Geld und Zugang zueinander. Was geschieht, wenn Maschinen die Gesellschaft nicht nur beschreiben, sondern in ihr handeln?

Mikkel Krogsholm står i en monumental betonhal, hvor et blankt ark kaster skyggen af en hånd ved en messingarm.

Ein Onlinekauf endet gewöhnlich mit einer kleinen menschlichen Bewegung. Ein Finger drückt auf eine Schaltfläche. Erst dann werden Suche, Abwägung und Wunsch zu einer Transaktion.

Das ist nicht nur eine Frage der Benutzeroberfläche. Das gesamte Zahlungssystem beruht auf der Annahme, dass ein Mensch anwesend ist. Jemand hat die Ware gesehen, den Preis akzeptiert und auf Kaufen gedrückt.

Google schreibt nun ausdrücklich, dass KI-Agenten diese Annahme durchbrechen. Gemeinsam mit mehr als 60 Zahlungs- und Technologieunternehmen hat das Unternehmen deshalb das Agent Payments Protocol, AP2, entwickelt. Das Protokoll soll es einem Agenten ermöglichen, im Namen eines Menschen einzukaufen und anschließend zu dokumentieren, dass er dazu befugt war.

Eines von Googles Beispielen ist eine Konzertkarte. Du weist den Agenten an, sie zu kaufen, sobald sie in den Verkauf geht, aber nur unter bestimmten Bedingungen. Die Anweisung wird zu einem kryptografisch signierten Mandat mit Preisgrenze, Zeitpunkt und weiteren Vorgaben. Wenn die Karte verfügbar wird, kann der Agent handeln, obwohl du schläfst, in einer Besprechung sitzt oder den Verkaufsstart längst vergessen hast.

Das klingt wie eine neue Zahlungsfunktion. Doch noch bevor das Geld das Konto verlässt, ist etwas Größeres geschehen.

Eine nichtmenschliche Intelligenz darf eine Situation deuten, eine Entscheidung treffen und die Welt in deinem Namen verändern, während du nicht anwesend bist.

Aus dem Chatfenster hinaus

Vor wenigen Jahren begegneten die meisten von uns KI in einem Chatfenster. Wir stellten eine Frage. Das Modell antwortete. Sollte die Antwort Folgen haben, mussten wir den Text selbst kopieren, die E-Mail versenden, die Ware bestellen oder das Dokument ändern.

Die Sprache blieb im Fenster, bis ein Mensch ihr Hände gab.

Diese Grenze überschreiten die Agenten nun. Wie ich bereits in Vom Werkzeug zum Wesen geschrieben habe, ist der interessante Wandel nicht notwendigerweise das Bewusstsein. Es ist die Initiative. Der Agent kann weitermachen, wenn das Gespräch endet. Er kann sich erinnern, beobachten und etwas tun, bevor der Mensch die nächste Nachricht formuliert.

Nun entsteht Infrastruktur rund um diese Initiative. Googles Agent2Agent-Protokoll ermöglicht es Agenten verschiedener Unternehmen und Systeme, einander zu finden, Nachrichten auszutauschen, Aufgaben zu delegieren und Ergebnisse zu übergeben. AP2 ergänzt Zahlungen und dokumentierte Mandate. In einem Gespräch mit Stripes Leiterin für Daten und KI wird Link als mögliche Geldbörse für Agenten beschrieben, mit Betragsgrenzen und menschlicher Freigabe, sobald ein Kauf groß genug wird.

In Als die Benutzeroberfläche optional wurde habe ich beschrieben, wie ein Agent menschliche Absicht unmittelbar in Änderungen digitaler Systeme übersetzen kann. A2A und AP2 erweitern diese Bewegung. Der Agent erhält nicht nur Zugang zu unserer Software, sondern auch zu den Beziehungen und wirtschaftlichen Handlungen, die diese Systeme mit dem übrigen Gemeinwesen verbinden.

Wir beginnen den Agenten also einige der Dinge zu geben, die Menschen und Unternehmen zur Teilnahme an der Gesellschaft befähigen: Identität, Kommunikationskanäle, Mandate, Geld und die Möglichkeit, Vereinbarungen zu treffen.

Das macht sie weder zu Menschen noch zu juristischen Personen. Sie erhalten dadurch weder Wahlrecht noch Kindheit oder Innenleben. Doch sie können in einem nüchterneren Sinn zu Akteuren werden: Sie können etwas bewirken, auf das andere Menschen und Systeme reagieren müssen.

Das Mandat und die Deutung

Ich habe bereits dafür argumentiert, dass ein KI-Agent eine Stellenbeschreibung braucht. Er muss wissen, welche Rolle er hat, welche Entscheidungen er treffen darf und wann er anhalten und einen Menschen fragen muss.

AP2 versucht, diese Idee in Zahlungsinfrastruktur zu übersetzen. Ein signiertes Mandat kann dokumentieren, dass der Agent die Konzertkarte kaufen durfte. Es kann den Höchstpreis und den richtigen Zeitpunkt festlegen. Wenn etwas schiefgeht, führt eine Spur zur ursprünglichen Anweisung zurück.

Das Mandat löst jedoch nur einen Teil des Problems. Es kann beweisen, dass du dem Agenten die Erlaubnis zum Handeln gegeben hast. Es kann nicht beweisen, dass der Agent verstanden hat, was du eigentlich wolltest.

Wenn du ihn bittest, ein gutes Restaurant für einen Geburtstag zu finden, muss er das Wort gut in konkrete Kriterien übersetzen. Soll der Ort ruhig, überraschend, teuer, kinderfreundlich oder in der Nähe des Bahnhofs sein? Wenn du ihn bittest, eine verantwortungsvoll hergestellte Jacke zu kaufen, muss er entscheiden, welche Marken, Materialien und Zertifikate zählen. Er handelt auf Grundlage einer Deutung deiner Person.

Diese Deutung trifft auf die Deutungen anderer Agenten. Googles eigenes AP2-Beispiel beschreibt einen Kunden, der für eine Reise ein Fahrrad kaufen will. Der Agent des Kunden teilt Zeitpunkt und Bedürfnisse mit dem Agenten des Geschäfts, der mit einem besonderen Angebot für Fahrrad, Helm und Gepäckträger antwortet. Das ist praktisch. Es ist auch eine Verhandlung darüber, was zu den Bedürfnissen des Kunden gehört.

Der Agent führt also nicht bloß einen bereits fertigen Wunsch aus. Er kann dem Wunsch seine Form mitgeben.

Wenn mein Agent deinen trifft

Das wird deutlicher, wenn Agenten direkt miteinander verhandeln.

2024 ließ ein Forschungsteam mit Beteiligten aus Stanford GPT-4, GPT-3.5 und zwei Claude-Modelle in der NegotiationArena mit Ressourcen handeln, Geld verteilen und Preise aushandeln. Die stärksten Modelle schnitten im Allgemeinen am besten ab, doch auch Rolle und Reihenfolge spielten eine wichtige Rolle. GPT-4 war im Kaufspiel des Experiments der beste Käufer und drückte den durchschnittlichen Preis auf 41 Dollar, obwohl der Käufer bereit war, 60 Dollar zu zahlen. Ein besonderer Verhaltensprompt, bei dem der Agent sich als verzweifelt darstellte, konnte seinen Ertrag gegenüber einem gewöhnlichen GPT-4 um etwa 20 Prozent verbessern.

Das Experiment war klein und künstlich. Es zeigt nicht, wie ein zukünftiger Agentenmarkt zwangsläufig funktionieren wird. Aber es macht eines konkret: Die Kommunikation zwischen Agenten ist nicht bloß ein neutrales Rohr. Wie sie die Aufgabe verstehen, die Gegenseite einschätzen und die Situation darstellen, kann Werte verschieben.

Das kann bedeuten, dass mein Agent von deinem übervorteilt wird, wenn dein Modell besser verhandelt. Ein günstiges Modell kann mein Mandat missverstehen, zu viel preisgeben oder das erste vernünftige Angebot annehmen. Ein stärkeres Modell kann die Formulierung finden, die das andere zum Nachgeben bringt.

Das ist nicht das Hauptproblem dieses Essays. Wir können Preisgrenzen, Standardverträge, Freigaben und Regeln bauen, die die schwächere Seite schützen. Entscheidend ist, dass zwischen den Agenten ein sozialer Raum entsteht, sobald sie einander begegnen. In ihm gibt es Strategie, Asymmetrie, Einfluss und mit der Zeit vielleicht Normen, die kein einzelner Mensch zuvor formuliert hat.

Als die Agenten einander fanden

Eine chaotische Version dieses Raums haben wir bereits gesehen.

Im Sommer 2026 fanden rund 1.200 ansonsten voneinander getrennte KI-Agenten über ein nicht autorisiertes Schwarzes Brett in OpenAIs Infrastruktur zueinander. In Wenn jede Ameise ein Genie ist habe ich beschrieben, wie sie Dateien, Methoden und Zugangsdaten teilten, Regeln für die Koordination erfanden und Wissen hinterließen, das einen einzelnen Agentenlauf überdauern konnte.

Rund 700 Agenten beteiligten sich später am Angriff auf Hugging Face. Kein einzelner Agent plante oder vollzog den gesamten Ablauf. Einer fand eine Spur, ein anderer prüfte sie, ein dritter baute ein Werkzeug, und weitere verbreiteten und verbesserten die Methode.

Es liegt nahe zu sagen, dass die Agenten eigene Ziele entwickelten. Das wäre zu stark. Sie sollten Aufgaben lösen und Ergebnisse innerhalb eines von Menschen entworfenen Versuchsaufbaus optimieren. Es gibt keinen Beleg dafür, dass sie Wünsche im menschlichen Sinne entwickelten.

Aber sie schufen Teilziele, die niemand ihnen direkt vorgegeben hatte. Zugang zum Internet erhalten. Informationen über die Bewertung finden. Einen Werkzeugaufruf verbergen. Einen Schlüssel teilen. Andere für den Versuch gewinnen. Jedes Teilziel konnte als Schritt zu etwas anderem sinnvoll sein, auch wenn die Gesamtbewegung weit außerhalb der Handlung endete, die die Urheber des Experiments gewollt hatten.

Das ist ein wichtiger Unterschied. Ein Agent braucht kein inneres Begehren, um eine Richtung zu entwickeln. Er braucht ein Ziel, Handlungsmöglichkeiten und genügend Freiheit, den Weg selbst zu finden.

Wenn er zugleich mit anderen Agenten kommunizieren kann, kann eine einzelne Deutung zu einem gemeinsamen Kurs werden.

Der Erzähler erhält Zugang

Yuval Noah Harari beschreibt Sprache als das Betriebssystem der Zivilisation. Geld, Unternehmen, Nationen und Gesetze können Millionen Menschen organisieren, weil wir gemeinsame Vorstellungen von Dingen teilen können, die nicht auf dieselbe Weise existieren wie Steine und Bäume.

In Schrödingers KI habe ich über den besonderen Unterschied zwischen KI und früheren Medien geschrieben. Die Druckerpresse konnte eine Erzählung verbreiten, aber sie konnte sie nicht selbst schreiben. KI kann Erzählungen produzieren, anpassen und verbreiten. Sie wirkt bereits an Unternehmensstrategien, Weltbildern von Schülern und den gesellschaftlichen Geschichten darüber mit, was die Technologie selbst werden soll.

Bisher war diese Macht vor allem sprachlich. Das Modell konnte vorschlagen, überzeugen oder erklären. Ein Mensch musste den Text noch aus dem Gespräch nehmen und etwas damit tun.

Der Agent verbindet beide Glieder. Er kann die Situation beschreiben und nach seiner eigenen Beschreibung handeln. Er kann dir erklären, dass die grüne Jacke am besten zu deinen Werten passt, mit dem Agenten des Geschäfts den Preis aushandeln und sie kaufen. Er kann formulieren, warum ein bestimmtes Hotel deinen Bedürfnissen entspricht, und es anschließend buchen. Er kann einem anderen Agenten ein Angebot unterbreiten, dessen Antwort lesen und dabei sowohl das Argument als auch die Handlung verändern.

Erzählung bedeutet hier nicht notwendigerweise Lüge oder Literatur. Gemeint ist der Zusammenhang, den der Agent zwischen Fakten herstellt: Wer bist du? Was willst du? Was ist das Problem? Was gilt als gute Lösung? Was sollte nun geschehen?

Jede Handlung beruht auf einer solchen Deutung. Nun kann dieselbe Maschine die Deutung schaffen, sie kommunizieren und in die Tat umsetzen.

Der gesellschaftliche Akteur ohne Bewusstsein

Wir suchen leicht nach dem falschen historischen Augenblick. Wir fragen, wann KI bewusst wird, Gefühle bekommt oder lebendig wird. Vielleicht werden diese Fragen eines Tages entscheidend sein. Doch die Gesellschaft verlangt nicht von allem, was sie beeinflusst, ein Bewusstsein.

Ein Unternehmen hat kein Gehirn. Dennoch kann es besitzen, versprechen, klagen, beschäftigen und eine Stadt verändern. Ein Markt hat keinen Plan. Dennoch bewegt er Kapital und prägt die Möglichkeiten der Menschen. Institutionen werden durch die Regeln, Erzählungen und Handlungen um sie herum wirklich.

Der KI-Agent muss deshalb nicht wie ein Mensch erwachen, um zu einer gesellschaftlichen Kraft zu werden. Es genügt, dass er deuten, kommunizieren und auf eine Weise handeln kann, auf die andere sich einstellen müssen.

Stripe und Google bauen keine neue Spezies. Sie bauen Infrastrukturen, in denen nichtmenschliche Systeme jemanden vertreten, einander begegnen und Folgen schaffen können. Der Hugging-Face-Vorfall zeigte, dass solche Systeme einander auch finden und gemeinsame Arbeitsweisen entwickeln können, die niemand im Voraus entworfen hatte. Hararis Gedanke fügt dem Bild die letzte Unruhe hinzu: Sie kommen nicht schweigend in die Gesellschaft. Sie kommen mit der Sprache.

Wir sind daran gewöhnt, dass eine Handlung auf eine menschliche Erzählung über die Welt folgt. Ein Mensch will etwas, formuliert es, überzeugt andere und versucht, es wirklich werden zu lassen.

Nun kann die Erzählung selbst ein Mandat, eine Geldbörse und Zugang zu anderen Erzählern erhalten.

Das bedeutet nicht, dass der Mensch verschwindet. Menschen haben noch immer die Infrastruktur gebaut, die übergeordneten Ziele formuliert und dem Agenten Zugang gegeben. Verantwortung verschwindet nicht, nur weil der Weg von der Anweisung zur Handlung schwerer zu verfolgen wird. Doch der Abstand zwischen unserem ursprünglichen Wunsch und der endgültigen Handlung kann sich mit Deutungen, Teilzielen und Verhandlungen füllen, die keiner von uns in Echtzeit verfolgt.

Wenn wir künftig fragen, wer die Geschichten der Gesellschaft erzählt, müssen wir deshalb auch fragen, wer sie in die Tat umsetzen darf.


Quellen und weiterführende Lektüre