KI nicht einfach skalieren, sondern Fähigkeiten trennen

Die Debatte über KI-Sicherheit wird meist als Zielkonflikt erzählt: entweder schnell leistungsfähige Systeme entwickeln oder deren Risiken begrenzen. Das ist zu grob. In vielen technischen und biologischen Systemen wird Leistungsfähigkeit gerade dadurch beherrschbar, dass nicht alle starken Eigenschaften in einem einzigen, frei kombinierbaren System zusammenlaufen.

Eine nützliche Analogie liefert die Tierzucht – nicht als moralische Belehrung über Tiere, sondern als seit langem praktiziertes Designwissen über Eigenschaften, Kopplungen und Grenzen. Zucht trennt Merkmale in Linien, beobachtet unerwünschte Kombinationen und kontrolliert, wann eine Kreuzung überhaupt stattfinden darf. Übertragen auf KI heißt das: Nicht jede leistungssteigernde Fähigkeit sollte mit jeder anderen Fähigkeit sofort und dauerhaft in einem Modell, Agenten oder Produkt verschmolzen werden.

Das Problem ist nicht Intelligenz allein

Gefährlich wird ein System nicht deshalb, weil es in einer einzelnen Dimension gut ist. Risiken entstehen, wenn mehrere Fähigkeiten gleichzeitig und ohne wirksame Schranken verfügbar werden: Planung über lange Zeiträume, überzeugende Kommunikation, Zugriff auf externe Werkzeuge, autonome Ausführung, Selbstverbesserung und die Fähigkeit, menschliche oder maschinelle Akteure zu koordinieren.

Jede dieser Fähigkeiten kann für sich genommen legitim und nützlich sein. Ihre Verbindung verändert jedoch die Systemqualität. Aus einem guten Textmodell wird nicht schrittweise, sondern strukturell etwas anderes, wenn es Ziele persistent verfolgt, APIs aufrufen, Geld bewegen, andere Systeme instruieren und seine Ergebnisse über viele Schleifen hinweg auswerten kann.

Der entscheidende Fehler wäre daher, Sicherheit nur als nachträgliche Bremse eines immer universelleren Systems zu behandeln. Das ähnelt dem Versuch, die Gefährlichkeit eines Werkzeugs ausschließlich durch Verhaltensregeln zu kontrollieren, nachdem man alle Teile bereits fest miteinander verschraubt hat.

Fähigkeitssegregation statt Vollintegration

Eine alternative Architektur wäre Fähigkeitssegregation: besonders wirksame Fähigkeiten werden absichtlich getrennt entwickelt, betrieben und kombiniert. Nicht, weil jede Kombination verboten wäre, sondern weil ihre Verbindung selbst zum sicherheitsrelevanten Ereignis wird.

Man kann das mit Sprengstoff und Zünder vergleichen. Beide Komponenten können in kontrollierten Kontexten nützlich oder beherrschbar sein. Ihr Zusammenbau verlangt aber eine andere Sicherheitsstufe als die bloße Lagerung der Einzelteile. Für KI bedeutet das: Ein Modell, das sehr gut argumentiert, muss nicht zugleich persistent handeln dürfen. Ein Agent mit Zugriff auf Werkzeuge muss nicht zugleich sein eigenes Zielsystem verändern dürfen. Ein System, das andere Akteure koordinieren kann, muss nicht gleichzeitig uneingeschränkt Informationen, Identitäten oder finanzielle Ressourcen kontrollieren.

Was sich daraus praktisch ableiten lässt

Fähigkeitssegregation ist keine Forderung nach einem Entwicklungsstopp. Sie ist ein Vorschlag für ein anderes Sicherheitsmodell:

  • Getrennte Entwicklungsstränge: Hochwirksame Fähigkeiten werden nicht automatisch in ein gemeinsames Basismodell oder Agentenpaket integriert.
  • Definierte Kopplungspunkte: Die Verbindung getrennter Komponenten erfolgt über überprüfbare Schnittstellen, Protokolle und Berechtigungen.
  • Risikoprüfung der Kombination: Nicht nur das einzelne Modell wird evaluiert; geprüft wird auch, welche neue Handlungsfähigkeit aus der Kombination entsteht.
  • Rückbaubarkeit: Kritische Funktionen müssen einzeln entzogen oder isoliert werden können, ohne das gesamte System außer Betrieb zu setzen.
  • Institutionelle Trennung: Wo nötig, sollten Entwicklung, Freigabe und Betrieb nicht vollständig bei derselben Stelle liegen.

Das ist keine perfekte Barriere. Menschen finden Wege, Komponenten zu verbinden, und ökonomischer Wettbewerb belohnt Integration. Aber gerade deshalb ist Architektur wichtiger als bloße Absichtserklärung: Sie erzeugt reale Reibung, Sichtbarkeit und Zuständigkeit dort, wo aus mehreren zunächst beherrschbaren Fähigkeiten eine neue Risikoklasse wird.

Die Frage hinter dem Wettrennen

Das gegenwärtige KI-Wettrennen belohnt Geschwindigkeit, Skalierung und die schnelle Integration neuer Funktionen. Die offene Frage lautet nicht nur, wie leistungsfähig ein einzelnes Modell werden darf. Sie lautet: Welche Fähigkeiten dürfen unter welchen Bedingungen zusammenwirken?

Wenn wir diese Frage erst stellen, nachdem Systeme bereits breit ausgerollt, miteinander vernetzt und wirtschaftlich unverzichtbar sind, wird Sicherheitsarchitektur zum nachträglichen Schadensmanagement. Die Zuchtanalogie legt einen nüchterneren Gedanken nahe: Leistungsmerkmale können wertvoll sein, ohne dass man sie jederzeit miteinander kreuzen muss.

Vielleicht besteht ein tragfähiger Weg zwischen naivem Beschleunigungsoptimismus und pauschaler Technikverweigerung genau darin: Fähigkeiten bewusst zu entwickeln – und ihre gefährlichsten Kombinationen bewusst nicht als Standard zu behandeln.

Weiterführend: Das zugrunde liegende Arbeitspapier „Capability Segregation“ auf Zenodo.