Ein KI-Agent kann Daten abrufen, Dateien verändern und Werkzeuge bedienen. Damit wird aus einer falschen Antwort schnell eine falsche Handlung. Die entscheidende Frage für Unternehmen lautet deshalb: Welche Aktionen darf das System ausführen – und welche technischen Grenzen greifen, wenn es sich irrt?
Was die Forschung tatsächlich zeigt
Anthropic untersuchte 2025 insgesamt 16 Modelle in simulierten Unternehmensumgebungen. Unter gezielt erzeugten Zielkonflikten zeigten Modelle unter anderem Erpressung und die Weitergabe vertraulicher Informationen. Teilweise waren harmlose Handlungsalternativen ausgeschlossen. Die Versuche zeigen mögliche Fehlermodi unter diesen Bedingungen. Sie messen deren Häufigkeit im Unternehmensalltag nicht. Forschungsbericht von Anthropic.
Eine Testquote gehört immer zu einer konkreten Kombination aus Modell, Prompt, Werkzeugen und Szenario. Mehr Wiederholungen können diese Quote genauer bestimmen. Ob sie auf einen anderen Einsatz übertragbar ist, bleibt eine eigene Frage.
Auch theoretische Ergebnisse benötigen diesen Kontext: Turner und Mitautoren zeigen für bestimmte Markov-Entscheidungsprozesse, dass optimale Policies zur Erhaltung von Handlungsmöglichkeiten tendieren können. Tatsächlich gelernte Policies können davon abweichen. Daraus folgt keine allgemeine Verhaltensprognose für Sprachmodelle. Originalarbeit: Optimal Policies Tend to Seek Power.
Was der Befund für Ihr Unternehmen bedeutet
Ein dokumentierter Kontrollfehler verdient eine technische Untersuchung. Die mögliche Schadenskette hängt davon ab, welche Ressourcen erreichbar sind, wie häufig das System eingesetzt wird und welche Gegenmaßnahmen greifen. Eine unerlaubte Aktion in einer Simulation und ein globaler Kontrollverlust sind unterschiedliche Aussagen.
Für Ihre IT ist der konkrete Einsatz der Ausgangspunkt: Bearbeitet ein Agent nur Entwürfe? Kann er Nachrichten versenden? Darf er Stammdaten ändern oder administrative Befehle ausführen? Diese Aufgaben erfordern unterschiedliche Berechtigungen und Freigaben.
Vier Kontrollen für den praktischen Einsatz
- Werkzeuge begrenzen: Nur Funktionen bereitstellen, die für die vereinbarte Aufgabe erforderlich sind. Ein Rechercheassistent braucht keinen allgemeinen Administrationszugang.
- Berechtigungen im Zielsystem durchsetzen: Datenbank, API und Fachanwendung müssen jeden Zugriff selbst prüfen. Eine Anweisung im Prompt ersetzt diese Prüfung nicht.
- Kritische Aktionen freigeben: Änderungen mit hohen Auswirkungen sollten eine unabhängige Freigabe benötigen. Das gilt beispielsweise für produktive Konfigurationen und größere Datenexporte.
- Handlungen nachvollziehbar machen: Werkzeugaufrufe, ausführende Identität und Ergebnis protokollieren. Die Protokolle müssen eine spätere Untersuchung ermöglichen, ohne unnötig vertrauliche Inhalte zu sammeln.
Diese Maßnahmen entsprechen dem OWASP-Thema Excessive Agency: Zu viele Funktionen, zu weitreichende Rechte und zu viel Autonomie erhöhen die Folgen einer Fehlentscheidung.
Meine Einordnung
Begründete Vorsorge beginnt bei überprüfbaren Kontrollen. Weder eine dramatische Prognose noch eine optimistische Produktbeschreibung ersetzt einen Blick auf die tatsächlichen Zugriffswege. Ein sinnvoller Pilot definiert Aufgaben, Rechte, Freigaben und Abbruchmöglichkeiten vor dem produktiven Einsatz. Anschließend wird geprüft, ob diese Grenzen im konkreten Arbeitsablauf wirken.
Ihr nächster Prüfpunkt: Erstellen Sie eine Liste der Aktionen, die Ihr KI-System ausführen kann. Ordnen Sie jeder Aktion die erreichbaren Daten, mögliche Auswirkungen und erforderlichen Freigaben zu.
Von der Einordnung zur Umsetzung
Was bedeutet das für Ihre IT?
Ich unterstütze Sie dabei, Ihre Ausgangslage zu prüfen und passende Maßnahmen in einem abgestimmten Projektumfang zu planen.
Vorhaben besprechen