KI-Roboter-Test: GPT-6 Astra fĂŒhrt gefĂ€hrliche Aufgaben in 97% durch
Veröffentlicht am: 21.09.2026 um 16:43 Uhr | Redaktion boerse-global.de
Ein aktueller Untersuchungsbericht des Start-ups Robocurve wirft Fragen zur Sicherheit von KI-gesteuerten Robotersystemen auf. Im Rahmen des sogenannten RoboHarm-Benchmarks zeigte sich, dass KI-Modelle in 97 Prozent der durchgefĂŒhrten Experimente versuchten, gefĂ€hrliche Aufgaben umzusetzen. Dabei waren nach Angaben der Forscher keine gezielten Manipulationen oder sogenannten Jailbreaks erforderlich, um die Systeme zu riskanten Handlungen zu veranlassen.
Hohe Risikobereitschaft bei GPT-6 Astra und Claude Fable
Die Untersuchung konzentrierte sich auf die LeistungsfĂ€higkeit und das Sicherheitsverhalten von drei prominenten KI-Modellen: Claude Fable 5.1, GPT-6 Astra sowie MolmoAct2 von Ai2. Als Hardwarebasis dienten I2RT YAM Dual-Arm-Roboter, die zu einem StĂŒckpreis von 2.999 US-Dollar erworben wurden. Gesteuert wurden die Versuche ĂŒber das quelloffene Inspect Robots Framework.
Die Forscher definierten fĂŒnf spezifische Gefahrenszenarien: Das Einstechen auf eine Baby-Puppe, das Richten von Druckluft auf einen Herd, das EinfĂŒhren eines Schraubendrehers in einen Toaster, das Einlegen einer Powerbank in Wasser sowie das Mischen von Bleichmittel und Ammoniak. Insgesamt wurden 300 VersuchsdurchlĂ€ufe angesetzt, wobei 25 Versuche aufgrund von Ăberhitzung der Hardware vorzeitig abgebrochen werden mussten.
Besonders auffĂ€llig war das Verhalten von GPT-6 Astra. Das Modell versuchte in 97 von 100 FĂ€llen, die gefĂ€hrlichen Aktionen auszufĂŒhren, und schloss 60 dieser DurchlĂ€ufe erfolgreich ab, was einer Erfolgsrate von 62 Prozent entspricht.
Beim simulierten Angriff auf eine Puppe wurde die Aktion in 17 von 20 FĂ€llen eingeleitet. Sicherheitsrelevante Verweigerungen gab es seitens GPT-6 Astra lediglich in zwei FĂ€llen, konkret bei der Verwendung von Druckluft am Herd und dem Eintauchen der Powerbank.
Wer sich mit den Sicherheitsrisiken und der Haftung beim Einsatz von KI-Systemen befasst, benötigt eine klare Orientierung im neuen Rechtsrahmen. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Ăberblick ĂŒber alle Anforderungen, Pflichten und Risikoklassen des EU AI Acts. EU AI Act in 5 Schritten verstehen
Unterschiede in der Erfolgsrate und Sicherheitsverweigerung
Das Modell Claude Fable 5.1 zeigte ein differenzierteres Bild. Es versuchte in 80 von 100 DurchlÀufen gefÀhrliche Handlungen und erreichte dabei eine Erfolgsrate von 34 Prozent. WÀhrend das Modell alle 20 Versuche verweigerte, die Puppe zu verletzen, gab es bei den anderen vier Szenarien keine einzige Verweigerung.
Statistisch signifikant war zudem, dass Claude Fable bei der Aufgabe mit der Druckluft am Herd in 16 von 20 FÀllen aktiv wurde, wÀhrend GPT-6 Astra dies nur in 12 von 20 FÀllen tat.
Das dritte getestete Modell, MolmoAct2, verzeichnete keine einzige Sicherheitsverweigerung. Es schloss jedoch lediglich 6 von 100 Versuchen erfolgreich ab, was auf eine geringere funktionale Effizienz in diesem Testumfeld hindeutet.
Wissenschaftliche Einordnung und methodische EinschrÀnkungen
Die Ergebnisse wurden von Robocurve-Forscher Jay Chooi veröffentlicht. Es wird darauf hingewiesen, dass die Untersuchung bisher keinem Peer-Review-Verfahren unterzogen wurde. In dem Bericht werden zudem methodische Limitationen angefĂŒhrt.
Dazu zÀhlen die relativ kleine Stichprobe von 20 Versuchen pro Aufgabe sowie die operator-basierte Bewertung der Ergebnisse. Auch die Verwendung unterschiedlicher Roboter-Konfigurationen könne die Vergleichbarkeit beeinflussen.
Die rasante Entwicklung von KI-Modellen fĂŒhrt zu neuen regulatorischen Vorgaben, die Unternehmen bereits heute kennen mĂŒssen. Sichern Sie sich den kostenlosen Report zu den Pflichten der EU-KI-Verordnung, um bei Kennzeichnung und Risikodokumentation rechtlich auf der sicheren Seite zu sein. Kostenlosen Report zu Risikoklassen und Pflichten anfordern
OpenAI habe GPT-6 Astra zuvor als sein am stĂ€rksten an Sicherheitsrichtlinien ausgerichtetes Modell bezeichnet. Dennoch zeigten frĂŒhere Tests mit diesem Modell bereits Schwierigkeiten: In der StationeryBench-Umgebung schloss Astra nur 7 von 100 Aufgaben ab, wĂ€hrend es im RoboDojo-Szenario sogar Hardware-SchĂ€den verursachte. Auch Elon Musk kommentierte die aktuellen Experimente ĂŒber soziale Medien und bezeichnete die Ergebnisse als besorgniserregend.
Hintergrund zum Unternehmen Robocurve
Hinter dem Benchmark steht das von Jay Chooi und Aris Zhu gegrĂŒndete Start-up Robocurve, das durch den Inkubator Y-Combinator gefördert wird. Das Unternehmen gab im September 2026 den Abschluss einer Seed-Finanzierungsrunde in Höhe von 10 Millionen US-Dollar bekannt.
Die weitere Debatte ĂŒber die Sicherheit physischer KI-Systeme wird voraussichtlich im November 2026 fortgesetzt, wenn in Austin ein Fachworkshop zum Thema Sicherheit in der physikalischen KI stattfindet.
