MentalHealthBench, OpenAI

MentalHealthBench: OpenAI prĂŒft KI-Antworten mit 1.215 GesprĂ€chen

Veröffentlicht am: 24.09.2026 um 11:32 Uhr | Redaktion boerse-global.de

Der offene Datensatz vergleicht KI-Antworten in psychischen GesundheitsgesprÀchen; GPT-6 Astra erzielt insgesamt 57,3 Prozent.

OpenAI veröffentlicht MentalHealthBench fĂŒr KI-Tests zur mentalen Gesundheit
Ein minimalistischer, ruhiger Raum mit natĂŒrlichem Licht, das sanfte Schatten auf eine schlichte HolztischoberflĂ€che wirft. Illustration mit AI erstellt.

In einem Bericht vom 23. September 2026 hat OpenAI die EinfĂŒhrung von MentalHealthBench bekannt gegeben. Dabei handelt es sich um einen offenen Benchmark, der speziell dafĂŒr entwickelt wurde, die Antworten von KĂŒnstlicher Intelligenz in realistischen GesprĂ€chen ĂŒber mentale Gesundheit zu bewerten.

Das System entstand in Zusammenarbeit mit ĂŒber 80 lizenzierten Experten aus 22 LĂ€ndern, die 19 Sprachen und rund 20 medizinische SubspezialitĂ€ten reprĂ€sentieren.

Methodik und Aufbau des Datensatzes

Der Benchmark umfasst laut Unternehmensangaben 1.215 synthetisch erzeugte GesprĂ€che zur mentalen Gesundheit sowie 5.262 von Experten erstellte Bewertungskriterien. Die PrĂŒfung der Konversationen erfolgte in einem dreistufigen Prozess, an dem pro Dialog mindestens drei Fachleute beteiligt waren.

Ein Kriterium wurde nur dann in das System aufgenommen, wenn zwei Experten zustimmten und der dritte keinen Widerspruch einlegte. Die Gewichtung der Kriterien reicht dabei von -10 bis +10.

Die Szenarien innerhalb des Benchmarks sind in verschiedene Dringlichkeitsstufen unterteilt. Den grĂ¶ĂŸten Anteil bilden mit 53,5 % nicht-akute AlltagsgesprĂ€che. 28,3 % der Szenarien betreffen NotfĂ€lle mit unmittelbarer SicherheitsgefĂ€hrdung, wĂ€hrend 18,2 % auf GesprĂ€che mit schweren psychischen Problemen entfallen.

Bei der Verteilung der Nutzerprofile liegt der Schwerpunkt mit 68,1 % auf Erwachsenen, gefolgt von Teenagern mit 21,2 %. Ein kleinerer Teil entfÀllt auf klinisches Personal (5,8 %) und pflegende Angehörige (4,9 %). In 5,8 % der Aufgaben ist zudem ein vorheriger Nutzerkontext enthalten.

Sprachliche Vielfalt und technische Evaluierung

MentalHealthBench deckt ein breites sprachliches Spektrum ab. Neben englischen Inhalten umfasst der Datensatz 105 spanische, 54 hindi-sprachige, 34 arabische und 29 portugiesische GesprĂ€che. Weitere Beispiele liegen in Deutsch, Italienisch, Persisch, Indonesisch, TĂŒrkisch und Chinesisch vor. FĂŒr die Bewertung der Jugendbeispiele wurden zudem 30 Kliniker herangezogen, die ĂŒber spezifische Erfahrung in der Behandlung von unter 18-JĂ€hrigen verfĂŒgen.

Als automatisches Bewertungsinstrument dient laut den Berichten vom 23. September 2026 das Modell GPT-5.6 Sol im sogenannten High-Reasoning-Modus. Dieses fĂŒhrt pro Aufgabe vier unabhĂ€ngig voneinander erzeugte VervollstĂ€ndigungen aus. Bewertet werden hierbei die Sicherheit der Antworten, die Kontexterfassung, die Wahrung der Nutzerautonomie sowie die Bereitstellung handlungsorientierter Beratung.

Anzeige

Der neue offene Benchmark zeigt, wie unterschiedlich aktuelle KI-Modelle in Mental-Health-GesprĂ€chen abschneiden — Spitzenwerte liegen bei 57,3 %, Ă€ltere Modelle fallen auf unter 30 % zurĂŒck. Wer KI in Gesundheitsprodukten einsetzt, braucht jetzt belastbare PrĂŒfkriterien statt BauchgefĂŒhl. Unser kostenloser Leitfaden fasst die relevanten Sicherheits- und Compliance-Schritte zusammen. Compliance-Leitfaden jetzt anfordern

Ergebnisse im Leistungsvergleich der Frontier-Modelle

Die Auswertung zeigt deutliche Leistungsunterschiede zwischen aktuellen KI-Modellen. GPT-6 Astra erreichte mit 57,3 % den höchsten Gesamtwert und erzielte in Notfall-Dialogen eine Quote von 58,3 %. GPT-6 Sol folgte mit 53,9 %, wÀhrend Claude Opus 5.5 auf 52,4 % kam.

Letzteres Modell zeigte mit 57,0 % eine besondere StÀrke bei Dialogen mit Jugendlichen. Das Modell GPT-6 Luna erreichte 50,2 %. Im Vergleich dazu schnitten Àltere oder andere Modelle schwÀcher ab: GPT-4o (Stand MÀrz 2025) kam auf 32,1 % und Gemini 2.5 Pro auf 29,5 %.

Es wurde festgestellt, dass VervollstĂ€ndigungen, die die spezifischen Rubriken berĂŒcksichtigen, Werte von bis zu 99,0 % erreichen können. Von Klinikern gefĂŒhrte Interaktionen lagen bei 38,5 %.

Diskrepanzen zwischen Nutzer- und Expertenbewertungen

Eine begleitende Studie mit 44 Erwachsenen aus 16 LĂ€ndern und 14 Sprachen untersuchte die Übereinstimmung zwischen Laien und Fachpersonal. Dabei zeigte sich eine Deckungsgleichheit von 25,7 % bei den Bewertungsgewichten, wĂ€hrend 1,0 % der Kriterien direkt widersprĂŒchlich beurteilt wurden.

WÀhrend Nutzer vor allem praktische nÀchste Schritte und den gewÀhlten Tonfall schÀtzten, betonten Kliniker die Bedeutung der Kontexterfassung und die Interpretation mehrdeutiger Situationen.

Anzeige

In 28,3 % der Benchmark-Szenarien geht es um NotfĂ€lle mit unmittelbarer SicherheitsgefĂ€hrdung — und selbst fĂŒhrende Modelle erreichen dort nur rund 58 %. Wenn Ihr Produkt in solchen Momenten antwortet, entscheidet die PrĂŒflogik ĂŒber Haftung und Nutzervertrauen. Der Leitfaden zeigt, wie Sie Notfall-Erkennung, Kontexterfassung und Autonomiewahrung systematisch testen. PrĂŒf-Checkliste fĂŒr Krisen-Dialoge sichern

Der CEO der American Psychological Association (APA) wies in diesem Zusammenhang darauf hin, dass mentale Gesundheit auf einem Kontinuum existiere. OpenAI betonte zudem, dass ChatGPT zwar wöchentlich von ĂŒber einer Milliarde Menschen genutzt werde, jedoch keinen Ersatz fĂŒr eine professionelle Therapie darstelle.

Der nun veröffentlichte Datensatz ist fĂŒr Forscher herunterladbar, eine direkte Online-Veröffentlichung der Inhalte ist jedoch nicht vorgesehen. Begleitet wird die Initiative durch weitere Projekte wie ChatGPT for Teens und Kooperationen mit Organisationen wie Transluce oder lokalen Krisenhotlines.

Disclaimer...

de | wissenschaft | 70176604 |