KI-Recherche, Fälle

KI-Recherche: 317 Fälle zeigen, wie veraltete Belege Antworten verfälschen

Veröffentlicht am: 04.10.2026 um 03:03 Uhr | Redaktion boerse-global.de

Eine Untersuchung belegt, dass alte Quellen KI-Antworten verfälschen; klar formulierte Gültigkeitsgrenzen verbessern die Ergebnisse.

Studie zeigt, wie Sprachmodelle durch veraltete Fakten irregeführt werden
Ein verwittertes altes Papier mit verblassten Linien, das teilweise von einer feinen Schicht Wüstensand bedeckt ist. Illustration mit AI erstellt.

Große Sprachmodelle werden zunehmend für Recherchen und Auswertungen herangezogen, geraten bei zeitlichen Veränderungen von Fakten jedoch an klare Grenzen. Eine wissenschaftliche Untersuchung eines Forschungsteams um Ahmed, Galke Poech und Röttger von der University of Southern Denmark zeigt, dass gängige KI-Systeme veraltete Informationen nicht verlässlich als abgelaufen identifizieren.

In dem am 25. September 2026 veröffentlichten Vorabdruck (Preprint arXiv 2609.31342) analysierten die Forschenden das Verhalten von Modellen anhand von 317 belegten Kehrtwenden. Diese verteilten sich auf 87 Fälle aus der Medizin, 100 aus dem Rechtsbereich, 60 aus der Softwareentwicklung sowie 70 aus Plattform-Regeln.

Hohe Anfälligkeit für überholte Quellen

Die Ergebnisse der Untersuchung verdeutlichen, dass vorgelegte Dokumente mit überholtem Wissensstand korrekte Antworten der Modelle massiv verzerren können. Über vier getestete Modelle und vier Fachgebiete hinweg reichte die Quote gekippter Antworten von 17 % bis 91 %. Die höchste Anfälligkeit zeigte sich im Bereich der Medizin, während Softwarefragen die geringsten Abweichungen verzeichneten.

Bereits ein veraltetes Dokument ohne expliziten Hinweis auf dessen Gültigkeit reichte aus, um zuvor richtige medizinische Antworten zu verfälschen: Bei Qwen2.5-7B kippten dadurch 37 % der korrekten Aussagen, bei Llama-3.1-8B waren es 30 %. Wurde den Systemen die Anweisung erteilt, dem bereitgestellten Dokument zwingend zu folgen, stiegen die Fehlerraten deutlich an.

In diesem Szenario übernahmen Qwen2.5-7B in 75 % und Llama-3.1-8B in 66 % der Fälle die überholten medizinischen Inhalte. Auch größere Architekturen blieben nicht fehlerfrei. So kippten bei GPT-5.5 insgesamt 74 von 83 zuvor zutreffenden Medizin-Antworten.

Anzeige

Wer sich mit der rechtssicheren Anwendung von KI-Systemen befasst, benötigt angesichts komplexer Compliance-Vorgaben einen klaren Überblick über aktuelle Fristen und Pflichten. Dieser kostenlose Umsetzungsleitfaden zum EU AI Act unterstützt Unternehmen dabei, die neuen Anforderungen und Risikoklassen strukturiert zu erfassen. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Grenzen einfacher Datumsangaben

Ein bloßes Datum im Text reicht in vielen Fällen nicht aus, damit Systeme die Gültigkeit einer Aussage korrekt einordnen. Bei einem Test mit 50 Kehrtwenden, die ein klares Gültigkeitsende aufwiesen, wechselten Qwen2.5-72B bei Vorliegen eines reinen Datums lediglich in 6 von 50 Fällen und Llama-3.1-70B in 7 von 50 Fällen zur korrekten Bewertung.

Deutlich bessere Ergebnisse erzielten die Systeme erst, wenn die zeitliche Gültigkeitsgrenze ausdrücklich ausformuliert war. In Form eines eindeutigen Satzes korrigierten Qwen2.5-72B 50 von 50 sowie Llama-3.1-70B 47 von 50 Antworten; lag die zeitliche Einschränkung als Tabelle vor, erreichten beide Modelle jeweils 50 von 50 Fällen.

Gleichzeitig greifen automatisierte Filter nur bedingt. Ein spezielles Verfahren zur Bevorzugung neuerer Dokumente reduzierte die Zahl fehlerhafter Antworten bei Qwen2.5-7B und GPT-4o in Medizin und Recht um 4,6 bis 10,0 Prozentpunkte. Dieser dämpfende Effekt stellte sich den Forschenden zufolge allerdings ausschließlich dann ein, wenn die zugrundeliegenden Datumsangaben fehlerfrei hinterlegt waren.

Anzeige

Die korrekte Einstufung von KI-Systemen ist entscheidend, um rechtliche Unsicherheiten und mögliche Sanktionen im geschäftlichen Umfeld zu vermeiden. Erfahren Sie in diesem kostenlosen Report, welche Systeme konkret als Hochrisiko gelten und wie Sie die Dokumentationspflichten der EU-KI-Verordnung rechtzeitig umsetzen. Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun?

Grundlegende Herausforderungen bei generativen Systemen

Die Anfälligkeit von KI-Systemen für fehlerhafte Faktenzuordnungen beruht auf deren architektonischem Aufbau. Der KI-Forscher Thore Graepel wies darauf hin, dass Sprachmodelle Vorhersager der nächsten Texteinheit bleiben und über kein unabhängiges Schlussfolgerungssystem verfügen. Dabei bestehen strukturelle Schwachstellen: Es fehlt ein überprüfbares Protokoll über interne Zustände und Belege, Wissen und Rechenoperationen sind untrennbar in denselben Netzgewichten gespeichert, und generierte Erklärungen spiegeln nicht zwingend die tatsächliche Entstehung einer Antwort wider.

Auch Technologiekonzerne betonen diese Eigenheiten. In erweiterten Empfehlungen zu KI-generierten Inhalten hob Google hervor, dass generative Modelle keine gesicherten Fakten abrufen, sondern statistische Wortfolgen aus Trainingsdaten prognostizieren. Für die praktische Anwendung empfiehlt das Unternehmen eine manuelle Überprüfung sämtlicher generierter Angaben vor einer Veröffentlichung.

Disclaimer...

de | wissenschaft | 70222342 |