KIDetektiv und ZeroGPT im Falschalarm-Test

Texte ohne KI-Ursprung und was die Detektoren daraus machen

Lesezeit ca. 8 Min. · aktualisiert: 28. Juli 2026 · zur Akademie

Ein Vorwurf der KI-Nutzung ist schwer zu widerlegen, sobald ein KI-Detektor eine Arbeit als maschinell erzeugt einstuft. Daher zählt weniger, wie zuverlässig KI-Text erkannt wird, als vielmehr, wie häufig menschlich verfasste Texte fälschlich beanstandet werden. Aus diesem Grund haben wir KIDetektiv und ZeroGPT 30 Abschlussarbeiten aus den Jahren 2007 bis 2020 vorgelegt. Diese Texte wurden vor der Veröffentlichung von ChatGPT verfasst. Allein das Veröffentlichungsdatum belegt jedoch nicht für jede Passage die menschliche Urheberschaft.

Vorschau der ersten Seite: KI-Werkzeuge im Studium: Merkzettel für den richtigen UmgangVorschau der ersten Seite

Kostenlos herunterladen

KI-Werkzeuge im Studium: Merkzettel für den richtigen Umgang

Die Grenze zwischen Hilfsmittel und Eigenleistung, gute Prompts für Gliederung, Recherche und Feedback, die Pflicht zur Quellenprüfung, KI beim Korrekturlesen, die Grenzen von Textdetektoren und Datenschutz mit fremden Texten. Erlaubnis und Kennzeichnung verweisen bewusst auf die eigene Hochschule.

Alle Merkzettel und Lernkarten ansehen

Warum alte Abschlussarbeiten besonders geeignet sind

Bei Tests dieser Art ist die Beweislage oft das Hauptproblem. Bei selbst verfassten Texten lässt sich die eigene Urheberschaft zwar behaupten, aber nicht objektiv belegen. Eine Arbeit, die 2009 auf einem Hochschulserver veröffentlicht wurde, ist ein starkes Indiz für eine menschliche Entstehung; ohne Unterlagen zur Entstehung lässt sich die Urheberschaft einzelner Passagen jedoch nicht abschließend belegen.

Sofern die historischen Texte tatsächlich von Menschen stammen, stellt jede positive Anzeige eines Detektors einen Falschalarm dar. Dieser Anteil bildet die Falsch-Positiv-Rate, eine wesentliche Größe zur Einschätzung der Genauigkeit eines Systems.

Das Material enthält 30 Bachelor- und Masterarbeiten aus den Jahren 2007 bis 2020 zweier Hochschulen sowie 15 gezielt erzeugte KI-Texte. Die Abschnitte der Abschlussarbeiten umfassen etwa 1.600 Zeichen und stammen aus dem Hauptteil.

Das Ergebnis

Für den Test wurden KIDetektiv und ZeroGPT genutzt. Die Übersicht zeigt die Auswertung bei 50 und 25 Prozent; diese Schwellen dienen der Einordnung des Testkorpus und sind keine allgemein verbindlichen Grenzwerte.

Tabelle: KIDetektiv, ZeroGPT
KIDetektivZeroGPT
Mittelwert bei Menschentext24,0 %2,5 %
höchster Wert bei Menschentext85,0 %40,4 %
Fehlalarm ab Schwelle 50 %3 von 300 von 30
Fehlalarm ab Schwelle 25 %12 von 301 von 30
KI-Texte erkannt ab 50 %13 von 1514 von 15
Mittelwert bei KI-Text79,6 %85,8 %

Keinen einfachen Zielkonflikt zeigen unsere Daten. Bei ZeroGPT bei einer Schwelle von 50 Prozent lagen die Werte bei keinem Menschentext und bei 14 von 15 KI-Beispielen oberhalb der Schwelle. Für die Gesamtleistung beider Detektoren erlaubt das jedoch keine allgemeingültige Schlussfolgerung.

KI-Detektor Falschalarm-Test: Ergebnisse im Überblick
Ergebnisse des eigenen Falschalarm-Tests mit KIDetektiv und ZeroGPT im Überblick.

Der Extremfall: 85 Prozent für eine Arbeit aus dem Jahr 2009

KIDetektiv wies einer vor ChatGPT veröffentlichten Arbeit den höchsten Wert von 85 Prozent zu. Nach der Skala des Anbieters werden Werte über 66 Prozent als „eher generiert“ eingeordnet. Das Veröffentlichungsjahr 2009 ist ein Indiz gegen die Nutzung von ChatGPT, belegt aber nicht die Urheberschaft jeder Passage.

Bei zwölf von dreißig Arbeiten lag der Wert über 25 Prozent. Die Anbieter-Skala ordnet erst Werte um 50 Prozent als „umgeschrieben oder gemischt“ ein. Ein gleichmäßiger, sachlicher Stil kann in wissenschaftlichen Texten vorkommen; eine Ursache für einzelne Einstufungen zeigt der kleine Test jedoch nicht.

Die Auswirkungen des Schwellenwerts

Die Tools geben lediglich einen Prozentwert aus und überlassen die Interpretation dem Nutzer. Gerade darin liegt das Risiko, denn die Festlegung der Schwelle beeinflusst die Aussage maßgeblich:

  • Bei 50 Prozent lagen in diesem Korpus drei von 30 Werten bei KIDetektiv oberhalb der Schwelle. Wenn die Texte menschlich verfasst sind, entspricht das einer Falsch-Positiv-Rate von 10 Prozent. In einem Kurs mit 30 Arbeiten entspräche das rechnerisch drei auffälligen Arbeiten.
  • Bei 25 Prozent lagen bei KIDetektiv zwölf von 30 Werten oberhalb der Schwelle. Wenn die Texte menschlich verfasst sind, entspricht das in diesem Test einer Falsch-Positiv-Rate von 40 Prozent.

Wer ein solches Tool nutzt, sollte die gewählte Schwelle und die Testgrundlage klar benennen. Die genannten Anteile beruhen auf wenigen Beispielen und genügen nicht, um allein daraufhin Prüfungsentscheidungen zu treffen.

Was du bei einem positiven Detektorbefund tun kannst

Ein hoher Detektorwert beweist die Urheberschaft eines Textes nicht ohne weitere Prüfung. Praktisch hilft es, die Entstehung der Arbeit belegen zu können:

  • Versionshistorie sichern. Word und Google Docs können frühere Stände anzeigen und helfen so, die Entwicklung sichtbar zu machen.
  • Zwischenstände sichern. Ein Ordner mit datierten Fassungen kann zeigen, wie der Text schrittweise gewachsen ist.
  • Halte Unterlagen fest. Deine Recherchen und Notizen können den individuellen Gedankengang belegen.
  • Prüfe die Grenze. Ermittle den genutzten Grenzwert und die damit verbundene Quote möglicher Fehlalarme.

Details dazu liest du auf unserer Seite zur Aussagekraft von Plagiatsprüfung und KI-Detektor.

KI-Detektor Falschalarm-Test: Vorgehen im Verdachtsfall

Einschränkungen dieser Untersuchung

Vier Einschränkungen gehören dazu:

  • Zwei Detektoren ersetzen keinen Marktüberblick. Die Untersuchung beschränkt sich auf zwei externe Detektoren, die zum Testzeitpunkt kostenlos und ohne Registrierung nutzbar waren; einen eigenen Scan bezogen wir nicht ein. Ein weiterer externer Kandidat ließ sich nicht bedienen, weil sein Cookie-Dialog das Eingabefeld dauerhaft verdeckte.
  • 30 plus 15 Texte ergeben eine kleine Stichprobe. Daraus folgen nur eingeschränkte Rückschlüsse; allgemeingültige Raten lassen sich damit nicht ableiten.
  • Die KI-Texte stammen aus einem einzigen, auf dieser Seite nicht näher benannten Sprachmodell. Andere Modelle oder nachträglich bearbeitete Texte lassen sich ohne Zusatztests nicht einschätzen.
  • Den internen KI-Scan testeten wir absichtlich nicht. Eine objektive Bewertung unseres Angebots sollte von neutralen Seiten erfolgen.

Methodik

Das Mensch-Korpus besteht aus deutschen Bachelor- und Masterarbeiten, die über OAI-Schnittstellen von Hochschulen bezogen wurden. Berücksichtigt wurden ausschließlich Schriften mit einem Erscheinungsjahr bis 2020. Pro Dokument prüften wir einen zusammenhängenden Abschnitt von rund 1.600 Zeichen aus dem Hauptteil, nachdem Kopfzeilen, Fußnoten und Verzeichnisse entfernt worden waren.

Die 15 KI-Texte wurden mit einem Sprachmodell erzeugt; Modellname und Version werden auf dieser Seite nicht angegeben. Es sollte jeweils einen Auszug von rund 260 Wörtern aus dem Hauptteil einer Bachelorarbeit zu einem vorgegebenen Thema verfassen, ohne weitere Bearbeitung. Jeder Text wurde einmal durch jeden Detektor geschickt; als Grundlage der Auswertung diente jeweils der angezeigte Prozentwert.

Weiterführende Informationen: KI-Detektoren im Vergleich, Merkmale von KI-Texten, Blindtest der Korrekturprogramme sowie wissenschaftliches Fehlverhalten.

Wenn du einen KI-Scan beauftragen möchtest, kannst du dein Dokument hochladen. Ein Bericht liefert Hinweise zur Einordnung, aber keinen Nachweis der Urheberschaft.

Datei hochladen

Häufige Fragen zum Falschalarm-Test

Wie zuverlässig sind KI-Detektoren?

In unserem Korpus aus 30 vor ChatGPT entstandenen Arbeiten klassifizierte KIDetektiv drei Texte und ZeroGPT keinen als KI. Wenn die Texte menschlich verfasst sind, wären dies Falschalarme. Bei einer niedrigeren Schwelle von 25 Prozent lagen zwölf von dreißig Arbeiten bei KIDetektiv und eine von dreißig bei ZeroGPT oberhalb der Schwelle. Diese Ergebnisse allein reichen nicht aus, um eine Prüfungsentscheidung zu begründen.

Warum werden menschliche Texte als KI erkannt?

Detektoren können statistische und sprachliche Muster in Texten auswerten; die verwendeten Verfahren unterscheiden sich je nach Anbieter. Sachliche und gleichmäßige Formulierungen können dabei ebenfalls berücksichtigt werden. Einzelne Werte belegen jedoch nicht sicher, wer eine wissenschaftliche Arbeit verfasst hat.

Was ist ein Falsch-Positiv?

Diese Meldung stuft einen von Menschen verfassten Text fälschlich als KI-generiert ein. Da die Texte vor 2022 veröffentlicht wurden, sind sie ein Indiz gegen eine Entstehung mit ChatGPT; für den Nachweis der menschlichen Urheberschaft sind zusätzlich Entstehungsunterlagen hilfreich.

Was mache ich bei einem KI-Verdacht?

Dokumentiere deinen Schreibprozess: Der Versionsverlauf in Word oder Google Docs, datierte Zwischenstände, Notizen und Rechercheunterlagen können dabei helfen. Frage außerdem nach, welcher Schwellenwert angesetzt wurde und mit welcher Fehlalarmquote gerechnet wird.

Habt ihr euren eigenen KI-Scan getestet?

Nein. Wir bieten selbst KI-Scans an und haben den eigenen Dienst deshalb nicht in diesen Vergleich aufgenommen. Die Ergebnisse betreffen nur KIDetektiv und ZeroGPT.

Welche Detektoren wurden getestet?

Getestet wurden KIDetektiv und ZeroGPT. Die Untersuchung bewertet nur die bei diesem Test verwendeten Fassungen; ein weiterer Kandidat blieb wegen eines verdeckten Eingabefelds außen vor.

Unsere Partner