Ratgeber zur KI-Erkennung

Ist der KI-Detektor von Grammarly zuverlässig?

Der KI-Detektor von Grammarly kann in standardisierten Benchmarks sehr stark abschneiden, doch sein Wert beweist nicht, wie ein Dokument entstanden ist. Grammarly nennt die Prozentzahl eine gemittelte Schätzung, erklärt die Funktion für nicht 100% genau und weist darauf hin, dass kurze Abschnitte schwerer zu messen sind. Die unabhängige Evidenz zeigt in dieselbe Richtung: starke Werte in einem großen geteilten Benchmark, während eine akademische Studie von 2025 auf denselben KI-geschriebenen Einleitungen viel niedrigere Prozentzahlen als ein anderer Detektor verzeichnete. Ein Grammarly-Wert ist also ein Signal. Wenn das Ergebnis zählt, prüfe denselben Abschnitt mit einem zweiten Detektor und lies den markierten Text selbst. Der KI-Detektor von AI-2-Human liefert dir diese zweite Lesart.

AI-2-HumanVeröffentlicht 13 Min. Lesezeit
Eine Textprobe neben AI-2-Human auf einem Laptop und illustrative Grammarly- und AI-2-Human-Berichte mit unterschiedlichen KI-Werten.
Illustration einer zweiten Meinung: derselbe Abschnitt, von zwei Detektoren gelesen. Die gezeigten Werte sind illustrativ, keine gemessenen Ergebnisse zu einem Dokument.

Was ist der KI-Detektor von Grammarly?

Der KI-Detektor von Grammarly schätzt, welcher Teil eines Textes KI-generiert wirkt. Grammarly erklärt den Mechanismus selbst: Der Text wird in Abschnitte zerlegt, jeder Abschnitt wird gegen ein Modell für maschinelles Lernen geprüft, das nach typischen KI-Mustern sucht, etwa Sprachmuster, Syntax und Komplexität, und danach gibt Grammarly eine Prozentzahl zurück. Das Modell sei mit Hunderttausenden menschlichen und KI-geschriebenen Texten trainiert.

Die Funktion ist keine separate Website für einen einmaligen Besuch. Grammarly integriert sie ins Produkt: den AI Detector in seinen Schreiboberflächen, die KI-Prüfung in Google Docs über die Browser-Erweiterung und die Desktop-Apps für Word, und in den meisten Tarifen ist sie kostenpflichtig. Eine kostenlose Version läuft auf der öffentlichen AI-Detector-Seite, wo du Text einfügst oder ein Dokument hochlädst.

Grammarly: Nutzerhandbuch zum KI-Detektor (auf Englisch)

Wie genau ist der KI-Detektor von Grammarly nun?

Es gibt keine einzelne Genauigkeitszahl, die jede Grammarly-Prüfung beschreibt. Sagbar ist etwas Engeres: Der Detektor trennt KI-Text und menschlichen Text unter Benchmark-Bedingungen sehr zuverlässig, und unabhängige Forschung zeigt, dass die zurückgegebenen Prozentzahlen deutlich unter dem tatsächlichen KI-Anteil liegen können.

Grammarlys eigene Formulierungen setzen die Erwartung besser als jede Zusammenfassung. Das Nutzerhandbuch nennt den Wert eine gemittelte Schätzung, wie viel KI-generierter Text ein Dokument wahrscheinlich enthält, sagt, Tests hätten die Richtungstreue des Modells sichergestellt, weist darauf hin, dass kürzere Abschnitte schwerer zu messen sind, und erklärt, die Funktion sei nicht 100% genau und dürfe nicht als abschließende Bewertung gelten. Ein weiterer Hilfeartikel ergänzt, kein Detektor könne heute abschließend feststellen, ob KI genutzt wurde, und diese Tools seien ein einzelner Datenpunkt, nicht die einzige Evidenzquelle.

Grammarly: Löst die Nutzung von Grammarly KI-Detektoren aus? (auf Englisch)

  • Schreibstil: formale, sehr gleichmäßige Prosa liegt näher an den Mustern, die Detektoren mit Maschinenschreiben verbinden.
  • Textlänge: kürzere Abschnitte sind schwerer zu messen als längere, so Grammarly selbst.
  • Modell: verschiedene Sprachmodelle hinterlassen verschiedene Spuren, und Detektoren sind auf bestimmte Familien abgestimmt.
  • Menschliche Bearbeitung: KI-generierter und dann stark umgeschriebener Text wirkt nicht mehr wie rohe Modellausgabe.
  • Gemischte Autorschaft: menschliche Entwürfe, KI-Hilfe und manuelle Überarbeitung zusammen sind der schwerste Fall.
  • Version und Datensatz: Grammarly aktualisiert das Modell, und jede Zahl hängt von Genre und Länge des Testmaterials ab.

Was bedeutet die Prozentzahl von Grammarly wirklich?

Ein Wert von 40% heißt nicht, dass Grammarly festgestellt hat, dass genau 40% des Dokuments von KI stammen. Es heißt, dass das Modell in den geprüften Abschnitten Muster fand, die diesen Anteil des Textes wie KI-Schreiben wirken lassen. Grammarly verwendet die Wörter Schätzung und gemittelt bewusst und wiederholt die Einschränkung: Der Wert sei eine gemittelte Schätzung und keine abschließende Prozentbewertung und dürfe nicht als objektive Wahrheit gelten, weil KI-Erkennung jeder Art fehleranfällig ist.

Das abschnittsweise Design erklärt einen Teil der Unschärfe. Die Zerlegung zeigt, welche Teile das Ergebnis verursacht haben, doch eine Prozentzahl presst mehrere lokale Urteile in eine einzige Zahl: Ein Dokument mit drei formelhaften und vier persönlichen Absätzen kann auf einem mittleren Wert landen, der keine der beiden Hälften gut beschreibt.

Was der RAID-Benchmark über Grammarly berichtet

RAID ist ein geteilter Benchmark, der Detektoren unter gleichen Bedingungen bewertet: über 10 Millionen Dokumente mit 11 Sprachmodellen, 11 Genres, vier Dekodierungsstrategien und adversarialen Angriffen wie Paraphrasieren, Synonymtausch und Homoglyphen. Jeder teilnehmende Detektor wird mit demselben Material und demselben Auswertungsskript bewertet, was RAID zum fairsten öffentlichen Vergleich macht und zugleich zu dem, der sich am schwersten in ein Versprechen über einen einzelnen Aufsatz verwandeln lässt.

RAID: ein geteilter Benchmark zur robusten Bewertung von Detektoren für maschinengenerierten Text (auf Englisch)

Grammarly bewirbt seine Leistung in diesem Benchmark direkt. Die Produktseite des Detektors erklärt, das Produkt erreiche 99% Erkennungsgenauigkeit und stehe im unabhängigen RAID-Benchmark an erster Stelle, vor anderen führenden KI-Detektoren. Das ist eine Anbieteraussage des Unternehmens, dessen Detektor beschrieben wird, und sollte auch so gelesen werden.

Grammarly: Produktseite des KI-Detektors (auf Englisch)

Das Leaderboard selbst ist konkreter. Der hier zitierte Stand wurde am 20. September 2026 erfasst, der Grammarly-Eintrag ist auf den 9. Februar 2026 datiert. Einträge werden von den Detektor-Entwicklern eingereicht und mit dem Skript des Benchmarks bewertet, die Bedingungen sind also geteilt, die Einreichung kommt vom Anbieter. In diesem Stand nennt Grammarly einen AUROC von 0,9987 über alle RAID-Bedingungen inklusive adversarischer Angriffe, mit 99,47% Genauigkeit bei einer Zielquote falscher Treffer von 5% und 98,21% bei 1%. Im nicht-adversarischen Teil meldet derselbe Eintrag einen AUROC von 0,99972 und 99,91% Genauigkeit bei 5%.

Die Metriknamen sind wichtig. Der AUROC misst, wie gut ein Detektor die beiden Klassen über alle Schwellen hinweg trennt, wobei 1,0 perfekt ist, und ist kein Prozentwert richtiger Entscheidungen. RAID misst Genauigkeit an einem festen Betriebspunkt, der Schwelle, an der nur 5% oder 1% der menschlichen Texte falsch markiert werden.

Was unabhängige Forschung über Grammarly sagt

Das nützlichste unabhängige Ergebnis stammt aus einer begutachteten Studie, die 2025 in Advances in Simulation erschien. Die Forschenden nahmen 30 vor 2022 erschienene Open-Access-Artikel aus zwei Fachzeitschriften für Simulation im Gesundheitswesen, entnahmen die Einleitungen und erstellten fünf Versionen je Text: das menschliche Original, eine leicht KI-bearbeitete Fassung, eine stark KI-bearbeitete, eine aus menschlichen Stichpunkten generierte und eine vollständig aus dem Titel geschriebene. Drei kostenlose Detektoren (ZeroGPT, Phrasly AI und Grammarly) und fünf verblindete menschliche Bewerter bewerteten dasselbe Material.

Grammarly unterschied die fünf Bedingungen insgesamt, mit statistisch signifikantem Effekt und einer Effektstärke von 0,75, doch seine absoluten Prozentzahlen lagen weit unter dem KI-Anteil im Text. Auf denselben Einleitungen lag der Durchschnitt bei 1,6% für unberührten menschlichen Text (95%-Konfidenzintervall 0,0 bis 3,1), 3,0% bei leichter KI-Bearbeitung, 11,5% bei starker, 62,5% bei aus Stichpunkten generiertem Text und 50,0% bei vollständig aus dem Titel erzeugtem Text. ZeroGPT lag bei 6,5%, 20,2%, 43,1%, 89,9% und 92,5%.

Advances in Simulation: Fähigkeit von KI-Detektoren und Menschen, KI-generierte Inhalte zu erkennen (2025, auf Englisch)

Daraus folgen zwei Schlüsse in entgegengesetzte Richtungen. Der ermutigende: Die Reihenfolge stimmte, die Werte stiegen mit dem KI-Anteil, und Grammarly markierte am seltensten unberührten menschlichen Text. Der mahnende: Ein vollständig von einem Sprachmodell geschriebenes Dokument kam im Mittel mit 50% zurück, weit entfernt von dem, was Lesende maschinengeschrieben nennen würden.

Die Studie maß auch die Übereinstimmung der Tools. ZeroGPT und Phrasly stimmten mit 0,96 sehr gut überein. Grammarly und ZeroGPT nur mäßig, mit 0,60 und einem Bias von 24,7 Punkten: ZeroGPT gab auf demselben Material systematisch höhere KI-Werte zurück, Phrasly gegen Grammarly lag bei 0,57. Die menschlichen Bewerter waren nicht besser, ihre Gesamtgenauigkeit lag bei 19%.

Kann Grammarly menschlichen Text als KI markieren?

Ja. Ein falscher Treffer ist wirklich menschlicher Text, den ein Detektor als KI-generiert oder KI-gestützt liest, und Grammarly räumt den Fall ein. Die Dokumentation erklärt, das Modell sei darauf optimiert, falsche Treffer zu minimieren, es könne Fälle geben, in denen menschliche Sprachmuster, Syntax und Komplexität KI-Text ähneln, und solche Fälle sollten sehr selten sein. Danach folgt derselbe Rat wie in dieser Übersicht: das Ergebnis im weiteren Kontext lesen, nicht als objektive Wahrheit.

Die Risikofaktoren werden in der Detektorliteratur einheitlich beschrieben, und es sind Eigenschaften des Textes, keine Liste von Grammarly. Sehr formales Register, gleichförmiger Satzbau, vorhersehbare Übergänge, geringe Wortvielfalt, sehr kurze Proben, Genres fernab der Trainingsdaten und Englisch als Zweitsprache liegen näher an der Grenze. Nichts davon belegt KI-Nutzung, und einiges davon entsteht durch sorgfältiges Schreiben.

Kann Grammarly KI-generierten Text übersehen?

Ja, und die Studie von 2025 ist das konkreteste öffentliche Beispiel: Vollständig aus dem Titel KI-generierter Text lag im Mittel bei 50,0% auf Grammarly, während dasselbe Material auf den anderen beiden Tools über 92% erreichte. Daraus lässt sich keine Ausfallquote ableiten, denn die Zahl beschreibt 30 Einleitungen einer Disziplin, mit einer Modellfamilie und zu einem Zeitpunkt. Sie zeigt aber die Form des Problems: Ein auf wenige falsche Treffer optimierter Detektor lässt einen Teil maschinengeschriebenen Textes durch.

Die Dokumentation erklärt, warum eine Überarbeitung durchrutschen kann. Das Modell wird mit menschlichem und KI-generiertem Text von Modellanbietern trainiert, Grammatik- oder Klarheitsvorschläge ändern die Prozentzahl meist nicht, bedeutendes Umschreiben mit einem generativen Modell erhöht sie. Von Hand bearbeiteter KI-Text liegt dazwischen, ebenso ein menschlicher Absatz, den ein Assistent stark umgeschrieben hat, also der Fall gemischter Autorschaft, den kein Detektor sauber löst. Neuere Modelle machen das Problem größer, weil Detektoren gegen die Ausgaben trainiert werden, die es beim Bau des Modells gab.

Warum Grammarly-Ergebnisse schwanken können

Wenn zwei Personen denselben Text durch dasselbe Tool schicken und verschiedene Zahlen erhalten, oder wenn zwei Tools sich über ein Dokument uneinig sind, liegt die Erklärung meist in den Bedingungen.

  • Detektorversion: Grammarly aktualisiert sein Modell laufend, Ergebnisse verändern sich mit dem Produkt.
  • Länge und Granularität: Der Text wird abschnittsweise geprüft, ein kurzes Dokument beruht auf weniger lokalen Entscheidungen.
  • Bearbeitungshistorie: Grammatik- und Klarheitskorrekturen lassen den Wert meist unverändert, generatives Umschreiben erhöht ihn.
  • Schwelle und Vergleich: Wo ein Detektor die Grenze zieht, ist wichtig, und Grammarly sagt, seine Werte wichen von Turnitin, GPTZero, Copyleaks und anderen ab.

Eine Prozentzahl ist nur zusammen mit einer Beschreibung des Textes lesbar. Zwei Sätze aus einem Absatz, ein in einem Zug geschriebener Aufsatz und ein über drei Wochen mit einem Assistenten erstellter Bericht sind drei verschiedene Messungen, auch wenn das Tool denselben Wertetyp ausgibt.

Beeinflusst die Textlänge den Grammarly-Wert?

Grammarly sagt es direkt: Kürzere Abschnitte sind schwerer genau zu messen als längere. Das ist eine vernünftige Aussage über Evidenz, denn ein abschnittsweise arbeitender Detektor hat bei zwei Sätzen weniger Abschnitte als Grundlage.

Die praktische Regel ist Verhältnismäßigkeit. Ein hoher Wert über ein ganzes Dokument, in dem sich Muster über mehrere Absätze wiederholen, verdient mehr Aufmerksamkeit als ein hoher Wert auf einem einzelnen markierten Satz. Bei kurzen Proben bleibt das Ergebnis vorläufig.

Ändern Bearbeiten oder Paraphrasieren den Grammarly-Wert?

Grammarly zieht eine Linie innerhalb der Bearbeitung, und sie ist nützlich. Traditionelle, nicht generative Korrekturen wie Vorschläge zu Grammatik, Klarheit, Wortwahl und Prägnanz ändern die KI-Prozentzahl meist nicht, weil sie die zugrunde liegenden Sprachmuster nicht verändern. Sätze oder ganze Absätze mit einem generativen Assistenten umzuschreiben ist etwas anderes: Grammarly erklärt, bedeutendes Umschreiben mit seinem Agenten, Assistenten oder einem Paraphrasierer erhöhe den Wert, und Text von einem externen Anbieter werde noch wahrscheinlicher höher eingestuft.

Das Unternehmen wendet diese Logik auf die eigenen Tools an, was ungewöhnlich offen ist. Die Dokumentation warnt, dass Umschreiben mit Grammarlys Umformulierungs- oder Humanisierungsagenten das Ergebnis wahrscheinlich als KI-generiert markiert, weil diese Umschreibungen aus Grammarlys eigenem Sprachmodell stammen, und empfiehlt, Agenten für Feedback zu nutzen, das man manuell einarbeitet, wenn eine Markierung problematisch ist. Liest man den Wert einer anderen Person, gilt dasselbe umgekehrt: Text, der durch einen Paraphrasierer gelaufen ist, ist schwerer zu deuten, und ein niedriger Wert beweist nicht, dass kein Assistent beteiligt war.

KI-Detektor von Grammarly oder Authorship?

Grammarly liefert zwei verschiedene Ideen unter ähnlichen Namen, und ihre Verwechslung führt am schnellsten zu einer Fehldeutung. KI-Erkennung untersucht den fertigen Text und schätzt, wie viel davon KI-Schreiben ähnelt. Authorship zeichnet auf, wie das Dokument entstand, und ordnet Text beim Eintragen ein: direkt geschrieben, aus einer Browserquelle eingefügt, aus unbekannter Quelle wie einem privaten Fenster eingefügt, von KI generiert oder geschrieben und anschließend mit KI-Umformulierung verändert.

Grammarly: Einführung in Authorship (auf Englisch)

Authorship funktioniert in Google Docs über die Browser-Erweiterung und in Word über die Desktop-App und erzeugt teilbare Berichte, die in höheren Tarifen KI- und Plagiatsprüfungen enthalten können. Die entscheidende Unterscheidung ist einfach: Ein Detektor liest den Text und schätzt, ein Autorschaftsprotokoll beschreibt den Entstehungsprozess.

Wie man einen Grammarly-Wert interpretiert

Bevor du auf eine Prozentzahl reagierst, gehe diese Fragen durch. Sie sind der Unterschied zwischen einem Signal und einem Urteil.

  • Wie viel Text wurde geprüft: ein ganzes Dokument oder ein kurzer Auszug?
  • Ist der Abschnitt stark bearbeitet, KI-gestützt oder gemischt?
  • Welche Abschnitte wurden markiert, und teilen sie ein Muster?
  • Wirkt der Text wirklich repetitiv oder formelhaft?
  • Liefert ein zweiter Detektor eine ähnliche Lesart?
  • Gibt es Entwürfe, Versionsverlauf oder einen Authorship-Bericht?

Was ein Grammarly-Wert allein nicht belegen kann, sollte klar gesagt werden. Er sagt nicht, wer ein Dokument geschrieben hat, ob eine KI-Nutzung gegen Regeln verstieß, ob plagiiert wurde oder ob jemand ehrlich ist. Grammarly beschreibt seine Erkennung selbst als einzelnen Datenpunkt, nicht als einzige Evidenzquelle.

Was tun, wenn Grammarly deinen Text markiert?

Arbeite die Situation in fester Reihenfolge ab, statt reflexhaft umzuschreiben. Es ist dieselbe Sequenz, die diese Übersicht für jeden Detektor empfiehlt.

Eine Abfolge, die sich wiederholen lässt
  1. 1

    Den markierten Abschnitt lesen

    Beurteile ihn zuerst als Text: Wirkt er wirklich repetitiv oder formelhaft?

  2. 2

    Die Stichprobengröße prüfen

    Kam der Wert aus einem ganzen Dokument oder aus zwei Sätzen?

  3. 3

    Einen zweiten Detektor vergleichen

    Schicke denselben Text durch ein anderes Tool und prüfe, ob die Lesarten übereinstimmen.

  4. 4

    Prozessbelege sammeln

    Suche Entwürfe, Versionsverlauf oder einen Authorship-Bericht.

  5. 5

    Überarbeiten, was es braucht

    Schreibe nur die Abschnitte um, die es brauchen, und prüfe Belege separat.

Manchmal ist die Sorge berechtigt. Gleichförmige Sätze, Übergänge, die nichts verbinden, und Absätze ohne Belege sollten korrigiert werden, ob ein Detektor sie bemerkt hat oder nicht. Ist ein Abschnitt wirklich mechanisch, schreibt der Humanizer von AI-2-Human eine natürlichere Fassung, die deine Bedeutung bewahrt.

Solltest du Grammarly mit einem anderen Detektor vergleichen?

Ja, und die Empfehlung kommt hier ebenfalls vom Anbieter. Die Dokumentation erklärt, die Erkennung nutze ein eigenes Inhouse-Modell, Werte könnten von anderen Lösungen wie Turnitin, GPTZero oder Copyleaks abweichen, und der Wert sei kein klarer Hinweis darauf, dass ein anderer Detektor dasselbe meldet. Die unabhängige Studie maß denselben Effekt: 0,60 Übereinstimmung zwischen Grammarly und ZeroGPT auf identischen Texten, mit rund 25 Punkten Unterschied.

Der Vergleich hilft in beide Richtungen. Markieren zwei Detektoren dieselbe Stelle, verdient sie eine genaue Lektüre. Widersprechen sie sich deutlich, liegt der Text nahe an einer Entscheidungsgrenze und der Wert ist weich, was man vor einer Überarbeitung wissen sollte.

Der AI-2-Human Detektor liest denselben Abschnitt mit seinem eigenen Modell und zeigt die Stellen, die noch generiert wirken, sodass zwei Interpretationen nebeneinander stehen. Das ist eine zweite Meinung, keine höhere Instanz: Du bekommst mehr Grundlagen, bevor du entscheidest, ob und was geändert wird.

Vor der Abgabe: eine praktische Checkliste

  • Ich weiß, dass der Grammarly-Wert eine Schätzung und keine Messung ist.
  • Ich habe geprüft, wie viel Text analysiert wurde, bevor ich den Wert lese.
  • Ich habe die markierten Stellen gelesen und nicht nur die Schlagzahl.
  • Ich habe bedacht, ob der Text menschlich, KI-gestützt oder gemischt ist.
  • Ich habe einen zweiten Detektor verglichen, wenn das Ergebnis zählt.
  • Ich habe nach Entwürfen, Versionsverlauf oder einem Authorship-Bericht gesucht.
  • Ich habe Belege und Fakten getrennt von der KI-Erkennung geprüft.
  • Ich habe nur die Abschnitte überarbeitet, die es wirklich brauchten.

Häufige Fragen

Quellen und redaktionelle Hinweise

AI-2-Human ist weder mit Grammarly verbunden noch von Grammarly unterstützt. Die Produktdokumentation von Grammarly, Benchmark-Informationen und die zitierte Forschung wurden am 20. September 2026 eingesehen. Erkennungsmodelle und Benchmark-Leaderboards ändern sich, prüfe daher die aktuelle Grammarly-Dokumentation und das aktuelle RAID-Leaderboard, bevor du dich auf eine hier genannte Zahl verlässt.

Aktualisiert

Zweite Meinung nötig?

Vergleiche deinen Grammarly-Wert mit einem anderen Detektor.

Gib denselben Abschnitt in AI-2-Human, prüfe ein zweites Signal und entscheide, ob der Text wirklich überarbeitet werden muss.

Alle Ratgeber ansehen