Détection IA

GPTZero est-il fiable ?

GPTZero identifie correctement un texte généré par une IA dans de nombreuses situations, mais aucun pourcentage de précision unique ne s’applique à tout type d’écrit. Le benchmark de GPTZero affiche des résultats très élevés sur quatre domaines anglophones, tandis que les études indépendantes montrent une performance qui varie avec la version du détecteur, le type d’écrit, la longueur du texte et le corpus testé. Les faux positifs comme les faux négatifs sont documentés. GPTZero est donc un signal de détection utile, mais pas une preuve incontestable de la façon dont un texte a été écrit. Quand le résultat compte, passer le même passage dans le détecteur AI-2-Human vous donne un second signal avant de conclure.

AI-2-HumanPublié le 15 min de lecture
Un exemple de texte à côté d’AI-2-Human sur un ordinateur portable et de rapports illustratifs GPTZero et AI-2-Human aux scores de détection IA différents.
Illustration d’un second avis : le même passage lu par deux détecteurs. Les scores affichés sont illustratifs et ne correspondent à aucun document mesuré.

Qu’est-ce que GPTZero ?

GPTZero est un détecteur de texte IA. Vous collez un texte ou vous importez un document, et son système d’apprentissage profond estime quelle part de ce texte a été écrite par une machine. Il renvoie l’une de trois classifications au niveau du document (entièrement écrit par un humain, entièrement écrit par une IA, ou écrit par un mélange des deux) accompagnée d’une catégorie de confiance, et il met en évidence les phrases qui ont le plus contribué au résultat. GPTZero décrit également des capacités de détection supplémentaires visant les textes modifiés par des outils de reformulation.

GPTZero : la technologie de détection IA (anglais)

GPTZero est-il précis ?

Il n’existe pas de pourcentage de précision unique qui s’applique à tout type de texte. Les résultats rapportés dépendent de la version du modèle, de la construction du benchmark, des écrits humains utilisés comme référence, du modèle d’IA qui a généré les textes machines, du genre, de la longueur, du fait que le texte a été retravaillé ou reformulé ensuite, du seuil de décision choisi par les testeurs et de la langue testée.

C’est pourquoi ce guide garde deux familles de preuves distinctes. La première, ce que GPTZero dit de son propre modèle, sur son propre benchmark, avec une version explicitement indiquée. La seconde, ce que des chercheurs indépendants ont mesuré en soumettant GPTZero à leurs propres textes, ce qui répond à une autre question : ils ont testé la version alors disponible, sur leur corpus, à un seuil qu’ils ont choisi. Les deux sont utiles, aucune ne remplace l’autre.

Pour un lecteur qui a un document précis sous les yeux, la réponse courte est donc conditionnelle : GPTZero peut être très efficace sur des écrits proches de ceux sur lesquels il a été entraîné et évalué, et sa documentation reconnaît que les extraits courts, les textes IA fortement modifiés, les genres inhabituels et les écrits très procéduraux sont des cas plus difficiles.

Ce que rapporte le benchmark actuel de GPTZero

GPTZero publie une page de benchmarking standardisée qu’elle annonce mise à jour chaque trimestre, avec les prédictions brutes mises à disposition des chercheurs qui veulent reproduire les résultats. Dans son évaluation de février 2026, GPTZero rapporte, pour la version 4.3b de son modèle, une moyenne sur quatre domaines anglophones de 0,08 % de faux positifs, 99,60 % de rappel, 99,93 % de précision et 99,76 % de justesse. Chaque benchmark utilise 1 000 textes humains et 1 000 textes générés par des modèles de langage, répartis équitablement entre les modèles testés (250 textes par modèle), et le panel de modèles est renouvelé chaque trimestre.

Les résultats par domaine sont publiés séparément, ce qui compte parce qu’une moyenne masque les écarts. GPTZero rapporte 99,85 % de justesse sur les relectures d’articles académiques (0,10 % de faux positifs), 99,80 % sur l’écriture créative, 100 % sur les dissertations avec 0,00 % de faux positifs, et 99,40 % sur les avis produits. La même page publie les scores qu’elle a mesurés pour les détecteurs concurrents sur les textes identiques, et la comparaison est plus serrée sur certains domaines que la moyenne affichée ne le suggère.

GPTZero : benchmark de détection IA, standard de précision, de transparence et d’équité (anglais)

Ce que disent les recherches indépendantes sur GPTZero

Le résultat indépendant le plus solide pour GPTZero vient d’une étude évaluée par les pairs publiée dans Acta Neurochirurgica en 2025. Les chercheurs ont réuni 1 000 textes : 250 résumés et introductions rédigés par des humains dans quatre revues de neurochirurgie à fort impact et publiés avant ChatGPT, plus 750 versions du même contenu générées par ChatGPT 3.5, GPT-4 et GPT-4o. Les détecteurs ont été utilisés entre le 1er et le 15 juin 2024, ce qui date la version de GPTZero testée. Avec GPTZero, le score moyen de probabilité d’IA était de 5,88 % pour les textes humains, 81,71 % pour GPT-3.5, 96,83 % pour GPT-4 et 99,58 % pour GPT-4o. Au seuil retenu par les chercheurs, GPTZero atteint 100 % de sensibilité et 99,6 % de spécificité.

Acta Neurochirurgica : précision et limites des détecteurs de textes IA (anglais)

C’est un résultat solide, et il reste conditionnel. Il décrit un corpus académique, dans une discipline, à des longueurs de texte données, face à trois versions de ChatGPT, sur la version de GPTZero disponible en juin 2024, à un seuil choisi par les auteurs. Cela ne signifie pas que le détecteur est précis à 99,6 % sur votre texte, et le même article note qu’aucun détecteur évalué n’était fiable dans toutes les situations.

Des travaux indépendants plus anciens montrent à quel point ces conditions peuvent changer la donne. Une étude préliminaire publiée dans le Journal of Korean Medical Science en 2023 a testé GPTZero sur 20 textes générés par ChatGPT en réponse à des questions de médecine et sur 30 extraits tirés d’articles médicaux déjà publiés. Elle rapporte une sensibilité de 0,65 (intervalle de confiance à 95 % de 0,41 à 0,85), une spécificité de 0,90 (0,73 à 0,98) et une justesse de 0,80 (0,66 à 0,90), et conclut que GPTZero avait un faible taux de faux positifs mais un taux élevé de faux négatifs : il accusait rarement un texte humain, et manquait souvent un texte machine.

Journal of Korean Medical Science : performance de GPTZero sur des textes médicaux générés par IA (2023, anglais)

L’écart entre cet instantané de 2023 et l’étude de 2025 n’est pas une contradiction, et ce n’est pas la preuve qu’une équipe a travaillé à la légère. C’est l’illustration la plus claire de cette page : la précision d’un détecteur doit se lire avec sa version et son corpus.

GPTZero peut-il signaler un texte humain comme écrit par une IA ?

Oui. Un faux positif, c’est un texte humain classé comme écrit par une IA ou comme mixte, et GPTZero reconnaît l’existence de ces cas. Sa documentation explique que la précision augmente avec la quantité de texte soumise, que son classifieur est entraîné principalement sur de la prose anglaise écrite par des adultes, et qu’il peut parfois signaler comme IA d’autres textes générés par machine ou très procéduraux. Un court extrait, un passage stéréotypé ou un texte éloigné de cette distribution d’entraînement sont les terrains où ce risque se concentre.

GPTZero : quelles sont les limites de son classifieur IA ? (anglais)

La documentation publique de GPTZero va plus loin que la plupart des éditeurs sur les conséquences de ce risque. Elle indique que les résultats ne doivent pas servir à sanctionner des étudiants, recommande de traiter une classification comme un élément d’une évaluation plus large, et présente le détecteur comme un point de départ de discussion plutôt que comme un verdict final. En contexte académique, l’entreprise précise même qu’elle préfère manquer un usage de l’IA plutôt que d’accuser une personne à tort : sa documentation d’API déconseille d’augmenter la sensibilité du détecteur pour un usage académique, car les faux négatifs y sont préférables aux faux positifs.

GPTZero peut-il manquer un texte généré par une IA ?

Oui, et le compromis assumé par l’éditeur le dit explicitement : un faux négatif, c’est un texte généré classé comme humain, et GPTZero indique qu’en contexte académique elle préfère cette erreur-là. L’étude médicale de 2023 mesure le coût pratique de la même préférence, avec une sensibilité de 0,65 sur son corpus : environ un tiers des textes machines n’ont pas été signalés.

Plusieurs facteurs poussent un passage généré vers une classification humaine. Un texte généré puis fortement réécrit à la main ne ressemble plus à une sortie brute de modèle, et la documentation de GPTZero précise que son classifieur n’a pas été entraîné à identifier un texte IA après des modifications lourdes. Les outils de reformulation, les modèles peu familiers, les genres inhabituels, les échantillons courts et les modifications destinées à tromper le détecteur se situent dans la même zone. L’entreprise met ses modèles à jour pour ces cas, ce qui explique aussi qu’un résultat obtenu sur une version ne se transpose pas automatiquement à la suivante.

Pourquoi la précision de GPTZero varie

Quand deux études rapportent des chiffres très différents pour le même outil, l’explication tient en général à la conception du test plutôt qu’à l’outil. Les variables ci-dessous couvrent l’essentiel de l’écart.

  • La version du modèle : le détecteur testé en 2023, celui testé en juin 2024 et le modèle actuel sont des systèmes différents, et GPTZero documente elle-même ces changements de version.
  • La construction du benchmark : les textes choisis, la façon dont les textes IA ont été générés et l’équilibre entre les genres influencent tous le résultat.
  • Les écrits humains servant de référence : de la prose académique d’avant ChatGPT, des copies d’étudiants et des textes web sont des distributions différentes, et un classifieur peut être excellent sur l’une et faible sur l’autre.
  • Le modèle générateur : l’étude Acta Neurochirurgica mesure des scores GPTZero moyens qui passent de 81,71 % pour GPT-3.5 à 99,58 % pour GPT-4o, donc le même outil lit différemment différents modèles.
  • Le genre et la langue : GPTZero indique être plus performant sur des textes longs et sur de la prose anglaise, là où se trouve l’essentiel de ses données d’entraînement.
  • La longueur du texte : plus de texte signifie plus d’indices, ce qui explique pourquoi les résultats au niveau du document sont plus fiables que ceux au niveau de la phrase.
  • La réécriture et la reformulation : une réécriture humaine importante ou une paraphrase automatique éloigne un texte des schémas appris par le classifieur.
  • Le seuil : tout détecteur convertit des scores en décisions à un certain seuil, et déplacer ce seuil échange des faux positifs contre des faux négatifs. L’étude Acta a publié son propre seuil, ce qui rend ses chiffres précis plutôt qu’universels.
  • Ce qui compte comme « correct » : les études traitent différemment les classifications mixtes, les textes partiellement générés et les documents hétérogènes, si bien que deux articles peuvent mesurer le même outil en donnant un sens différent au mot précision.

La longueur du texte influence-t-elle la précision de GPTZero ?

Oui, et GPTZero le dit directement. Sa documentation indique que la précision augmente avec la quantité de texte soumise, et que les classifications au niveau du document sont généralement plus fiables que celles au niveau du paragraphe, elles-mêmes plus fiables que celles au niveau de la phrase.

La conséquence pratique vaut la peine d’être retenue la prochaine fois que vous verrez une phrase surlignée. Une phrase isolée est un signal faible, parce qu’elle porte le moins d’indices de tout ce que le détecteur examine. Une classification cohérente au niveau du document sur une copie complète, où les mêmes schémas apparaissent dans plusieurs paragraphes, mérite davantage de poids. Si le texte que vous vérifiez est court, traitez le résultat comme provisoire et vérifiez une portion plus large.

Comment interpréter un résultat GPTZero

GPTZero ne renvoie pas un chiffre unique, et lire sa sortie comme « X pour cent de cette copie a été écrit par une IA » est un contresens. Le système retourne une classification (humain uniquement, mixte, ou IA uniquement), une probabilité pour chacune de ces classes, et une catégorie de confiance : haute, moyenne ou basse. La probabilité associée à la classe prédite est décrite par GPTZero comme la chance que le détecteur ait raison dans sa prédiction : un chiffre de 90 % signifie que, sur des documents similaires, il voit juste environ 90 % du temps.

GPTZero : comment traduire les probabilités de l’API en décisions ? (anglais)

GPTZero publie aussi la signification concrète de ses catégories de confiance : lorsque la confiance est haute, elle indique que 99,1 % des articles humains sont classés comme humains et 98,4 % des articles IA comme écrits par une IA. Un résultat de confiance moyenne ou basse est, par construction, un énoncé plus mou, et la documentation décrit les seuils que vous pouvez ajuster pour échanger de la sensibilité contre des faux positifs selon votre usage.

Quelques questions à se poser avant d’agir sur un résultat :

  • Quelle est la longueur du texte, et le verdict porte-t-il sur le document ou sur une phrase ?
  • La confiance est-elle haute, moyenne ou basse ?
  • Quels passages ont déclenché la classification ?
  • Ces passages paraissent-ils réellement répétitifs ou stéréotypés quand vous les relisez ?
  • Un autre détecteur renvoie-t-il un signal comparable sur le même texte ?
  • Existe-t-il des traces du processus de rédaction, comme des brouillons, des notes ou un historique de versions ?
  • Le texte a-t-il été fortement retravaillé ou reformulé après sa génération ?

Ce qu’un résultat GPTZero ne peut pas établir, à lui seul : un plagiat, une faute, une intention ou l’histoire exacte d’un document. C’est une preuve portant sur des schémas dans le texte, et elle est surtout utile lorsqu’on la lit à côté du texte lui-même.

Les enseignants peuvent-ils utiliser GPTZero comme preuve d’un usage de l’IA ?

Pas comme preuve, et la documentation de GPTZero dit la même chose. Ses pages d’aide indiquent qu’aucun détecteur n’est totalement fiable, que les résultats ne doivent pas servir à sanctionner des étudiants, et qu’une classification se traite mieux comme un élément d’une évaluation plus large. L’entreprise documente aussi sa préférence d’erreur en contexte académique : elle préfère laisser passer un texte assisté par IA plutôt que d’accuser un étudiant à tort, ce qui est exactement l’inverse de ce dont une décision disciplinaire a besoin.

Quand la paternité d’un texte compte, un processus pèse plus qu’un score. Les preuves utiles comprennent l’historique de rédaction, les versions successives du document, les notes de lecture, des travaux antérieurs du même étudiant, des citations vérifiables, une discussion du contenu et ce que la consigne autorise réellement en matière d’IA. Un détecteur peut désigner des passages qui méritent une discussion. Il ne remplace pas la discussion.

Que faire si GPTZero signale votre texte ?

Si le résultat compte, traitez-le dans un ordre précis plutôt que de réécrire par réflexe.

Une séquence de relecture réutilisable
  1. 1

    Lire

    Relisez les passages signalés et jugez-les comme un texte.

  2. 2

    Situer

    Notez si la classification porte sur le document ou sur une phrase.

  3. 3

    Peser

    Regardez la catégorie de confiance, pas seulement le verdict affiché.

  4. 4

    Comparer

    Passez le même texte à un second détecteur.

  5. 5

    Justifier

    Rassemblez brouillons et historique de versions si la paternité est contestée.

  6. 6

    Réécrire

    Ne reprenez que les passages qui en ont réellement besoin.

Parfois, le signalement est justifié : structures de phrase répétées, transitions qui ne relient rien, affirmations sans exemple. Lorsqu’un passage est réellement stéréotypé, l’humaniseur AI-2-Human peut le réécrire en un brouillon plus naturel tout en conservant votre sens initial, et vous retravaillez ensuite le résultat avec votre propre voix.

Faut-il comparer GPTZero avec un autre détecteur IA ?

Oui, en particulier lorsque le résultat a des conséquences. Les détecteurs utilisent des modèles, des données d’entraînement et des seuils de décision différents, donc un même passage peut produire des résultats différents. Les études citées sur cette page sont elles-mêmes un exemple de l’importance des conditions : le même outil a obtenu des scores très différents selon les corpus et les versions.

La comparaison aide dans les deux sens. Quand deux détecteurs signalent le même passage, ce passage mérite une lecture attentive. Quand ils divergent nettement, ce désaccord indique que le texte se situe près d’une frontière de décision et que le score est fragile, ce qui vaut la peine d’être su avant de réécrire quoi que ce soit ou avant qu’une autre personne agisse sur le résultat.

Le détecteur AI-2-Human restitue sa propre lecture du texte et désigne les passages qui semblent encore générés, ce qui vous donne deux interprétations à mettre côte à côte avant de décider quoi modifier.

Avant de rendre votre texte : les points à vérifier

  • J’ai vérifié si le résultat porte sur le document ou sur une phrase.
  • J’ai tenu compte de la longueur et du type de texte analysé.
  • J’ai regardé la confiance indiquée par GPTZero, pas seulement la classification affichée.
  • J’ai relu les passages qui ont déclenché le signalement.
  • J’ai traité le résultat comme une preuve, pas comme une démonstration.
  • J’ai comparé avec un autre détecteur parce que l’enjeu le justifiait.
  • J’ai conservé mes brouillons ou mon historique de versions là où la paternité pouvait être contestée.
  • J’ai vérifié les faits et les références indépendamment de la détection IA.
  • Je n’ai réécrit que les passages qui en avaient réellement besoin.

Questions fréquentes

Sources et notes éditoriales

AI-2-Human n’est ni affilié à GPTZero ni approuvé par GPTZero. La documentation, les informations de benchmark et les recherches citées ont été consultées le 20 septembre 2026. Les modèles de détection et leurs performances peuvent évoluer.

Mis à jour le

Besoin d’un second avis ?

Comparez votre résultat GPTZero avec un autre détecteur IA.

Passez le même passage dans AI-2-Human, examinez un autre signal de détection et décidez si l’écrit a réellement besoin d’être révisé.

Voir tous les guides