Guide sul rilevamento IA

GPTZero è affidabile?

GPTZero identifica correttamente i testi generati dall’IA in molte situazioni, ma non esiste una percentuale di accuratezza unica valida per ogni testo. Il benchmark dello stesso GPTZero riporta risultati molto forti in quattro ambiti in inglese, mentre gli studi indipendenti mostrano una prestazione che varia con la versione del rilevatore, il tipo di scrittura, la lunghezza del testo e il corpus testato. Sia i falsi positivi sia i falsi negativi sono documentati. Questo rende GPTZero un segnale di rilevamento utile, ma non una prova indiscutibile di come è stato scritto un testo. Quando il risultato conta, far passare lo stesso brano nel rilevatore di AI-2-Human ti dà un secondo segnale prima di concludere qualcosa.

AI-2-HumanPubblicato 14 min di lettura
Un esempio di testo accanto ad AI-2-Human su un portatile e rapporti illustrativi di GPTZero e AI-2-Human con punteggi di rilevamento IA diversi.
Illustrazione di un secondo parere: lo stesso brano letto da due rilevatori. I punteggi mostrati sono illustrativi e non sono risultati misurati su un documento specifico.

Che cos’è GPTZero?

GPTZero è un rilevatore di testo IA. Incolli un testo o carichi un documento e il suo sistema di deep learning stima quanta parte di quel testo è stata scritta da una macchina. Restituisce una di tre classificazioni del documento (scritto interamente da una persona, interamente da un’IA o da una combinazione delle due) insieme a una categoria di affidabilità, ed evidenzia le frasi che hanno contribuito di più al risultato. GPTZero descrive anche funzioni di rilevamento aggiuntive rivolte a testi alterati con strumenti di parafrasi.

GPTZero: tecnologia di rilevamento IA

Quanto è accurato GPTZero?

Non esiste una percentuale unica di accuratezza di GPTZero valida per ogni testo. I risultati riportati dipendono dalla versione del modello del rilevatore, da come è stato costruito il benchmark, da quale scrittura umana è stata usata come controllo, da quale modello IA ha generato il testo automatico, dal genere, dalla lunghezza del testo, dal fatto che il testo sia stato modificato o parafrasato in seguito, dalla soglia di classificazione scelta da chi ha testato e dalla lingua esaminata.

Per questo la guida tiene separate due tipi di prove. Il primo è ciò che GPTZero dichiara sul proprio modello, nel proprio benchmark e con una versione di modello indicata. Il secondo è ciò che i ricercatori indipendenti hanno misurato quando hanno applicato GPTZero ai propri testi, che è una domanda diversa: hanno testato la versione disponibile allora, sul loro dataset e con una soglia che hanno scelto loro. Entrambe sono utili e nessuna sostituisce l’altra.

La risposta breve per chi ha un documento specifico è quindi condizionale: GPTZero può essere molto efficace su testi simili a quelli su cui è stato addestrato e valutato, e la sua documentazione pubblicata ammette che campioni brevi, testo IA molto modificato, generi insoliti e scrittura procedurale sono casi più difficili.

Che cosa riporta l’attuale benchmark di GPTZero

GPTZero pubblica una pagina di benchmark standardizzata che, secondo l’azienda, viene aggiornata ogni trimestre, con previsioni grezze disponibili per chi vuole riprodurre i risultati. Nella valutazione di febbraio 2026 GPTZero dichiara, come media di quattro ambiti in inglese per la versione di modello 4.3b, un tasso di falsi positivi dello 0,08%, un recall del 99,60%, una precisione del 99,93% e un’accuratezza del 99,76%. Ogni benchmark usa 1.000 testi umani e 1.000 testi generati da LLM, distribuiti in modo uniforme tra i modelli testati (250 testi per modello), e l’insieme dei modelli viene rinnovato ogni trimestre.

Le righe per ambito sono pubblicate separatamente, cosa che conta perché le medie nascondono la variazione. GPTZero dichiara il 99,85% di accuratezza su recensioni di articoli accademici (0,10% di falsi positivi), il 99,80% su scrittura creativa, il 100% sui saggi con un tasso di falsi positivi dello 0,00% e il 99,40% su recensioni di prodotti. La stessa pagina riporta i punteggi misurati per i rilevatori concorrenti sugli stessi testi, e il confronto è più equilibrato in alcuni ambiti di quanto suggerisca la media di titolo.

GPTZero: benchmark del rilevamento IA, lo standard del settore per accuratezza, trasparenza ed equità

Che cosa dice la ricerca indipendente sull’accuratezza di GPTZero

Il risultato indipendente più solido per GPTZero viene da uno studio peer-reviewed pubblicato su Acta Neurochirurgica nel 2025. I ricercatori hanno messo insieme 1.000 testi: 250 abstract e introduzioni scritti da persone, tratti da quattro riviste di neurochirurgia ad alto impatto pubblicate prima di ChatGPT, più 750 versioni dello stesso materiale generate da ChatGPT 3.5, GPT-4 e GPT-4o. I rilevatori sono stati usati tra il 1 e il 15 giugno 2024, il che data la versione di GPTZero testata. Con GPTZero il punteggio medio di probabilità IA è stato del 5,88% per i testi umani, dell’81,71% per GPT-3.5, del 96,83% per GPT-4 e del 99,58% per GPT-4o. Alla soglia scelta dai ricercatori, GPTZero ha raggiunto il 100% di sensibilità e il 99,6% di specificità.

Acta Neurochirurgica: accuratezza e limiti dei rilevatori di testi IA

È un risultato solido, e resta condizionale. Descrive un dataset accademico, in una disciplina, con determinate lunghezze di testo, rispetto a tre versioni di ChatGPT, sulla versione di GPTZero disponibile a giugno 2024 e con una soglia scelta dagli autori. Non significa che il rilevatore sia accurato al 99,6% sul tuo testo, e lo stesso articolo osserva che nessun rilevatore esaminato era affidabile in ogni situazione.

Lavori indipendenti precedenti mostrano quanto possano cambiare quelle condizioni. Uno studio preliminare pubblicato sul Journal of Korean Medical Science nel 2023 ha testato GPTZero su 20 testi generati da ChatGPT in risposta a domande mediche e 30 brani tratti da articoli medici già pubblicati. Ha riportato una sensibilità di 0,65 (intervallo di confidenza al 95% da 0,41 a 0,85), una specificità di 0,90 (0,73 a 0,98) e un’accuratezza di 0,80 (0,66 a 0,90), concludendo che GPTZero aveva un basso tasso di falsi positivi ma un alto tasso di falsi negativi: accusava raramente la scrittura umana e spesso lasciava passare quella automatica.

Journal of Korean Medical Science: prestazioni di GPTZero su testi medici generati dall’IA (2023)

La distanza tra quell’istantanea del 2023 e lo studio del 2025 non è una contraddizione né la prova che un gruppo sia stato superficiale. È l’esempio più chiaro di questa pagina del perché l’accuratezza di un rilevatore vada letta insieme alla sua versione e al suo dataset.

GPTZero può segnalare la scrittura umana come IA?

Sì. Un falso positivo è scrittura umana classificata come IA o mista, e GPTZero ammette che questi casi esistono. La sua documentazione di supporto spiega che l’accuratezza aumenta con la quantità di testo inviato, che il classificatore è addestrato soprattutto su prosa inglese scritta da adulti e che a volte può segnalare come scritti dall’IA altri testi generati da macchine o molto procedurali. Un estratto breve, un passaggio schematico o un testo lontano da quella distribuzione di addestramento sono i punti in cui questo rischio si concentra.

GPTZero: quali sono i limiti del suo classificatore IA?

La documentazione pubblica di GPTZero va oltre quella della maggior parte dei fornitori sulle conseguenze di questo rischio. Afferma che i risultati non vanno usati per punire gli studenti, raccomanda di trattare una classificazione come un componente di una valutazione più ampia e sostiene che il rilevatore debba servire come punto di partenza di una conversazione e non come verdetto finale. In ambito accademico l’azienda dichiara anche di preferire lasciar passare un uso dell’IA piuttosto che accusare una persona: la documentazione dell’API sconsiglia di aumentare la sensibilità del rilevatore per usi accademici, perché lì i falsi negativi sono preferibili ai falsi positivi.

GPTZero può lasciar passare testi generati dall’IA?

Sì, e il compromesso scelto dal fornitore lo rende esplicito: un falso negativo è testo generato dall’IA classificato come umano, e GPTZero afferma che in un contesto accademico preferisce sbagliare in quella direzione. Lo studio medico del 2023 ha misurato il costo pratico della stessa preferenza, con una sensibilità di 0,65 sul suo dataset: circa un terzo dei testi scritti dalla macchina non è stato segnalato.

Diversi fattori spingono un passaggio generato verso la classificazione umana. Il testo generato e poi riscritto a fondo a mano non assomiglia più a un output grezzo del modello, e la documentazione di GPTZero osserva che il classificatore non è stato addestrato a identificare testo generato dall’IA dopo modifiche consistenti. Gli strumenti di parafrasi, i modelli poco noti, i generi insoliti, i campioni brevi e le modifiche deliberate contro il rilevatore stanno nella stessa zona. L’azienda aggiorna i modelli per questi casi, ed è anche per questo che un risultato di una versione non vale automaticamente per la successiva.

Perché l’accuratezza di GPTZero varia

Quando due studi riportano numeri molto diversi per lo stesso strumento, la spiegazione di solito sta nel disegno del test e non nello strumento. Le variabili qui sotto coprono gran parte della differenza.

  • Versione del modello: il rilevatore testato nel 2023, quello testato a giugno 2024 e il modello attuale sono sistemi diversi, e GPTZero documenta lei stessa i cambi di versione.
  • Costruzione del benchmark: quali testi sono stati scelti, come sono stati richiesti i testi IA e se i campioni sono equilibrati tra i generi determinano il risultato.
  • Scrittura umana usata come controllo: la prosa accademica precedente a ChatGPT, i saggi degli studenti e la scrittura del web sono distribuzioni diverse, e un classificatore può sembrare ottimo su una e debole su un’altra.
  • Modello generatore: lo studio di Acta Neurochirurgica ha misurato punteggi medi di GPTZero che salivano dall’81,71% con GPT-3.5 al 99,58% con GPT-4o, quindi lo stesso strumento legge modelli diversi in modo diverso.
  • Genere e lingua: GPTZero dichiara di rendere meglio su testi lunghi e prosa in inglese, dove si trova la maggior parte dei suoi dati di addestramento.
  • Lunghezza del testo: più testo significa più prove, ed è per questo che i risultati a livello di documento sono più affidabili di quelli a livello di frase.
  • Modifica e parafrasi: una riscrittura umana consistente o una parafrasi automatica allontanano un testo dagli schemi che il classificatore ha appreso.
  • Soglia: ogni rilevatore converte i punteggi in decisioni a una certa soglia, e spostarla scambia falsi positivi e falsi negativi. Lo studio di Acta indica la propria soglia, ed è una delle ragioni per cui i suoi numeri sono precisi e non universali.
  • Che cosa conta come corretto: gli studi trattano in modo diverso le classificazioni miste, il testo IA parziale e i documenti disomogenei, quindi due articoli possono misurare lo stesso strumento e intendere cose diverse per accuratezza.

La lunghezza del testo influisce sull’accuratezza di GPTZero?

Sì, e GPTZero lo dice direttamente. La sua documentazione afferma che l’accuratezza migliora con la quantità di testo inviato e che le classificazioni a livello di documento sono in genere più affidabili di quelle a livello di paragrafo, che a loro volta sono più affidabili di quelle a livello di frase.

Vale la pena ricordare la conseguenza pratica la prossima volta che vedi una frase evidenziata. Una singola frase evidenziata è un segnale debole da sola, perché è l’elemento che porta meno prove tra tutto ciò che il rilevatore esamina. Una classificazione coerente a livello di documento su un saggio completo, dove gli stessi schemi compaiono in più paragrafi, merita più peso. Se il testo che controlli è breve, considera il risultato provvisorio e controllane una parte maggiore.

Come interpretare un risultato di GPTZero

GPTZero non restituisce un solo numero, e leggere il suo output come “l’X per cento di questo saggio è stato scritto da un’IA” è un fraintendimento. Il sistema restituisce una classificazione (solo umano, misto o solo IA), una probabilità per ciascuna di queste classi e una categoria di affidabilità alta, media o bassa. La probabilità della classe prevista è descritta dalla documentazione di GPTZero come la probabilità che il rilevatore abbia ragione in quella previsione: un valore del 90% significa che su documenti simili ha ragione circa nel 90% dei casi.

GPTZero: come trasformo le probabilità dell’API in risultati?

GPTZero pubblica anche che cosa significano in pratica le sue categorie di affidabilità: con affidabilità alta dichiara che il 99,1% degli articoli umani viene classificato come umano e che il 98,4% degli articoli IA viene classificato come IA. Un risultato con affidabilità media o bassa è, per costruzione, un’affermazione più morbida, e la documentazione descrive soglie che puoi regolare per scambiare sensibilità e falsi positivi nel tuo caso d’uso.

Domande che vale la pena porsi prima di agire in base a un risultato:

  • Quanto è lungo il testo e il verdetto è a livello di documento o di frase?
  • L’affidabilità è alta, media o bassa?
  • Quali passaggi hanno innescato la classificazione?
  • Leggendo quei passaggi, la scrittura sembra davvero ripetitiva o schematica?
  • Un altro rilevatore restituisce un segnale simile sullo stesso testo?
  • Ci sono prove del processo di scrittura, come bozze, appunti o una cronologia delle versioni?
  • Il testo è stato modificato o parafrasato in modo sostanziale dopo la generazione?

Ciò che un risultato di GPTZero non può stabilire da solo sono il plagio, la cattiva condotta, l’intenzione o la storia esatta di un documento. È una prova su schemi nel testo, ed è più utile quando si legge accanto al testo stesso.

Gli insegnanti dovrebbero usare GPTZero come prova dell’uso dell’IA?

Non come prova, e la documentazione di GPTZero dice lo stesso. Le sue pagine di supporto affermano che nessun rilevatore è del tutto accurato, che i risultati non vanno usati per punire gli studenti e che una classificazione va trattata come un elemento di una valutazione più ampia. L’azienda documenta anche la sua preferenza di errore in ambito accademico: preferisce lasciar passare una scrittura assistita dall’IA piuttosto che accusare uno studente a torto, che è esattamente l’opposto di ciò che serve a una decisione disciplinare.

Quando la paternità conta, un processo è più solido di un punteggio. Prove utili sono la cronologia di redazione, le revisioni del documento, gli appunti sulle fonti, lavori precedenti dello stesso studente, citazioni verificabili, una discussione sul materiale e ciò che la politica sull’IA della consegna permette davvero. Un rilevatore può indicare passaggi che meritano una conversazione. Non può sostituire quella conversazione.

Che cosa fare se GPTZero segnala il tuo testo

Se il risultato conta, affrontalo in un ordine fisso invece di riscrivere d’istinto.

Una sequenza di revisione che puoi ripetere
  1. 1

    Leggi

    Leggi i passaggi segnalati e giudicali come scrittura.

  2. 2

    Controlla il livello

    Annota se la classificazione è a livello di documento o di frase.

  3. 3

    Pesa l’affidabilità

    Guarda la categoria di affidabilità, non solo il risultato di titolo.

  4. 4

    Confronta

    Fai passare lo stesso testo in un secondo rilevatore.

  5. 5

    Prove

    Raccogli bozze e cronologia delle versioni se la paternità è contestata.

  6. 6

    Rivedi

    Riscrivi solo i passaggi che hanno davvero bisogno di migliorare.

A volte la preoccupazione è giustificata: forme di frase ripetute, transizioni che non collegano nulla, affermazioni senza alcun esempio dietro. Quando un passaggio è davvero schematico, l’Humanizer di AI-2-Human può riscriverlo in una bozza più naturale mantenendo al centro il significato che intendi, e poi modifichi il risultato con la tua voce.

Dovresti confrontare GPTZero con un altro rilevatore IA?

Sì, soprattutto quando il risultato ha conseguenze. I rilevatori usano modelli diversi, dati di addestramento diversi e soglie di decisione diverse, quindi lo stesso passaggio può dare risultati differenti. Gli studi citati in questa pagina sono essi stessi un esempio di quanto contino le condizioni: lo stesso strumento ha ottenuto punteggi molto diversi tra dataset e versioni.

Il confronto aiuta in entrambe le direzioni. Quando due rilevatori evidenziano lo stesso passaggio, quel passaggio merita uno sguardo attento. Quando divergono nettamente, la divergenza dice che il testo è vicino a una soglia di decisione e che il punteggio è morbido: è utile saperlo prima di riscrivere qualcosa o prima che qualcun altro agisca in base al risultato.

Il rilevatore di AI-2-Human comunica la propria lettura del testo e indica i passaggi che sembrano ancora generati, offrendoti due interpretazioni da mettere accanto prima di decidere che cosa cambiare.

Prima di consegnare: una checklist pratica

  • Ho controllato se il risultato è a livello di documento o di frase.
  • Ho considerato la lunghezza e il tipo di testo controllato.
  • Ho guardato l’affidabilità di GPTZero, non solo la classificazione di titolo.
  • Ho letto i passaggi che hanno destato preoccupazione.
  • Ho trattato il risultato come una prova e non come una dimostrazione.
  • Ho confrontato un altro rilevatore perché il risultato conta.
  • Ho conservato bozze o cronologia delle versioni dove la paternità potrebbe essere contestata.
  • Ho verificato fatti e citazioni separatamente dal rilevamento IA.
  • Ho rivisto solo i passaggi che avevano davvero bisogno di migliorare.

Domande frequenti

Fonti e note editoriali

AI-2-Human non è affiliata a GPTZero né sostenuta da GPTZero. La documentazione, le informazioni sul benchmark e la ricerca citata di GPTZero sono state consultate il 20 settembre 2026. I modelli di rilevamento e le loro prestazioni possono cambiare nel tempo.

Aggiornato

Vuoi un secondo parere?

Confronta il tuo risultato GPTZero con un altro rilevatore IA.

Fai passare lo stesso brano in AI-2-Human, esamina un altro segnale di rilevamento e decidi se il testo ha davvero bisogno di una revisione.

Vedi tutte le guide