Guide sul rilevamento IA
GPTZero è affidabile?
GPTZero identifica correttamente i testi generati dall’IA in molte situazioni, ma non esiste una percentuale di accuratezza unica valida per ogni testo. Il benchmark dello stesso GPTZero riporta risultati molto forti in quattro ambiti in inglese, mentre gli studi indipendenti mostrano una prestazione che varia con la versione del rilevatore, il tipo di scrittura, la lunghezza del testo e il corpus testato. Sia i falsi positivi sia i falsi negativi sono documentati. Questo rende GPTZero un segnale di rilevamento utile, ma non una prova indiscutibile di come è stato scritto un testo. Quando il risultato conta, far passare lo stesso brano nel rilevatore di AI-2-Human ti dà un secondo segnale prima di concludere qualcosa.

Che cos’è GPTZero?
GPTZero è un rilevatore di testo IA. Incolli un testo o carichi un documento e il suo sistema di deep learning stima quanta parte di quel testo è stata scritta da una macchina. Restituisce una di tre classificazioni del documento (scritto interamente da una persona, interamente da un’IA o da una combinazione delle due) insieme a una categoria di affidabilità, ed evidenzia le frasi che hanno contribuito di più al risultato. GPTZero descrive anche funzioni di rilevamento aggiuntive rivolte a testi alterati con strumenti di parafrasi.
Quanto è accurato GPTZero?
Non esiste una percentuale unica di accuratezza di GPTZero valida per ogni testo. I risultati riportati dipendono dalla versione del modello del rilevatore, da come è stato costruito il benchmark, da quale scrittura umana è stata usata come controllo, da quale modello IA ha generato il testo automatico, dal genere, dalla lunghezza del testo, dal fatto che il testo sia stato modificato o parafrasato in seguito, dalla soglia di classificazione scelta da chi ha testato e dalla lingua esaminata.
Per questo la guida tiene separate due tipi di prove. Il primo è ciò che GPTZero dichiara sul proprio modello, nel proprio benchmark e con una versione di modello indicata. Il secondo è ciò che i ricercatori indipendenti hanno misurato quando hanno applicato GPTZero ai propri testi, che è una domanda diversa: hanno testato la versione disponibile allora, sul loro dataset e con una soglia che hanno scelto loro. Entrambe sono utili e nessuna sostituisce l’altra.
La risposta breve per chi ha un documento specifico è quindi condizionale: GPTZero può essere molto efficace su testi simili a quelli su cui è stato addestrato e valutato, e la sua documentazione pubblicata ammette che campioni brevi, testo IA molto modificato, generi insoliti e scrittura procedurale sono casi più difficili.
Che cosa riporta l’attuale benchmark di GPTZero
GPTZero pubblica una pagina di benchmark standardizzata che, secondo l’azienda, viene aggiornata ogni trimestre, con previsioni grezze disponibili per chi vuole riprodurre i risultati. Nella valutazione di febbraio 2026 GPTZero dichiara, come media di quattro ambiti in inglese per la versione di modello 4.3b, un tasso di falsi positivi dello 0,08%, un recall del 99,60%, una precisione del 99,93% e un’accuratezza del 99,76%. Ogni benchmark usa 1.000 testi umani e 1.000 testi generati da LLM, distribuiti in modo uniforme tra i modelli testati (250 testi per modello), e l’insieme dei modelli viene rinnovato ogni trimestre.
Le righe per ambito sono pubblicate separatamente, cosa che conta perché le medie nascondono la variazione. GPTZero dichiara il 99,85% di accuratezza su recensioni di articoli accademici (0,10% di falsi positivi), il 99,80% su scrittura creativa, il 100% sui saggi con un tasso di falsi positivi dello 0,00% e il 99,40% su recensioni di prodotti. La stessa pagina riporta i punteggi misurati per i rilevatori concorrenti sugli stessi testi, e il confronto è più equilibrato in alcuni ambiti di quanto suggerisca la media di titolo.
Che cosa dice la ricerca indipendente sull’accuratezza di GPTZero
Il risultato indipendente più solido per GPTZero viene da uno studio peer-reviewed pubblicato su Acta Neurochirurgica nel 2025. I ricercatori hanno messo insieme 1.000 testi: 250 abstract e introduzioni scritti da persone, tratti da quattro riviste di neurochirurgia ad alto impatto pubblicate prima di ChatGPT, più 750 versioni dello stesso materiale generate da ChatGPT 3.5, GPT-4 e GPT-4o. I rilevatori sono stati usati tra il 1 e il 15 giugno 2024, il che data la versione di GPTZero testata. Con GPTZero il punteggio medio di probabilità IA è stato del 5,88% per i testi umani, dell’81,71% per GPT-3.5, del 96,83% per GPT-4 e del 99,58% per GPT-4o. Alla soglia scelta dai ricercatori, GPTZero ha raggiunto il 100% di sensibilità e il 99,6% di specificità.
Acta Neurochirurgica: accuratezza e limiti dei rilevatori di testi IA
È un risultato solido, e resta condizionale. Descrive un dataset accademico, in una disciplina, con determinate lunghezze di testo, rispetto a tre versioni di ChatGPT, sulla versione di GPTZero disponibile a giugno 2024 e con una soglia scelta dagli autori. Non significa che il rilevatore sia accurato al 99,6% sul tuo testo, e lo stesso articolo osserva che nessun rilevatore esaminato era affidabile in ogni situazione.
Lavori indipendenti precedenti mostrano quanto possano cambiare quelle condizioni. Uno studio preliminare pubblicato sul Journal of Korean Medical Science nel 2023 ha testato GPTZero su 20 testi generati da ChatGPT in risposta a domande mediche e 30 brani tratti da articoli medici già pubblicati. Ha riportato una sensibilità di 0,65 (intervallo di confidenza al 95% da 0,41 a 0,85), una specificità di 0,90 (0,73 a 0,98) e un’accuratezza di 0,80 (0,66 a 0,90), concludendo che GPTZero aveva un basso tasso di falsi positivi ma un alto tasso di falsi negativi: accusava raramente la scrittura umana e spesso lasciava passare quella automatica.
Journal of Korean Medical Science: prestazioni di GPTZero su testi medici generati dall’IA (2023)
La distanza tra quell’istantanea del 2023 e lo studio del 2025 non è una contraddizione né la prova che un gruppo sia stato superficiale. È l’esempio più chiaro di questa pagina del perché l’accuratezza di un rilevatore vada letta insieme alla sua versione e al suo dataset.
GPTZero può segnalare la scrittura umana come IA?
Sì. Un falso positivo è scrittura umana classificata come IA o mista, e GPTZero ammette che questi casi esistono. La sua documentazione di supporto spiega che l’accuratezza aumenta con la quantità di testo inviato, che il classificatore è addestrato soprattutto su prosa inglese scritta da adulti e che a volte può segnalare come scritti dall’IA altri testi generati da macchine o molto procedurali. Un estratto breve, un passaggio schematico o un testo lontano da quella distribuzione di addestramento sono i punti in cui questo rischio si concentra.
GPTZero: quali sono i limiti del suo classificatore IA?
La documentazione pubblica di GPTZero va oltre quella della maggior parte dei fornitori sulle conseguenze di questo rischio. Afferma che i risultati non vanno usati per punire gli studenti, raccomanda di trattare una classificazione come un componente di una valutazione più ampia e sostiene che il rilevatore debba servire come punto di partenza di una conversazione e non come verdetto finale. In ambito accademico l’azienda dichiara anche di preferire lasciar passare un uso dell’IA piuttosto che accusare una persona: la documentazione dell’API sconsiglia di aumentare la sensibilità del rilevatore per usi accademici, perché lì i falsi negativi sono preferibili ai falsi positivi.
GPTZero può lasciar passare testi generati dall’IA?
Sì, e il compromesso scelto dal fornitore lo rende esplicito: un falso negativo è testo generato dall’IA classificato come umano, e GPTZero afferma che in un contesto accademico preferisce sbagliare in quella direzione. Lo studio medico del 2023 ha misurato il costo pratico della stessa preferenza, con una sensibilità di 0,65 sul suo dataset: circa un terzo dei testi scritti dalla macchina non è stato segnalato.
Diversi fattori spingono un passaggio generato verso la classificazione umana. Il testo generato e poi riscritto a fondo a mano non assomiglia più a un output grezzo del modello, e la documentazione di GPTZero osserva che il classificatore non è stato addestrato a identificare testo generato dall’IA dopo modifiche consistenti. Gli strumenti di parafrasi, i modelli poco noti, i generi insoliti, i campioni brevi e le modifiche deliberate contro il rilevatore stanno nella stessa zona. L’azienda aggiorna i modelli per questi casi, ed è anche per questo che un risultato di una versione non vale automaticamente per la successiva.
Perché l’accuratezza di GPTZero varia
Quando due studi riportano numeri molto diversi per lo stesso strumento, la spiegazione di solito sta nel disegno del test e non nello strumento. Le variabili qui sotto coprono gran parte della differenza.
- Versione del modello: il rilevatore testato nel 2023, quello testato a giugno 2024 e il modello attuale sono sistemi diversi, e GPTZero documenta lei stessa i cambi di versione.
- Costruzione del benchmark: quali testi sono stati scelti, come sono stati richiesti i testi IA e se i campioni sono equilibrati tra i generi determinano il risultato.
- Scrittura umana usata come controllo: la prosa accademica precedente a ChatGPT, i saggi degli studenti e la scrittura del web sono distribuzioni diverse, e un classificatore può sembrare ottimo su una e debole su un’altra.
- Modello generatore: lo studio di Acta Neurochirurgica ha misurato punteggi medi di GPTZero che salivano dall’81,71% con GPT-3.5 al 99,58% con GPT-4o, quindi lo stesso strumento legge modelli diversi in modo diverso.
- Genere e lingua: GPTZero dichiara di rendere meglio su testi lunghi e prosa in inglese, dove si trova la maggior parte dei suoi dati di addestramento.
- Lunghezza del testo: più testo significa più prove, ed è per questo che i risultati a livello di documento sono più affidabili di quelli a livello di frase.
- Modifica e parafrasi: una riscrittura umana consistente o una parafrasi automatica allontanano un testo dagli schemi che il classificatore ha appreso.
- Soglia: ogni rilevatore converte i punteggi in decisioni a una certa soglia, e spostarla scambia falsi positivi e falsi negativi. Lo studio di Acta indica la propria soglia, ed è una delle ragioni per cui i suoi numeri sono precisi e non universali.
- Che cosa conta come corretto: gli studi trattano in modo diverso le classificazioni miste, il testo IA parziale e i documenti disomogenei, quindi due articoli possono misurare lo stesso strumento e intendere cose diverse per accuratezza.
La lunghezza del testo influisce sull’accuratezza di GPTZero?
Sì, e GPTZero lo dice direttamente. La sua documentazione afferma che l’accuratezza migliora con la quantità di testo inviato e che le classificazioni a livello di documento sono in genere più affidabili di quelle a livello di paragrafo, che a loro volta sono più affidabili di quelle a livello di frase.
Vale la pena ricordare la conseguenza pratica la prossima volta che vedi una frase evidenziata. Una singola frase evidenziata è un segnale debole da sola, perché è l’elemento che porta meno prove tra tutto ciò che il rilevatore esamina. Una classificazione coerente a livello di documento su un saggio completo, dove gli stessi schemi compaiono in più paragrafi, merita più peso. Se il testo che controlli è breve, considera il risultato provvisorio e controllane una parte maggiore.
Come interpretare un risultato di GPTZero
GPTZero non restituisce un solo numero, e leggere il suo output come “l’X per cento di questo saggio è stato scritto da un’IA” è un fraintendimento. Il sistema restituisce una classificazione (solo umano, misto o solo IA), una probabilità per ciascuna di queste classi e una categoria di affidabilità alta, media o bassa. La probabilità della classe prevista è descritta dalla documentazione di GPTZero come la probabilità che il rilevatore abbia ragione in quella previsione: un valore del 90% significa che su documenti simili ha ragione circa nel 90% dei casi.
GPTZero: come trasformo le probabilità dell’API in risultati?
GPTZero pubblica anche che cosa significano in pratica le sue categorie di affidabilità: con affidabilità alta dichiara che il 99,1% degli articoli umani viene classificato come umano e che il 98,4% degli articoli IA viene classificato come IA. Un risultato con affidabilità media o bassa è, per costruzione, un’affermazione più morbida, e la documentazione descrive soglie che puoi regolare per scambiare sensibilità e falsi positivi nel tuo caso d’uso.
Domande che vale la pena porsi prima di agire in base a un risultato:
- Quanto è lungo il testo e il verdetto è a livello di documento o di frase?
- L’affidabilità è alta, media o bassa?
- Quali passaggi hanno innescato la classificazione?
- Leggendo quei passaggi, la scrittura sembra davvero ripetitiva o schematica?
- Un altro rilevatore restituisce un segnale simile sullo stesso testo?
- Ci sono prove del processo di scrittura, come bozze, appunti o una cronologia delle versioni?
- Il testo è stato modificato o parafrasato in modo sostanziale dopo la generazione?
Ciò che un risultato di GPTZero non può stabilire da solo sono il plagio, la cattiva condotta, l’intenzione o la storia esatta di un documento. È una prova su schemi nel testo, ed è più utile quando si legge accanto al testo stesso.
Gli insegnanti dovrebbero usare GPTZero come prova dell’uso dell’IA?
Non come prova, e la documentazione di GPTZero dice lo stesso. Le sue pagine di supporto affermano che nessun rilevatore è del tutto accurato, che i risultati non vanno usati per punire gli studenti e che una classificazione va trattata come un elemento di una valutazione più ampia. L’azienda documenta anche la sua preferenza di errore in ambito accademico: preferisce lasciar passare una scrittura assistita dall’IA piuttosto che accusare uno studente a torto, che è esattamente l’opposto di ciò che serve a una decisione disciplinare.
Quando la paternità conta, un processo è più solido di un punteggio. Prove utili sono la cronologia di redazione, le revisioni del documento, gli appunti sulle fonti, lavori precedenti dello stesso studente, citazioni verificabili, una discussione sul materiale e ciò che la politica sull’IA della consegna permette davvero. Un rilevatore può indicare passaggi che meritano una conversazione. Non può sostituire quella conversazione.
Che cosa fare se GPTZero segnala il tuo testo
Se il risultato conta, affrontalo in un ordine fisso invece di riscrivere d’istinto.
- 1
Leggi
Leggi i passaggi segnalati e giudicali come scrittura.
- 2
Controlla il livello
Annota se la classificazione è a livello di documento o di frase.
- 3
Pesa l’affidabilità
Guarda la categoria di affidabilità, non solo il risultato di titolo.
- 4
Confronta
Fai passare lo stesso testo in un secondo rilevatore.
- 5
Prove
Raccogli bozze e cronologia delle versioni se la paternità è contestata.
- 6
Rivedi
Riscrivi solo i passaggi che hanno davvero bisogno di migliorare.
A volte la preoccupazione è giustificata: forme di frase ripetute, transizioni che non collegano nulla, affermazioni senza alcun esempio dietro. Quando un passaggio è davvero schematico, l’Humanizer di AI-2-Human può riscriverlo in una bozza più naturale mantenendo al centro il significato che intendi, e poi modifichi il risultato con la tua voce.
Dovresti confrontare GPTZero con un altro rilevatore IA?
Sì, soprattutto quando il risultato ha conseguenze. I rilevatori usano modelli diversi, dati di addestramento diversi e soglie di decisione diverse, quindi lo stesso passaggio può dare risultati differenti. Gli studi citati in questa pagina sono essi stessi un esempio di quanto contino le condizioni: lo stesso strumento ha ottenuto punteggi molto diversi tra dataset e versioni.
Il confronto aiuta in entrambe le direzioni. Quando due rilevatori evidenziano lo stesso passaggio, quel passaggio merita uno sguardo attento. Quando divergono nettamente, la divergenza dice che il testo è vicino a una soglia di decisione e che il punteggio è morbido: è utile saperlo prima di riscrivere qualcosa o prima che qualcun altro agisca in base al risultato.
Il rilevatore di AI-2-Human comunica la propria lettura del testo e indica i passaggi che sembrano ancora generati, offrendoti due interpretazioni da mettere accanto prima di decidere che cosa cambiare.
Prima di consegnare: una checklist pratica
- Ho controllato se il risultato è a livello di documento o di frase.
- Ho considerato la lunghezza e il tipo di testo controllato.
- Ho guardato l’affidabilità di GPTZero, non solo la classificazione di titolo.
- Ho letto i passaggi che hanno destato preoccupazione.
- Ho trattato il risultato come una prova e non come una dimostrazione.
- Ho confrontato un altro rilevatore perché il risultato conta.
- Ho conservato bozze o cronologia delle versioni dove la paternità potrebbe essere contestata.
- Ho verificato fatti e citazioni separatamente dal rilevamento IA.
- Ho rivisto solo i passaggi che avevano davvero bisogno di migliorare.
Domande frequenti
GPTZero ottiene risultati molto forti nei propri benchmark e in almeno un dataset accademico indipendente, ma non esiste una percentuale universale di accuratezza per ogni tipo di testo. I risultati riportati cambiano con la versione del rilevatore, il tipo di scrittura, la lunghezza del testo e il dataset, e sia i falsi positivi sia i falsi negativi sono documentati. Conviene trattare un risultato come un segnale e non come una prova.
Dipende dal test, ed è per questo che la risposta utile è un confronto e non un numero. Il benchmark di GPTZero di febbraio 2026 dichiara un’accuratezza media del 99,76% con un tasso di falsi positivi dello 0,08% in quattro ambiti in inglese per il modello 4.3b. Uno studio indipendente del 2024 su 1.000 testi accademici ha misurato il 100% di sensibilità e il 99,6% di specificità alla propria soglia. Uno studio medico preliminare del 2023 ha dichiarato l’80% di accuratezza e il 65% di sensibilità su una versione precedente. Stesso strumento, versioni e condizioni diverse.
GPTZero dichiara un tasso medio di falsi positivi dello 0,08% nel proprio benchmark di febbraio 2026 e dello 0,00% nell’ambito dedicato ai saggi. Gli studi indipendenti collocano il rischio in modo diverso a seconda del dataset e della soglia, e la documentazione di supporto di GPTZero ammette che la scrittura umana può essere classificata come IA, motivo per cui sconsiglia di usare una classificazione come unica base per una decisione su uno studente.
Sì, in entrambe le direzioni. La documentazione di GPTZero ammette falsi positivi e falsi negativi, osserva che nessun rilevatore è del tutto accurato e afferma che i risultati non vanno usati per punire gli studenti. Studi indipendenti hanno misurato entrambi i tipi di errore su dataset reali.
Sì. GPTZero ammette l’esistenza di casi limite, e la documentazione spiega che l’accuratezza migliora con più testo e che il classificatore è addestrato soprattutto su prosa inglese scritta da adulti. Gli estratti brevi, la scrittura schematica e il testo molto procedurale sono i punti in cui un falso positivo è più probabile.
Una prosa formale, molto rifinita o ripetitiva può assomigliare agli schemi che il classificatore associa alla scrittura automatica, e un campione breve gli dà poco su cui lavorare. L’indicazione dello stesso GPTZero è di usare il risultato come un elemento di una valutazione più ampia. Se un passaggio è davvero ripetitivo, migliorarlo aiuta; se è soltanto formale, la classificazione dice più dei limiti del rilevatore che della tua scrittura.
Controlla con il rilevatore IA →Sì. Un falso negativo è testo generato dall’IA classificato come umano, e GPTZero afferma che in uso accademico preferisce quell’errore a un’accusa falsa. Lo studio medico del 2023 ha misurato il costo pratico con una sensibilità di 0,65 sul suo dataset. Una modifica umana consistente, gli strumenti di parafrasi e i modelli poco noti rendono più difficile segnalare un passaggio generato.
Nel benchmark di GPTZero di febbraio 2026 l’ambito dei saggi è il più forte dei quattro, con il 100% di accuratezza e lo 0,00% di falsi positivi per il modello 4.3b. È un risultato dichiarato dall’azienda sul proprio dataset di saggi, quindi descrive quel benchmark e non tutti i saggi. I risultati indipendenti sulla prosa accademica sono solidi ma variano con la versione e la soglia usate.
Meno che sui testi lunghi, secondo quanto dichiara GPTZero stessa. La sua documentazione afferma che l’accuratezza migliora con la quantità di testo inviato e che le classificazioni a livello di documento sono più affidabili di quelle a livello di paragrafo, che a loro volta lo sono più di quelle a livello di frase. Una frase evidenziata da sola è un segnale debole.
GPTZero è costruito per classificare testi di diverse famiglie di modelli linguistici, e lo studio di Acta Neurochirurgica ha misurato punteggi medi di probabilità IA di GPTZero che salivano dall’81,71% con GPT-3.5 al 96,83% con GPT-4 e al 99,58% con GPT-4o. Questo non significa che ogni passaggio di ChatGPT venga segnalato, né che un passaggio segnalato provi che è stato usato ChatGPT.
Nei dataset citati in questa serie le metriche dichiarate di GPTZero erano superiori a quelle di ZeroGPT, tra cui il 100% contro il 94,4% di sensibilità nello studio accademico del 2024 e il 97,22% contro il 64,35% di accuratezza in uno studio del 2025 su abstract scientifici. È un risultato su quei test e non una classifica permanente: i prodotti usano sistemi diversi e benchmark, soglie e versioni cambiano. Conviene confrontare sul proprio testo invece di dare per scontato un ordine.
Sì, ed è prevedibile. Modelli, dati di addestramento e soglie diversi fanno sì che due strumenti possano leggere lo stesso passaggio in modo differente. La pagina di benchmark di GPTZero riporta i confronti che ha eseguito con altri rilevatori, e i margini cambiano a seconda dell’ambito, il che illustra bene quanto il dataset condizioni il risultato.
Non come unica prova. La documentazione di GPTZero raccomanda di usare il classificatore come un componente di una valutazione più ampia e afferma che i risultati non vanno usati per punire gli studenti. Un processo praticabile combina il segnale di un rilevatore con la cronologia di redazione, i registri di revisione, gli appunti sulle fonti, i lavori precedenti dello stesso studente e una conversazione sul materiale.
Leggi tu stesso i passaggi segnalati, controlla se la classificazione è a livello di documento o di frase, guarda la categoria di affidabilità, confronta con un altro rilevatore e raccogli le tue bozze e la cronologia delle versioni. Poi rivedi solo i passaggi che si leggono davvero come schematici. AI-2-Human può fornire un secondo segnale di rilevamento, e l’Humanizer può occuparsi della riscrittura se un passaggio ne ha davvero bisogno.
Sì. Il rilevatore di AI-2-Human offre un altro segnale di rilevamento sullo stesso testo e indica i passaggi che sembrano generati, così puoi mettere due letture una accanto all’altra. Comunica la propria interpretazione e non una copia del modello di GPTZero, ed è questo che rende utile il confronto.
Avvia il rilevatore IA →Uno strumento di riscrittura cambia il testo, e un testo diverso può essere classificato diversamente, ma nessuno strumento può promettere un risultato specifico: rilevatori e soglie cambiano di continuo, e GPTZero aggiorna i suoi modelli. L’approccio affidabile è migliorare la scrittura che ne ha davvero bisogno, poi controllare di nuovo e confrontare. AI-2-Human riscrive passaggi ripetitivi e schematici in una versione più naturale mantenendo il tuo significato.
Umanizza testo IA →Fonti e note editoriali
- GPTZero: tecnologia di rilevamento IA (in inglese)
- GPTZero: benchmark del rilevamento IA, lo standard del settore per accuratezza, trasparenza ed equità (in inglese)
- GPTZero: quali sono i limiti del suo classificatore IA? (in inglese)
- GPTZero: come trasformo le probabilità dell’API in risultati? (in inglese)
- Acta Neurochirurgica: accuratezza e limiti dei rilevatori di testi IA (in inglese)
- Journal of Korean Medical Science: prestazioni di GPTZero su testi medici generati dall’IA, 2023 (in inglese)
AI-2-Human non è affiliata a GPTZero né sostenuta da GPTZero. La documentazione, le informazioni sul benchmark e la ricerca citata di GPTZero sono state consultate il 20 settembre 2026. I modelli di rilevamento e le loro prestazioni possono cambiare nel tempo.
Aggiornato


