Guias de deteção de IA
O GPTZero é fiável?
O GPTZero identifica corretamente texto gerado por IA em muitas situações, mas não existe uma percentagem única de precisão que valha para qualquer texto. O benchmark do próprio GPTZero declara resultados muito fortes em quatro domínios em inglês, enquanto os estudos independentes mostram um desempenho que varia com a versão do detetor, o tipo de escrita, o comprimento do texto e o corpus testado. Há falsos positivos e falsos negativos documentados. Isso faz do GPTZero um sinal de deteção útil, mas não uma prova indiscutível de como um texto foi escrito. Quando o resultado importa, passar a mesma passagem pelo Detetor do AI-2-Human dá-te outro sinal antes de concluíres seja o que for.

O que é o GPTZero?
O GPTZero é um detetor de texto de IA. Colas um texto ou carregas um documento e o seu sistema de aprendizagem profunda estima que parte desse texto foi escrita por uma máquina. Devolve uma de três classificações do documento (escrito inteiramente por uma pessoa, inteiramente por uma IA ou por uma mistura de ambas) juntamente com uma categoria de confiança, e destaca as frases que mais contribuíram para o resultado. O GPTZero descreve também capacidades adicionais de deteção dirigidas a texto alterado com ferramentas de paráfrase.
Qual é a precisão do GPTZero?
Não existe uma percentagem única de precisão do GPTZero que valha para qualquer texto. Os resultados declarados dependem da versão do modelo do detetor, de como o benchmark foi construído, que escrita humana foi usada como controlo, que modelo de IA gerou o texto automático, do género, do comprimento do texto, de o texto ter sido editado ou parafraseado depois, do limiar de classificação escolhido por quem testou e do idioma avaliado.
É por isso que este guia mantém separadas duas classes de provas. A primeira é o que o GPTZero declara sobre o seu próprio modelo, no seu próprio benchmark e com uma versão de modelo indicada. A segunda é o que investigadores independentes mediram quando passaram o GPTZero pelos seus próprios textos, que é outra pergunta: testaram a versão disponível na altura, no seu corpus e com um limiar que escolheram. Ambas são úteis e nenhuma substitui a outra.
A resposta curta para quem tem um documento concreto é, por isso, condicional: o GPTZero pode ser muito eficaz com escrita semelhante àquela com que foi treinado e avaliado, e a sua documentação publicada reconhece que as amostras curtas, o texto de IA muito modificado, os géneros pouco habituais e a escrita procedimental são casos mais difíceis.
O que declara o benchmark atual do GPTZero
O GPTZero publica uma página de avaliação estandardizada que, segundo indica, é atualizada trimestralmente, com previsões em bruto disponíveis para quem quiser reproduzir os resultados. Na sua avaliação de fevereiro de 2026, o GPTZero declara, como média de quatro domínios em inglês para a versão de modelo 4.3b, uma taxa de falsos positivos de 0,08%, uma sensibilidade de 99,60%, uma precisão de 99,93% e uma exatidão de 99,76%. Cada benchmark usa 1.000 textos humanos e 1.000 textos gerados por LLM, distribuídos de forma uniforme pelos modelos testados (250 textos por modelo), e o conjunto de modelos é renovado trimestralmente.
As linhas por domínio são publicadas em separado, o que importa porque as médias escondem variação. O GPTZero declara 99,85% de exatidão em recensões de artigos académicos (0,10% de falsos positivos), 99,80% em escrita criativa, 100% em ensaios com uma taxa de falsos positivos de 0,00% e 99,40% em recensões de produtos. A mesma página apresenta as pontuações que mediu para detetores concorrentes sobre os mesmos textos, e a comparação é mais equilibrada em alguns domínios do que a média de manchete sugere.
GPTZero: avaliação da deteção de IA, o padrão do setor em exatidão, transparência e equidade
O que diz a investigação independente sobre a precisão do GPTZero
O resultado independente mais forte para o GPTZero vem de um estudo revisto por pares publicado na Acta Neurochirurgica em 2025. Os investigadores reuniram 1.000 textos: 250 resumos e introduções escritos por pessoas, provenientes de quatro revistas de neurocirurgia de alto impacto publicadas antes do ChatGPT, mais 750 versões do mesmo material geradas pelo ChatGPT 3.5, GPT-4 e GPT-4o. Os detetores foram usados entre 1 e 15 de junho de 2024, o que data a versão do GPTZero testada. Com o GPTZero, a pontuação média de probabilidade de IA foi de 5,88% para os textos humanos, 81,71% para o GPT-3.5, 96,83% para o GPT-4 e 99,58% para o GPT-4o. No corte escolhido pelos investigadores, o GPTZero atingiu 100% de sensibilidade e 99,6% de especificidade.
Acta Neurochirurgica: exatidão e limitações dos detetores de textos de IA
É um resultado sólido, e continua a ser condicional. Descreve um corpus académico, de uma disciplina, com determinados comprimentos de texto, face a três versões do ChatGPT, sobre a versão do GPTZero disponível em junho de 2024 e com um limiar escolhido pelos autores. Não significa que o detetor tenha 99,6% de exatidão no teu texto, e o mesmo artigo observa que nenhum detetor avaliado foi fiável em todas as situações.
Trabalhos independentes anteriores mostram quanto essas condições podem variar. Um estudo preliminar publicado no Journal of Korean Medical Science em 2023 testou o GPTZero com 20 textos gerados pelo ChatGPT em resposta a perguntas médicas e 30 excertos retirados de artigos médicos já publicados. Declarou uma sensibilidade de 0,65 (intervalo de confiança de 95%: 0,41 a 0,85), uma especificidade de 0,90 (0,73 a 0,98) e uma exatidão de 0,80 (0,66 a 0,90), e concluiu que o GPTZero tinha uma taxa baixa de falsos positivos mas uma taxa alta de falsos negativos: raramente acusava a escrita humana e frequentemente deixava passar a escrita automática.
Journal of Korean Medical Science: desempenho do GPTZero com textos médicos gerados por IA (2023)
A distância entre esse retrato de 2023 e o estudo de 2025 não é uma contradição nem prova de que uma equipa foi descuidada. É o exemplo mais claro desta página de porque é que a precisão de um detetor tem de ser lida em conjunto com a sua versão e o seu corpus.
O GPTZero pode marcar escrita humana como IA?
Sim. Um falso positivo é escrita humana classificada como IA ou mista, e o GPTZero reconhece que esses casos existem. A sua documentação de apoio explica que a exatidão aumenta à medida que se envia mais texto, que o classificador é treinado sobretudo com prosa inglesa escrita por adultos e que por vezes pode marcar como escritos por IA outros textos gerados por máquinas ou muito procedimentais. Um excerto curto, uma passagem formulaica ou um texto muito afastado dessa distribuição de treino são os pontos onde esse risco se concentra.
GPTZero: quais são as limitações do seu classificador de IA?
A documentação pública do GPTZero vai mais longe do que a da maioria dos fornecedores quanto às consequências desse risco. Afirma que os resultados não devem ser usados para castigar estudantes, recomenda tratar uma classificação como um componente de uma avaliação mais ampla e defende que o detetor deve servir como ponto de partida de uma conversa e não como veredicto final. Em contextos académicos, a empresa afirma também que prefere deixar passar um uso de IA a acusar uma pessoa: a documentação da API desaconselha aumentar a sensibilidade do detetor para usos académicos, porque aí os falsos negativos são preferíveis aos falsos positivos.
O GPTZero pode deixar passar texto gerado por IA?
Sim, e o próprio equilíbrio escolhido pelo fornecedor torna isso explícito: um falso negativo é texto gerado por IA classificado como humano, e o GPTZero afirma que, em contexto académico, prefere errar nessa direção. O estudo médico de 2023 mediu o custo prático dessa mesma preferência, com uma sensibilidade de 0,65 no seu corpus: cerca de um terço dos textos escritos por máquina não foi sinalizado.
Vários fatores empurram uma passagem gerada para a classificação humana. O texto gerado e depois reescrito em profundidade à mão já não se parece com uma saída em bruto de um modelo, e a documentação do GPTZero observa que o classificador não foi treinado para identificar texto gerado por IA depois de uma modificação intensa. As ferramentas de paráfrase, os modelos pouco conhecidos, os géneros invulgares, as amostras curtas e as edições deliberadas para enganar o detetor estão na mesma zona. A empresa atualiza os modelos para estes casos, e é também por isso que um resultado de uma versão não passa automaticamente para a seguinte.
Porque é que a precisão do GPTZero varia
Quando dois estudos declaram números muito diferentes para a mesma ferramenta, a explicação costuma estar no desenho do teste e não na ferramenta. As variáveis abaixo cobrem a maior parte da diferença.
- Versão do modelo: o detetor avaliado em 2023, o avaliado em junho de 2024 e o modelo atual são sistemas diferentes, e o próprio GPTZero documenta as mudanças de versão.
- Construção do benchmark: que textos foram escolhidos, como foram pedidos os textos de IA e se as amostras estão equilibradas entre géneros condicionam o resultado.
- Escrita humana usada como controlo: a prosa académica anterior ao ChatGPT, os ensaios de estudantes e a escrita da web são distribuições diferentes, e um classificador pode parecer excelente numa e fraco noutra.
- Modelo gerador: o estudo da Acta Neurochirurgica mediu pontuações médias do GPTZero que subiam de 81,71% com o GPT-3.5 para 99,58% com o GPT-4o, por isso a mesma ferramenta lê modelos diferentes de forma diferente.
- Género e idioma: o GPTZero afirma que rende melhor em textos longos e prosa em inglês, que é onde estão a maior parte dos seus dados de treino.
- Comprimento do texto: mais texto significa mais provas, e é por isso que os resultados ao nível do documento são mais fiáveis do que os de frase.
- Edição e paráfrase: uma reescrita humana intensa ou uma paráfrase automática afastam um texto dos padrões que o classificador aprendeu.
- Limiar: todos os detetores convertem pontuações em decisões com algum corte, e movê-lo troca falsos positivos por falsos negativos. O estudo da Acta indica o seu próprio corte, e é uma das razões por que os seus números são precisos e não universais.
- O que conta como acerto: os estudos tratam de forma diferente as classificações mistas, o texto de IA parcial e os documentos irregulares, por isso dois artigos podem medir a mesma ferramenta e entender coisas distintas por exatidão.
O comprimento do texto afeta a precisão do GPTZero?
Sim, e o GPTZero di-lo diretamente. A sua documentação afirma que a exatidão melhora quando se envia mais texto e que as classificações ao nível do documento são em geral mais fiáveis do que as de parágrafo, que por sua vez são mais fiáveis do que as de frase.
Vale a pena lembrar a consequência prática da próxima vez que vires uma frase destacada. Uma única frase destacada é um sinal fraco por si só, porque é o que traz menos provas de tudo o que o detetor examina. Uma classificação coerente ao nível do documento num ensaio completo, onde os mesmos padrões aparecem em vários parágrafos, merece mais peso. Se o texto que estás a verificar é curto, trata o resultado como provisório e verifica mais parte dele.
Como interpretar um resultado do GPTZero
O GPTZero não devolve um único número, e ler o seu resultado como “X por cento deste ensaio foi escrito por uma IA” é um mal-entendido. O sistema devolve uma classificação (só humano, misto ou só IA), uma probabilidade para cada uma dessas classes e uma categoria de confiança alta, média ou baixa. A probabilidade da classe prevista é descrita pela documentação do GPTZero como a probabilidade de o detetor acertar nessa previsão: um valor de 90% significa que, em documentos semelhantes, acerta cerca de 90% das vezes.
GPTZero: como transformo as probabilidades da API em resultados?
O GPTZero publica também o que significam as suas categorias de confiança na prática: com confiança alta, declara que 99,1% dos artigos humanos são classificados como humanos e que 98,4% dos artigos de IA são classificados como IA. Um resultado de confiança média ou baixa é, por construção, uma afirmação mais suave, e a documentação descreve limiares que podes ajustar para trocar sensibilidade por falsos positivos no teu próprio caso de uso.
Perguntas que vale a pena fazer antes de agir a partir de um resultado:
- Qual é o comprimento do texto e o veredicto é ao nível do documento ou da frase?
- A confiança é alta, média ou baixa?
- Que passagens provocaram a classificação?
- Quando lês essas passagens, a escrita parece mesmo repetitiva ou formulaica?
- Outro detetor devolve um sinal semelhante sobre o mesmo texto?
- Há provas do processo de escrita, como rascunhos, notas ou um histórico de versões?
- O texto foi editado ou parafraseado de forma substancial depois de gerado?
O que um resultado do GPTZero não consegue estabelecer por si só é o plágio, a má conduta, a intenção ou a história exata de um documento. É uma prova sobre padrões no texto, e é mais útil quando se lê ao lado do próprio texto.
O professorado deve usar o GPTZero como prova de uso de IA?
Não como prova, e a própria documentação do GPTZero diz o mesmo. As suas páginas de apoio afirmam que nenhum detetor é totalmente preciso, que os resultados não devem ser usados para castigar estudantes e que uma classificação é melhor tratada como um elemento de uma avaliação mais ampla. A empresa documenta também a sua preferência em contextos académicos: prefere deixar passar escrita assistida por IA a acusar um estudante por engano, que é exatamente o contrário do que uma decisão disciplinar precisa.
Quando a autoria importa, um processo é mais forte do que uma pontuação. As provas úteis incluem o histórico de redação, as revisões do documento, as notas das fontes, trabalhos anteriores do mesmo estudante, citações que podem ser verificadas, conversa sobre o material e o que a política de IA do trabalho realmente permite. Um detetor pode apontar passagens que merecem uma conversa. Não pode substituir essa conversa.
O que fazer se o GPTZero sinalizar o teu texto
Se o resultado importa, percorre-o numa ordem fixa em vez de reescreveres por reflexo.
- 1
Lê
Lê as passagens sinalizadas e avalia-as como escrita.
- 2
Vê o nível
Regista se a classificação é ao nível do documento ou da frase.
- 3
Pondera a confiança
Olha para a categoria de confiança, não apenas para o resultado de manchete.
- 4
Compara
Passa o mesmo texto por um segundo detetor.
- 5
Provas
Reúne rascunhos e histórico de versões se a autoria for questionada.
- 6
Revê
Reescreve apenas as passagens que realmente precisam de melhorar.
Às vezes a preocupação é justa: formas de frase repetidas, transições que não ligam nada, afirmações sem um único exemplo por trás. Quando uma passagem é mesmo formulaica, o Humanizador do AI-2-Human pode reescrevê-la num rascunho mais natural mantendo a tua intenção no centro, e depois editas o resultado com a tua própria voz.
Deves comparar o GPTZero com outro detetor de IA?
Sim, sobretudo quando o resultado tem consequências. Os detetores usam modelos diferentes, dados de treino diferentes e limiares de decisão diferentes, por isso a mesma passagem pode dar resultados distintos. Os estudos citados nesta página são, eles próprios, um exemplo de quanto as condições importam: a mesma ferramenta pontuou de forma muito diferente segundo o corpus e a versão.
A comparação ajuda nas duas direções. Quando dois detetores destacam a mesma passagem, essa passagem merece um olhar atento. Quando discordam de forma marcada, a discordância diz-te que o texto está perto de um limite de decisão e que a pontuação é suave, o que é útil saber antes de reescreveres seja o que for ou antes de outra pessoa agir a partir do resultado.
O Detetor do AI-2-Human comunica a sua própria leitura do texto e aponta as passagens que ainda parecem geradas, o que te dá duas interpretações para pôr lado a lado antes de decidires o que mudar.
Antes de entregar: uma lista de verificação prática
- Verifiquei se o resultado é ao nível do documento ou da frase.
- Tive em conta o comprimento e o tipo do texto verificado.
- Olhei para a confiança do GPTZero, não apenas para a classificação de manchete.
- Li as passagens que levantaram a dúvida.
- Tratei o resultado como prova e não como demonstração.
- Comparei com outro detetor porque o resultado importa.
- Guardei rascunhos ou histórico de versões onde a autoria poderia ser questionada.
- Verifiquei factos e citações em separado da deteção de IA.
- Revisei apenas as passagens que realmente precisavam de melhorar.
Perguntas frequentes
O GPTZero tem um desempenho muito forte nos seus próprios benchmarks e em pelo menos um corpus académico independente, mas não existe uma percentagem universal de precisão para todo o tipo de texto. Os resultados declarados mudam com a versão do detetor, o tipo de escrita, o comprimento do texto e o corpus, e há falsos positivos e falsos negativos documentados. O melhor é tratar um resultado como um sinal e não como uma prova.
Depende do teste, e por isso a resposta útil é uma comparação e não um número. O benchmark do GPTZero de fevereiro de 2026 declara uma exatidão média de 99,76% com uma taxa de falsos positivos de 0,08% em quatro domínios em inglês para o modelo 4.3b. Um estudo independente de 2024 sobre 1.000 textos académicos mediu 100% de sensibilidade e 99,6% de especificidade no seu próprio corte. Um estudo médico preliminar de 2023 declarou 80% de exatidão e 65% de sensibilidade numa versão anterior. A mesma ferramenta, versões e condições diferentes.
O GPTZero declara uma taxa média de falsos positivos de 0,08% no seu próprio benchmark de fevereiro de 2026 e de 0,00% no domínio de ensaios. Os estudos independentes situam o risco de outra forma segundo o corpus e o corte, e a documentação de apoio do GPTZero reconhece que a escrita humana pode ser classificada como IA, e é por isso que desaconselha usar uma classificação como única base para decidir sobre um estudante.
Sim, nas duas direções. A documentação do GPTZero reconhece falsos positivos e falsos negativos, observa que nenhum detetor é totalmente preciso e afirma que os resultados não devem ser usados para castigar estudantes. Estudos independentes mediram os dois tipos de erro em corpus reais.
Sim. O GPTZero reconhece que existem casos-limite, e a documentação explica que a exatidão melhora com mais texto e que o classificador é treinado sobretudo com prosa inglesa escrita por adultos. Os excertos curtos, a escrita formulaica e o texto muito procedimental são os locais onde um falso positivo é mais provável.
Uma prosa formal, muito polida ou repetitiva pode assemelhar-se aos padrões que o classificador associa à escrita automática, e uma amostra curta dá-lhe pouco com que trabalhar. A própria orientação do GPTZero é usar o resultado como um elemento de uma avaliação mais ampla. Se uma passagem é realmente repetitiva, melhorá-la ajuda; se é apenas formal, a classificação diz mais sobre os limites do detetor do que sobre a tua escrita.
Verificar com o Detetor de IA →Sim. Um falso negativo é texto gerado por IA classificado como humano, e o GPTZero afirma que, em uso académico, prefere esse erro a uma acusação falsa. O estudo médico de 2023 mediu o custo prático com uma sensibilidade de 0,65 no seu corpus. Uma edição humana intensa, as ferramentas de paráfrase e os modelos pouco conhecidos tornam mais difícil sinalizar uma passagem gerada.
No próprio benchmark do GPTZero de fevereiro de 2026, o domínio dos ensaios é o mais forte dos quatro, com 100% de exatidão e 0,00% de falsos positivos para o modelo 4.3b. É um resultado declarado pela empresa sobre o seu próprio corpus de ensaios, por isso descreve esse benchmark e não todos os ensaios. Os resultados independentes sobre prosa académica são sólidos mas variam com a versão e o corte usados.
Menos do que com textos longos, segundo o próprio GPTZero. A sua documentação afirma que a exatidão melhora quando se envia mais texto e que as classificações ao nível do documento são mais fiáveis do que as de parágrafo, que por sua vez o são mais do que as de frase. Uma frase destacada por si só é um sinal fraco.
O GPTZero foi construído para classificar texto de várias famílias de modelos de linguagem, e o estudo da Acta Neurochirurgica mediu pontuações médias de probabilidade de IA do GPTZero que subiam de 81,71% com o GPT-3.5 para 96,83% com o GPT-4 e 99,58% com o GPT-4o. Isso não significa que todas as passagens do ChatGPT sejam sinalizadas, nem que uma passagem sinalizada prove que o ChatGPT foi usado.
Nos corpus citados nesta série, as métricas declaradas do GPTZero foram superiores às do ZeroGPT, incluindo 100% contra 94,4% de sensibilidade no estudo académico de 2024 e 97,22% contra 64,35% de exatidão num estudo de 2025 sobre resumos académicos. É um resultado sobre esses testes e não uma ordenação permanente: os produtos usam sistemas diferentes e os benchmarks, limiares e versões mudam. Compara com o teu próprio texto em vez de assumires uma ordem.
Sim, e é o esperado. Modelos, dados de treino e limiares diferentes fazem com que duas ferramentas possam ler a mesma passagem de forma distinta. A própria página de benchmarks do GPTZero apresenta as comparações que fez com outros detetores, e as margens variam segundo o domínio, o que mostra bem até que ponto o corpus condiciona o resultado.
Não como prova única. A documentação do GPTZero recomenda usar o seu classificador como um componente de uma avaliação mais ampla e afirma que os resultados não devem ser usados para castigar estudantes. Um processo viável combina o sinal de um detetor com o histórico de redação, os registos de revisão, as notas das fontes, trabalhos anteriores do mesmo estudante e uma conversa sobre o material.
Lê tu mesmo as passagens sinalizadas, verifica se a classificação é ao nível do documento ou da frase, olha para a categoria de confiança, compara com outro detetor e reúne os teus rascunhos e o teu histórico de versões. Depois revê apenas as passagens que realmente se leem como formulaicas. O AI-2-Human pode dar-te um segundo sinal de deteção, e o Humanizador pode encarregar-se da reescrita se uma passagem precisar mesmo dela.
Sim. O Detetor do AI-2-Human dá-te outro sinal de deteção sobre o mesmo texto e aponta as passagens que parecem geradas, para poderes pôr duas leituras lado a lado. Comunica a sua própria interpretação e não uma cópia do modelo do GPTZero, que é o que torna a comparação útil.
Executar o Detetor de IA →Uma ferramenta de reescrita muda o texto, e um texto diferente pode ser classificado de outra maneira, mas nenhuma ferramenta pode prometer um resultado concreto: os detetores e os limiares mudam sem parar, e o GPTZero atualiza os seus modelos. A abordagem fiável é melhorar a escrita que realmente precisa disso e depois verificar de novo e comparar. O AI-2-Human reescreve passagens repetitivas e formulaicas numa versão mais natural, mantendo o teu sentido.
Humanizar texto de IA →Fontes e notas editoriais
- GPTZero: tecnologia de deteção de IA (em inglês)
- GPTZero: avaliação da deteção de IA, o padrão do setor em exatidão, transparência e equidade (em inglês)
- GPTZero: quais são as limitações do seu classificador de IA? (em inglês)
- GPTZero: como transformo as probabilidades da API em resultados? (em inglês)
- Acta Neurochirurgica: exatidão e limitações dos detetores de textos de IA (em inglês)
- Journal of Korean Medical Science: desempenho do GPTZero com textos médicos gerados por IA, 2023 (em inglês)
O AI-2-Human não está associado ao GPTZero nem é apoiado por ele. A documentação, a informação de benchmark e a investigação citada do GPTZero foram consultadas a 20 de setembro de 2026. Os modelos de deteção e o seu desempenho podem mudar ao longo do tempo.
Atualizado


