Guías de detección de IA
¿Es fiable el detector de IA de Grammarly?
El detector de IA de Grammarly puede rendir muy bien en benchmarks estandarizados, pero su puntuación no prueba cómo se escribió un documento. Grammarly llama a ese porcentaje una estimación media de cuánto texto parece generado por IA, afirma que la función no es 100% precisa y señala que los textos cortos son más difíciles de medir. La evidencia independiente apunta igual: rinde bien en un gran benchmark compartido, mientras un estudio académico de 2025 registró porcentajes muy inferiores a los de otro detector en las mismas introducciones de IA. Una puntuación es una señal: cuando el resultado importa, compara el mismo fragmento con otro detector y lee tú el texto marcado. El Detector de IA de AI-2-Human te da esa segunda lectura.

¿Qué es el detector de IA de Grammarly?
El detector de IA de Grammarly estima qué parte de un texto parece generada por IA. Grammarly explica el mecanismo en su documentación: el texto se divide en secciones, cada una se compara con un modelo de aprendizaje automático que busca patrones típicos de la IA, como esquemas de lenguaje, sintaxis y complejidad, y después devuelve un porcentaje. El modelo se describe como entrenado con cientos de miles de textos humanos y de IA.
La función no es una web aparte que visitas una vez. Grammarly la integra en su producto, con el agente AI Detector en sus superficies de escritura, la comprobación de IA en Google Docs mediante la extensión y las aplicaciones de escritorio para Word, y es de pago en casi todos los planes. Hay una versión gratuita en la página pública AI Detector, donde pegas texto o subes un documento para ver el porcentaje.
Entonces, ¿qué precisión tiene el detector de IA de Grammarly?
No hay un porcentaje único de precisión que describa cada análisis. Lo que se puede decir es más concreto: el detector separa texto de IA de texto humano con mucha fiabilidad en condiciones de benchmark, y la investigación independiente muestra que los porcentajes que devuelve pueden quedar muy por debajo del nivel real de implicación de la IA.
Las propias palabras de Grammarly fijan mejor las expectativas. Su guía de usuario llama a la puntuación una estimación media de cuánto texto generado por IA contiene probablemente un documento, dice que las pruebas garantizaron que el modelo acierta en dirección, señala que los fragmentos cortos son más difíciles de medir y afirma que la función no es 100% precisa y no debe usarse como valoración definitiva. Otro artículo añade que ningún detector actual puede determinar de forma concluyente si se usó IA y que estas herramientas son un dato más, no la única fuente de prueba.
Grammarly: ¿el uso de Grammarly activa los detectores de IA? (inglés)
- Estilo: la prosa formal y muy regular se acerca a los patrones que los detectores asocian con la máquina.
- Longitud: los fragmentos cortos son más difíciles de medir que los largos, según Grammarly.
- Modelo: cada modelo deja huellas distintas y los detectores se ajustan a familias concretas.
- Edición humana: el texto generado y luego muy reescrito ya no parece salida de un modelo.
- Autoría mixta: redacción humana más ayuda de IA y revisión manual es el caso más difícil.
- Versión y datos: cada cifra publicada depende del género y la longitud del material de prueba.
¿Qué significa de verdad el porcentaje de IA de Grammarly?
Una puntuación del 40% no significa que Grammarly haya establecido que exactamente el 40% del documento lo escribió una IA. Significa que el modelo encontró patrones que hacen que esa parte del texto se parezca a escritura generada por IA. Grammarly usa a propósito las palabras estimación y media, y repite la matización: la puntuación debe leerse como una estimación media y no como una valoración porcentual definitiva, ni como fuente objetiva de verdad, porque cualquier detección de IA puede cometer errores.
El diseño por secciones explica parte de esa ambigüedad. Analizar por secciones muestra qué partes provocaron el resultado, pero un único porcentaje comprime varios juicios locales en un solo número: un documento con tres párrafos formulaicos y cuatro personales puede acabar en una puntuación intermedia que no describe bien ninguna de las dos mitades.
Qué informa el benchmark RAID sobre Grammarly
RAID es un benchmark compartido creado para evaluar detectores en condiciones comunes: más de 10 millones de documentos con 11 modelos de lenguaje, 11 géneros, cuatro estrategias de decodificación y ataques adversariales como parafraseo, cambios de sinónimos y homoglifos. Todos los detectores participantes se puntúan con el mismo material y el mismo script, lo que lo convierte en la comparación pública más justa disponible y en la más difícil de transformar en una promesa sobre un ensayo concreto.
Grammarly anuncia su rendimiento en ese benchmark directamente. Su página de producto del detector afirma que el producto alcanza un 99% de precisión de detección y que ocupa el primer puesto en el benchmark independiente de RAID, por delante de otros detectores líderes. Es una afirmación del proveedor, publicada por la empresa cuyo detector describe, y debe leerse como tal.
Grammarly: página de producto del detector de IA (inglés)
La clasificación en sí es más precisa. La instantánea citada aquí se tomó el 20 de septiembre de 2026 y la entrada de Grammarly está fechada el 9 de febrero de 2026. Las entradas las envían los desarrolladores de los detectores y se puntúan con el script del propio benchmark, así que las condiciones son compartidas pero el envío viene del proveedor. En esa instantánea Grammarly declara un AUROC de 0,9987 en todas las condiciones de RAID, incluidos los ataques adversariales, con un 99,47% de precisión con una tasa objetivo de falsos positivos del 5% y un 98,21% con el 1%. En la parte no adversarial, la misma entrada declara un AUROC de 0,99972 y un 99,91% de precisión con objetivo del 5%.
Los nombres de las métricas importan. El AUROC mide qué bien separa un detector las dos clases en todos los umbrales posibles, donde 1,0 es perfecto, y no es un porcentaje de decisiones correctas. La cifra de precisión de RAID se mide en un punto de funcionamiento fijo, el umbral donde solo el 5% o el 1% de los textos humanos se marcan por error.
Qué dice la investigación independiente sobre Grammarly
El resultado independiente más útil sobre Grammarly viene de un estudio revisado por pares publicado en Advances in Simulation en 2025. Los investigadores tomaron 30 artículos de acceso abierto publicados antes de 2022 en dos revistas de simulación sanitaria, extrajeron las introducciones y produjeron cinco versiones de cada una: el original humano, una versión humana con edición ligera de IA, una con edición intensa, una generada a partir de puntos clave humanos y una escrita enteramente desde el título. Tres detectores gratuitos (ZeroGPT, Phrasly AI y Grammarly) y cinco evaluadores humanos ciegos puntuaron el mismo material.
Grammarly distinguió las cinco condiciones en conjunto, con un efecto estadísticamente significativo y un tamaño del efecto de 0,75, pero sus porcentajes absolutos quedaron muy por debajo del nivel de implicación de la IA. En esas introducciones promedió un 1,6% en el texto humano intacto (intervalo de confianza del 95%: 0,0 a 3,1), un 3,0% con edición ligera, un 11,5% con edición intensa, un 62,5% en texto generado desde puntos clave y un 50,0% en texto escrito enteramente por IA desde el título. ZeroGPT promedió 6,5%, 20,2%, 43,1%, 89,9% y 92,5% en las mismas cinco condiciones.
De ahí salen dos conclusiones opuestas. La alentadora es que el orden de Grammarly era correcto: sus puntuaciones subían a medida que subía la implicación de la IA y fue la menos propensa de las tres herramientas a marcar texto humano intacto. La cautelosa es que un documento escrito enteramente por un modelo de lenguaje volvió con un 50% de media, lejos de lo que un lector llamaría escrito por máquina.
El estudio también midió la concordancia entre herramientas. ZeroGPT y Phrasly coincidían muy bien, con 0,96. La de Grammarly con ZeroGPT era solo moderada, 0,60, con un sesgo de 24,7 puntos: ZeroGPT devolvía sistemáticamente porcentajes más altos en el mismo material, y Phrasly frente a Grammarly quedó en 0,57. Los evaluadores humanos no lo hicieron mejor: su precisión global fue del 19%.
¿Puede Grammarly marcar escritura humana como IA?
Sí. Un falso positivo es texto realmente humano que un detector lee como generado o asistido por IA, y Grammarly reconoce el caso en lugar de descartarlo. Su documentación afirma que el modelo está optimizado para minimizar los falsos positivos, que puede haber casos en los que los patrones, la sintaxis y la complejidad humanos se parezcan más a la escritura de IA y que espera que sean muy raros. Después da el mismo consejo que esta guía: lee el resultado en contexto, no como fuente objetiva de verdad.
Las condiciones que elevan el riesgo se describen de forma consistente en la literatura sobre detectores, y son propiedades de la escritura más que una lista que Grammarly publique. El registro muy formal, la estructura de frases repetitiva, las transiciones predecibles, la poca variación léxica, las muestras muy cortas, los géneros alejados de los datos de entrenamiento y el inglés como lengua adicional se acercan más a la frontera. Ninguna es prueba de uso de IA, y varias son producto de una escritura cuidada.
¿Puede Grammarly pasar por alto texto generado por IA?
Sí, y el estudio de 2025 es el ejemplo público más concreto: el texto escrito enteramente por IA desde el título promedió un 50,0% en Grammarly, mientras el mismo material promediaba más del 92% en las otras dos herramientas. Ese resultado no es una tasa de fallo, porque describe 30 introducciones de una disciplina, generadas con una familia de modelos y en un momento concreto. Sí muestra la forma del problema: un detector ajustado para evitar falsos positivos deja pasar parte del texto de máquina.
La documentación de Grammarly explica por qué una reescritura puede escapar. Su modelo se entrena con texto humano y texto generado por IA de proveedores de modelos, y las sugerencias de gramática o claridad normalmente no cambian el porcentaje, mientras que una reescritura significativa con un modelo generativo lo sube. El texto generado y luego editado a mano queda entre esos dos casos, y también un pasaje escrito por una persona y muy reescrito por un asistente, la autoría mixta que ningún detector resuelve bien. Los modelos nuevos dificultan el problema, porque los detectores se entrenan contra las salidas que existían cuando se creó el modelo.
Por qué pueden variar los resultados del detector de Grammarly
Cuando dos personas pasan el mismo texto por la misma herramienta y obtienen números distintos, o cuando dos herramientas no coinciden sobre el mismo documento, la explicación suele estar en las condiciones.
- Versión: Grammarly actualiza su modelo de forma continua, así que los resultados cambian con el producto.
- Longitud: el texto se analiza por secciones, así que un documento corto se juzga con menos decisiones.
- Edición: las correcciones de gramática o claridad suelen dejar la puntuación igual; la reescritura generativa la sube.
- Umbral: dónde traza la línea un detector importa, y Grammarly dice que sus puntuaciones difieren de las de Turnitin, GPTZero o Copyleaks.
Un porcentaje solo es interpretable junto a una descripción del texto. Dos frases pegadas de un párrafo, un ensayo entero escrito de una vez y un informe montado en tres semanas con un asistente son tres mediciones distintas, aunque la herramienta muestre el mismo estilo de puntuación.
¿Influye la longitud del texto en la puntuación de Grammarly?
Grammarly lo dice directamente: los fragmentos cortos son más difíciles de medir que los largos. Es sensato, porque un detector que analiza por secciones tiene menos secciones con las que trabajar cuando le das dos frases, así que su juicio se apoya en menos material.
La regla práctica es la proporción. Un porcentaje alto en un documento completo, donde los patrones se repiten en varios párrafos, merece más atención que uno alto en una sola frase. Si analizas algo corto, trata el resultado como provisional.
¿La edición o el parafraseo cambian la puntuación de Grammarly?
Grammarly traza una línea dentro de la edición y es útil. Las correcciones tradicionales no generativas, como las sugerencias de gramática, claridad, elección de palabras y concisión, normalmente no afectan al porcentaje de IA, porque no cambian los patrones de lenguaje subyacentes que lee el modelo. Reescribir frases o párrafos enteros con un asistente generativo es otra operación: Grammarly afirma que una reescritura significativa con su agente, su asistente generativo o un parafraseador subirá la puntuación, y que el texto de un proveedor externo tiene aún más probabilidad de recibir un porcentaje más alto.
La empresa aplica esa lógica a sus propias herramientas, y es poco habitual tanta franqueza. Su documentación advierte de que reescribir contenido con sus agentes de reformulación o humanización probablemente hará que el resultado se marque como generado por IA, porque esas reescrituras salen de su propio modelo, y sugiere usar los agentes para recibir comentarios que apliques a mano si te preocupa que te marquen. Si estás leyendo la puntuación de otra persona, el mismo hecho importa al revés: el texto que ha pasado por un parafraseador es más difícil de interpretar, y un porcentaje bajo no prueba que no hubiera un asistente.
Detector de IA de Grammarly frente a Authorship
Grammarly incluye dos ideas distintas con nombres parecidos, y confundirlas es la forma más rápida de malinterpretar un resultado. La detección de IA examina el texto final y estima qué parte se parece a escritura generada por IA. Authorship registra cómo se creó el documento y clasifica el texto según entra: escrito directamente, pegado desde el navegador, pegado desde una fuente desconocida como una ventana privada, generado por IA, o escrito y luego reformulado con IA a demanda.
Grammarly: presentación de Authorship (inglés)
El seguimiento de Authorship funciona en Google Docs con la extensión y en Word con la aplicación de escritorio, y produce informes compartibles que pueden incluir comprobaciones de IA y de plagio en los planes superiores. La distinción que importa es sencilla: un detector lee el texto y estima, mientras que un registro de autoría describe el proceso que lo produjo.
Cómo interpretar una puntuación de Grammarly
Antes de actuar a partir de un porcentaje, repasa estas preguntas: son la diferencia entre leer una señal y tratar un número como un veredicto.
- ¿Cuánto texto se analizó: un documento completo o un extracto corto?
- ¿El pasaje está muy editado, asistido por IA o es una mezcla?
- ¿Qué secciones se marcaron y comparten algún patrón?
- ¿La escritura se lee como repetitiva o formulaica?
- ¿Un segundo detector devuelve una lectura parecida?
- ¿Hay borradores, historial de versiones o un informe de Authorship?
Lo que una puntuación de Grammarly no puede establecer por sí sola conviene decirlo claro. No dice quién escribió un documento, si el uso de IA rompió una política, si hubo plagio ni si alguien es honesto. Grammarly lo admite, al describir su detección como un dato más y no como la única fuente de prueba.
Qué hacer si Grammarly marca tu texto
Aborda la situación en un orden fijo en lugar de reescribir por reflejo. Es la misma secuencia que esta guía recomienda para cualquier detector.
- 1
Lee el pasaje marcado
Júzgalo primero como escritura: ¿se lee de verdad como repetitivo o formulaico?
- 2
Comprueba el tamaño de la muestra
¿La puntuación salió de un documento completo o de un par de frases?
- 3
Compara con un segundo detector
Pasa el mismo texto por otra herramienta y mira si las lecturas coinciden.
- 4
Reúne pruebas del proceso
Busca borradores, historial de versiones o un informe de Authorship.
- 5
Revisa lo que lo necesite
Reescribe solo los pasajes que necesitan mejora y verifica las citas aparte.
A veces la preocupación es justa. Las frases con la misma forma, las transiciones que no conectan nada y los párrafos que enumeran afirmaciones sin pruebas merecen arreglarse, tanto si un detector lo notó como si no. Cuando un pasaje es realmente mecánico, el humanizador de AI-2-Human lo reescribe en una versión más natural sin perder tu significado.
¿Deberías comparar Grammarly con otro detector de IA?
Sí, y aquí la recomendación viene también del proveedor. La documentación de Grammarly afirma que su detección usa un modelo propio, que las puntuaciones pueden diferir de otras soluciones como Turnitin, GPTZero o Copyleaks y que su puntuación no debe leerse como indicación clara de que otro detector dirá lo mismo. El estudio independiente midió el mismo efecto: 0,60 de concordancia entre Grammarly y ZeroGPT en textos idénticos, con unos 25 puntos de diferencia.
La comparación ayuda en las dos direcciones. Cuando dos detectores marcan el mismo pasaje, merece una lectura atenta. Cuando discrepan con claridad, la discrepancia dice que el texto está cerca de una frontera de decisión y que el porcentaje es blando, algo que conviene saber antes de reescribir nada o de que otra persona actúe a partir del resultado.
El Detector de AI-2-Human lee el mismo pasaje con su propio modelo y señala las secciones que siguen pareciendo generadas, para poner dos interpretaciones una junto a otra. Es una segunda opinión, no una autoridad superior: te da más elementos antes de decidir qué cambiar.
Antes de entregar: lista de comprobación práctica
- Entiendo que el porcentaje de Grammarly es una estimación, no una medición.
- Comprobé si se analizó suficiente texto antes de leer la puntuación.
- Leí los pasajes que provocaron la marca en lugar de solo el número principal.
- Valoré si el texto es escritura humana, asistida por IA o una mezcla.
- Comparé con otro detector cuando el resultado importa de verdad.
- Busqué borradores, historial de versiones o un informe de Authorship cuando se cuestiona la autoría.
- Verifiqué citas y datos aparte de la detección de IA.
- Revisé solo los pasajes que de verdad necesitaban mejora.
Preguntas frecuentes
El detector de IA de Grammarly rinde bien en benchmarks estandarizados: su propia entrada en RAID declara un AUROC de 0,9987 y un 99,47% de precisión con una tasa objetivo de falsos positivos del 5% en la instantánea que consultamos. Ningún detector acierta en todos los textos. Grammarly describe su puntuación como una estimación y no como prueba definitiva de uso de IA, y la investigación independiente muestra que los porcentajes que devuelve pueden quedar muy por debajo del nivel real de implicación de la IA.
La respuesta honesta es que depende de la prueba, y por eso las cifras publicadas difieren tanto. En RAID, un gran benchmark compartido con ataques adversariales incluidos, la entrada de Grammarly declara un AUROC de 0,9987. En un estudio independiente de 2025 con 30 introducciones de artículos, Grammarly ordenó correctamente las cinco condiciones de escritura pero promedió un 50,0% en texto escrito enteramente por IA, frente al 92,5% de ZeroGPT en el mismo material. Mismo producto, distinto material, distinta conclusión.
Es la estimación media de Grammarly sobre qué parte del texto analizado parece generada por IA. Grammarly divide el documento en secciones, comprueba cada una en busca de patrones típicos de la IA como esquemas de lenguaje, sintaxis y complejidad, y devuelve un porcentaje. Un 40% no significa que el 40% del documento esté probado como escrito por una máquina, solo que aproximadamente esa parte del texto se parece a escritura de IA según el modelo.
No, y Grammarly lo dice en su propia documentación. Afirma que la función no es 100% precisa, que no debe usarse como valoración definitiva de si hay texto generado por IA y que el porcentaje no debe tratarse como fuente objetiva de verdad, porque cualquier detección de IA puede cometer errores.
Sí. Grammarly reconoce la posibilidad y dice que esos casos deberían ser muy raros, aunque también señala que los patrones de lenguaje, la sintaxis y la complejidad humanos pueden parecerse mucho a la escritura de IA. El registro formal, la estructura repetitiva, las muestras muy cortas y los géneros poco habituales son las situaciones donde un falso positivo es más probable, y una marca no es prueba de que alguien haya usado IA.
Normalmente porque partes del texto comparten rasgos superficiales con la escritura de máquina, no porque haya pasado nada indebido. Grammarly analiza por secciones, así que unos párrafos formulaicos pueden subir la puntuación, y los pasajes cortos dan menos material al modelo. Compara con otro detector y lee tú mismo las secciones marcadas antes de cambiar nada.
Comprobar con el Detector de IA →Sí. El estudio de 2025 en Advances in Simulation registró una media del 50,0% para Grammarly en introducciones escritas enteramente por IA desde el título del artículo, una lectura mucho más baja que la de los otros detectores sobre el mismo texto. Grammarly también afirma que su modelo está optimizado para minimizar los falsos positivos, lo que significa que es deliberadamente cauto a la hora de acusar escritura humana, y los modelos cautos dejan pasar más escritura de máquina.
Grammarly dice que su detector identifica texto escrito o modificado por modelos principales, incluidos ChatGPT, Claude y Gemini, y el benchmark RAID al que se presenta incluye varias familias de modelos. Detectar una familia no es lo mismo que detectar todos sus pasajes: el estudio de 2025 encontró introducciones totalmente escritas por IA con alrededor del 50% en Grammarly, y una puntuación baja no establece que no hubiera un asistente.
Sí, y Grammarly lo dice con claridad. Su documentación afirma que una reescritura significativa con un asistente generativo o un parafraseador sube la puntuación, que el texto de un proveedor externo como ChatGPT o Gemini tiene más probabilidad de recibir un porcentaje mayor y que reescribir contenido con sus propios agentes de reformulación o humanización probablemente también se marque, porque esas reescrituras salen de un modelo de lenguaje.
Grammarly rinde bien en material de benchmark que incluye prosa tipo ensayo, y sus resultados en RAID son sólidos en varios géneros. Eso no se traslada automáticamente a un ensayo concreto de un estudiante. La propia Grammarly advierte de que los pasajes cortos son más difíciles de puntuar con precisión, y el estudio independiente encontró porcentajes absolutos muy por debajo del nivel real de implicación de la IA en introducciones académicas.
Sí. Grammarly afirma en su guía de usuario que los fragmentos cortos son algo más difíciles de medir con precisión que los largos. Un porcentaje obtenido de dos frases merece más cautela que uno obtenido de un documento completo, donde los mismos patrones se repiten en varias secciones.
Depende del benchmark, la versión y la métrica, y un solo conjunto de datos no lo resuelve. En la instantánea de RAID que consultamos, la entrada de Grammarly quedaba por encima de la de GPTZero por AUROC en todas las condiciones. En el estudio de 2025 en Advances in Simulation, GPTZero se excluyó durante las pruebas piloto porque a menudo clasificaba escritura totalmente humana como principalmente IA, y las tres herramientas que se mantuvieron discreparon entre sí. Compara los dos con tu propio texto en lugar de dar por supuesto un orden.
Comparar con el Detector de IA →Sí, y es lo esperable, no señal de que uno esté roto. Modelos, datos de entrenamiento y umbrales distintos hacen que el mismo pasaje se lea de otra manera. Grammarly dice que su modelo propio producirá puntuaciones distintas de Turnitin, GPTZero y Copyleaks, y el estudio de 2025 midió una concordancia solo moderada, un ICC de 0,60, entre Grammarly y ZeroGPT sobre textos idénticos.
No por sí solo. Grammarly aconseja tratar la salida del detector como un dato más y no como la única fuente de prueba, y recomienda combinar la detección automática con revisión manual. Un proceso viable empareja la puntuación con pruebas del proceso de escritura: borradores, historial de versiones, un informe de Authorship, notas de fuentes, trabajos anteriores del mismo alumno y una conversación sobre el material.
La detección de IA lee el texto final y estima qué parte se parece a escritura de IA. Authorship registra cómo se creó el documento y clasifica el texto como escrito, pegado desde el navegador, pegado desde una fuente desconocida, generado por IA o escrito y luego reformulado con IA. La detección es una puntuación de parecido; Authorship es prueba del proceso, y por eso importa más cuando hay mucho en juego.
Sí, sobre todo cuando el resultado tiene consecuencias. La propia Grammarly dice que sus puntuaciones pueden diferir de las de otros detectores y que su porcentaje no debe leerse como predicción de lo que dirá otra herramienta. Una segunda lectura muestra si el texto está cerca de una frontera de decisión y te da otro conjunto de pasajes marcados que revisar.
Usar el Detector de IA →Sí. Pega el mismo pasaje en el Detector de AI-2-Human y tendrás otra lectura del texto, con las secciones que siguen pareciendo generadas señaladas. Si las dos herramientas apuntan a los mismos pasajes, merecen una revisión atenta. Si discrepan, sabes que la puntuación es blanda y puedes decidir con más contexto que un solo porcentaje.
Comprobar mi texto →Fuentes y notas editoriales
- Grammarly: guía de usuario del detector de IA (inglés)
- Grammarly: página de producto del detector de IA (inglés)
- Grammarly: ¿el uso de Grammarly activa los detectores de IA? (inglés)
- Grammarly: presentación de Authorship (inglés)
- RAID: un benchmark compartido para la evaluación robusta de detectores de texto generado por máquina (inglés)
- Clasificación del benchmark RAID (inglés)
- Advances in Simulation: capacidad de las herramientas de detección de IA y de los humanos para identificar contenido generado por IA (2025, inglés)
AI-2-Human no está afiliado a Grammarly ni cuenta con su respaldo. La documentación de producto de Grammarly, la información de benchmarks y la investigación citada se consultaron el 20 de septiembre de 2026. Los modelos de detección y las clasificaciones de benchmark cambian con el tiempo, así que consulta la documentación actual de Grammarly y la clasificación de RAID en línea antes de fiarte de cualquier cifra citada aquí.
Actualizado


