En enero de 2026, una alumna del máster de IA en UNIR en el que doy clase sobre IA Generativa preguntó en el foro por qué un detector marcaba como escrito por IA el trabajo de fin de máster que había escrito ella. La respuesta corta es que esos detectores no son fiables, y que saber con certeza si un texto lo ha escrito una IA sigue siendo, en general, un problema sin resolver. La respuesta larga explica por qué, y por qué en audio e imagen la situación es distinta.
Hay dos formas de intentarlo: marcar el texto mientras se genera o adivinarlo después.
Marcar el texto al generarlo
Un modelo de lenguaje escribe eligiendo la siguiente palabra (en realidad, el siguiente fragmento de palabra, o token) según unas probabilidades. Una marca de agua aprovecha ese momento para dejar una señal estadística en el texto.
La idea más conocida la publicaron John Kirchenbauer y sus colegas de la Universidad de Maryland en 2023. Antes de elegir cada palabra, el sistema divide el vocabulario en una lista «verde» y otra «roja» de forma pseudoaleatoria, y favorece ligeramente las verdes. Una persona no nota nada al leer, pero quien conoce la clave puede contar cuántas palabras verdes hay y calcular si es demasiada casualidad (Kirchenbauer et al., 2023).
Google usa un sistema de este tipo, SynthID Text, en las respuestas de Gemini. En un artículo publicado en Nature en 2024 explicaron cómo funciona y lo probaron con cerca de 20 millones de respuestas reales, sin que los usuarios notaran pérdida de calidad (Dathathri et al., 2024). El equipo de Hugging Face tiene una buena introducción a estas técnicas para texto, imagen y audio (Hugging Face, 2024).
Por qué la marca de agua no lo resuelve todo
Una marca de agua solo sirve si el modelo que generó el texto la puso y si tienes el detector de ese proveedor. Un texto escrito con un modelo que no marca, o con uno cuyo detector no es público, no lleva ninguna señal que buscar.
Además, la marca se debilita si se reescribe el texto, si se traduce o si se mezcla con texto propio. Y hay que equilibrar: cuanto más fuerte es la marca, más fácil de detectar, pero más puede afectar a la calidad del texto. Es el equilibrio difícil que encontró WaterBench al comparar varios métodos (Tu et al., 2024).
Los modelos abiertos complican todavía más las cosas. Si cualquiera puede descargar el modelo, puede generar sin marca. Y un estudio de 2025 mostró que las marcas de agua integradas en los propios modelos abiertos desaparecen con modificaciones habituales como reentrenarlos con otros datos, comprimirlos o combinarlos con otros modelos (Gloaguen et al., 2025).
Adivinar después: los detectores
Los detectores que usa la mayoría de la gente no buscan marcas de agua. Son clasificadores que estiman si un texto «parece» generado, sobre todo por lo predecible que es: los modelos de lenguaje tienden a elegir las palabras más probables, y un texto muy predecible les resulta sospechoso.
El problema es que muchos textos humanos también son predecibles. Un trabajo académico está escrito con un lenguaje formal, ordenado y sin sorpresas, justo el estilo que imitan los modelos. Por eso mi alumna tenía un falso positivo. Un estudio de Stanford encontró que varios detectores clasificaban de forma sistemática como generados por IA textos escritos por personas que no tenían el inglés como lengua materna, con un vocabulario más limitado (Liang et al., 2023).
La propia OpenAI retiró su detector en julio de 2023 por su baja precisión: identificaba como probablemente generado solo el 26 % de los textos escritos por IA, y marcaba como IA el 9 % de los escritos por personas (OpenAI, 2023). A eso se suma que cada modelo escribe de una forma distinta, y un detector entrenado con unos no reconoce bien a otros.
La investigación sigue buscando alternativas. RepreGuard, publicado en 2025, propone mirar las activaciones internas de un modelo al procesar el texto, en lugar del texto final, y obtiene buenos resultados en sus pruebas (Chen et al., 2025). Es prometedor, pero todavía está lejos de ser una herramienta en la que confiar para acusar a nadie.
En audio e imagen, el problema está más avanzado
Con la voz y las imágenes hay mucho más margen para esconder una señal que las personas no perciben. AudioSeal, de Meta, marca el audio con una señal imperceptible, la detecta incluso en fragmentos concretos de una grabación y resiste bien las manipulaciones habituales (San Roman et al., 2024). Google aplica SynthID a imágenes, vídeo y al audio de algunos de sus productos, y ofrece un portal para comprobar si un contenido lleva su marca (Google DeepMind).
Esto importa especialmente para las voces clonadas, de las que hemos hablado en cuántos minutos hacen falta para clonar una voz y en antes de clonar una voz, pregunta de quién es. Y la normativa empuja en esa dirección: desde agosto de 2026, el Reglamento europeo de IA exige que los proveedores marquen el contenido sintético de forma que una máquina pueda detectarlo (Reglamento (UE) 2024/1689, artículo 50).
Las mismas limitaciones siguen ahí: la marca solo está si alguien la puso, y solo la encuentra quien tiene el detector adecuado.
Qué hacer con un detector
Si eres docente o evalúas textos, un detector puede ser, como mucho, un indicio para empezar una conversación. Nunca una prueba. Sirve más preguntar por el proceso: los borradores, el historial de versiones, las fuentes consultadas o una defensa oral del trabajo.
Si tu organización genera contenido con IA, la vía más sólida es la contraria: marcarlo y decirlo. Es más fácil demostrar que algo lo ha generado una IA cuando quien lo genera lo declara, que intentar adivinarlo después.
Referencias
- Kirchenbauer, J., Geiping, J., Wen, Y. et al. (2023). A Watermark for Large Language Models. ICML 2023.
- Dathathri, S. et al. (2024). Scalable watermarking for identifying large language model outputs. Nature, 634.
- Hugging Face (2024). AI Watermarking 101: Tools and Techniques.
- Tu, S., Sun, Y., Bai, Y. et al. (2024). WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models. ACL 2024.
- Gloaguen, T., Jovanović, N., Staab, R. y Vechev, M. (2025). Towards Watermarking of Open-Source LLMs. arXiv.
- Liang, W., Yuksekgonul, M., Mao, Y., Wu, E. y Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns.
- OpenAI (2023). New AI classifier for indicating AI-written text (actualizado en julio de 2023 con su retirada).
- Chen, X., Wu, J., Yang, S. et al. (2025). RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns. arXiv.
- San Roman, R., Fernandez, P., Défossez, A. et al. (2024). Proactive Detection of Voice Cloning with Localized Watermarking (AudioSeal). ICML 2024.
- Google DeepMind. SynthID.
- Reglamento (UE) 2024/1689 de Inteligencia Artificial. Artículo 50: obligaciones de transparencia.