OpenAI textGrain: marcas de agua en ChatGPT llegan a la UE

OpenAI textGrain: marcas de agua en ChatGPT llegan a la UE

OpenAI empezará a ocultar una señal legible por máquinas en los textos que generan ChatGPT y Codex para los usuarios de la Unión Europea. Fuera del chatbot, el planteamiento es más laxo: los desarrolladores que usan la API en cualquier parte del mundo pueden decidir si la activan o no. Esto sitúa a OpenAI en un camino distinto al de Anthropic, que aplica marcas de agua a Claude en todo el mundo.

Por qué la UE es el detonante

Según diversas informaciones, la Ley de IA de la UE, la ley marco del bloque sobre inteligencia artificial, obliga a los proveedores a marcar los textos generados por IA de forma que las máquinas puedan leerlos. La respuesta de OpenAI es un sistema llamado textGrain. No añade etiquetas visibles ni metadatos. En su lugar, influye ligeramente en la elección de palabras del modelo para que en el resultado quede un patrón estadístico. Un lector no puede verlo, pero un detector puede buscarlo.

La idea se parece a la marca de agua SynthID de Claude, que se basa en tecnología de código abierto de Google. OpenAI asegura que textGrain rindió igual o mejor que los métodos de la competencia en sus propias pruebas, incluido SynthID para texto de Google. La compañía también prevé publicar textGrain como código abierto para que otros puedan desarrollar a partir de él.

El despliegue tiene tres partes:

  1. ChatGPT y Codex en la UE: la marca de agua se activará en las próximas semanas.
  2. API en todo el mundo: la marca de agua es opcional, no obligatoria.
  3. Socios en la nube: la marca de agua de la API también llegará en las próximas semanas a plataformas como Microsoft Azure.

La marca de agua de Anthropic para Claude se aplica a escala global, independientemente de cómo se acceda a sus modelos. El modelo opcional de la API de OpenAI es la diferencia más clara entre ambas.

Qué muestran las cifras de detección

OpenAI ha compartido cifras de detección, y dependen mucho de la longitud del texto y de su temática. Con el detector ajustado a una tasa objetivo de falsos positivos del 1 por ciento, identificó la marca de agua en aproximadamente el 95 por ciento de los fragmentos de 400 tokens sobre psicología. Con 200 tokens, la tasa bajó a alrededor del 80 por ciento.

Los contenidos de matemáticas dieron resultados "sustancialmente" peores, según OpenAI. La razón es sencilla: cuando hay menos formas válidas de expresar algo, el modelo tiene menos margen para variar las palabras que elige, así que la señal es más débil. Los fragmentos más largos podrían darle al detector más material con el que trabajar, pero los resultados pueden seguir variando según el tema. OpenAI no ha aportado datos que lo respalden.

La edición es el punto débil más importante. Según las cifras de OpenAI, cambiar solo el 10 por ciento de las palabras por sinónimos en un fragmento de 400 tokens reduce la detección de aproximadamente el 92 por ciento al 66 por ciento. Si se sustituye una cuarta parte de las palabras, la detección cae al 17 por ciento. En la práctica, basta con una ligera reescritura para burlarla.

Esa fragilidad quizá no sea del todo mala para OpenAI. Si su marca de agua fuera mucho más difícil de eliminar, los usuarios que quieren mantener en privado su uso de ChatGPT podrían pasarse a modelos de pesos abiertos.

Anthropic no ha publicado tasas de detección para la marca de agua de Claude, aunque afirma que su sistema resiste bien las ediciones. OpenAI ha publicado un informe técnico que detalla el diseño de textGrain.

La calidad, y lo que una marca de agua no demuestra

OpenAI asegura que la marca de agua no empeora los resultados. Se apoya en pruebas de su modelo puntero Astra, que no mostraron diferencias significativas con la función activada o desactivada en ocho benchmarks, entre ellos GPQA Diamond, BrowseComp y DeepSWE. Sin embargo, esos benchmarks miden razonamiento, navegación y programación, no prosa. No aclaran si cambia la calidad de la redacción. Los críticos han planteado la misma duda sobre la marca de agua de Claude.

OpenAI también es prudente sobre lo que significa un resultado positivo. Detectar una marca de agua no dice nada de cuánto editó o aportó una persona al texto. No acredita la autoría, no atribuye responsabilidades, no identifica a ningún usuario ni confirma que el contenido sea correcto. Y a la inversa: la ausencia de marca de agua no demuestra que lo haya escrito una persona. El texto puede ser demasiado corto, estar editado o traducido, o haberlo generado un modelo que el detector no cubre.

Un detector de acceso restringido

Por ahora, el detector no es público. Algunos investigadores y organizaciones especializadas pueden solicitar acceso mediante un formulario, y OpenAI decidirá caso por caso conforme al Código de Buenas Prácticas de la UE, la guía voluntaria vinculada a la Ley de IA. Anthropic gestiona su API de detección de forma parecida.

La herramienta solo devuelve una respuesta: si se ha encontrado o no una marca de agua de OpenAI. No revela usuarios, prompts ni conversaciones.

El motivo que da OpenAI para la restricción es que el detector puede señalar por error textos sin marcar y pasar por alto marcas de agua reales. La compañía afirma que ampliará el acceso "cuando creamos que los resultados pueden interpretarse de forma responsable", pero no da plazos. Sus herramientas de procedencia ya existentes para imágenes y audio, como openai.com/verify y la Content Provenance API, siguen disponibles públicamente.

Nuestro análisis

El patrón aquí es un cumplimiento normativo que depende de la geografía. OpenAI aplica la marca de agua donde la regulación lo exige y deja la decisión a los desarrolladores en el resto del mundo. Eso indica que es la regulación, y no la filosofía de producto, la que fija los mínimos en la procedencia de los textos. Para los lectores que desarrollan sobre la API, la conclusión práctica es que, fuera de la UE, la marca de agua es ahora un ajuste que depende de ellos.

Las cifras también invitan a la cautela. Una señal cuya detección cae al 17 por ciento tras sustituir una cuarta parte de las palabras es una herramienta pobre para profesores, editores o plataformas que esperan pillar textos generados por IA. La propia OpenAI reconoce que un resultado demuestra poco en un sentido u otro. Quien trate estos detectores como polígrafos probablemente cometerá errores.

Conviene estar atentos a si la publicación en código abierto permite a terceros comparar textGrain con SynthID de forma independiente, y a si Anthropic publica sus propias tasas de detección. La presión de los reguladores sobre los laboratorios de IA, como la investigación de la FTC a OpenAI y Anthropic, también podría empujar a otras jurisdicciones hacia normas de etiquetado al estilo de la UE. Si eso ocurre, la opción voluntaria de hoy podría no durar.