Cuando un generador de imágenes crea un retrato, una ilustración o una escena fantástica, una de las preguntas más discutidas es de dónde salió realmente esa imagen. ¿Puede vincularse con una obra concreta del conjunto de entrenamiento? ¿Se parece a un artista específico porque lo copió o porque aprendió patrones más generales? Un estudio de MIT sugiere que, en muchos casos, esa búsqueda puede no tener una respuesta clara.
El trabajo, publicado en Nature Communications, analizó modelos de difusión, la familia de sistemas que hoy domina la generación automática de imágenes. Los investigadores encontraron que, a medida que estos modelos se entrenan con conjuntos de datos más grandes, el peso de cada ejemplo individual se diluye hasta hacerse muy difícil de detectar. El equipo llamó a este fenómeno “decadencia de atribución”.
La idea central es simple, aunque probarla no lo sea. Si se quita una imagen del entrenamiento y la salida del modelo no cambia, entonces esa imagen no parece haber influido de forma decisiva en el resultado. Según los autores, eso también vale si se elimina toda la obra de un artista o todas las fotos de una persona y la imagen generada sigue siendo prácticamente la misma.
Para poner a prueba esa idea, el equipo diseñó una arquitectura llamada “diffusion ensemble”. En lugar de entrenar un único modelo grande, dividieron el aprendizaje en múltiples componentes más pequeños, cada uno expuesto a una parte distinta de los datos. Eso les permitió apagar selectivamente las partes que habían visto cierto material y observar qué cambiaba sin tener que reentrenar el sistema desde cero cada vez.
Los investigadores compararon 24 de estos conjuntos con modelos de difusión convencionales entrenados sobre los mismos datos. Después probaron qué pasaba cuando eliminaban ejemplos del entrenamiento en colecciones que iban desde 256 imágenes hasta más de 160.000. El patrón fue consistente: cuanto mayor era la base de datos, menor era el efecto detectable de quitar una imagen concreta. En otras palabras, la salida parecía depender cada vez menos de una fuente individual y más de una mezcla estadística mucho más distribuida.
Eso no significa que los modelos sean mágicamente independientes de sus datos. Siguen aprendiendo de ellos y sin ese material no existirían. Lo que cambia, según el estudio, es la posibilidad de señalar una imagen específica y decir: “esta salida viene de aquí”. Para los autores, en modelos grandes ese vínculo puede disolverse hasta volverse inapreciable.
El resultado importa porque toca un debate que ya salió de los laboratorios. Empresas tecnológicas, artistas, jueces y legisladores discuten si las imágenes generadas por IA deben tratarse como obras derivadas de material protegido por derechos de autor. Este estudio no resuelve por sí solo esa discusión, pero sí complica la idea de que siempre pueda encontrarse una línea directa entre una salida y una obra individual del entrenamiento.
También hay una consecuencia científica y técnica. Si el hallazgo se sostiene en otros contextos, puede cambiar cómo se investiga la influencia de los datos en sistemas generativos y cómo se diseñan herramientas para auditar modelos. El artículo plantea, además, que entender esta pérdida de rastro podría ayudar a construir sistemas en los que sea más claro cuándo una semejanza se debe a copia y cuándo surge de combinaciones más generales aprendidas por el modelo.
El estudio, sin embargo, tiene límites importantes. Se centró en generadores de imágenes basados en difusión, no en modelos de lenguaje como los que están en el centro de muchos conflictos actuales sobre texto e IA. Además, la “decadencia de atribución” no implica que desaparezcan todos los problemas de propiedad intelectual, sesgo o uso indebido de datos. Solo muestra que, en ciertos modelos y a determinada escala, rastrear una salida hasta un ejemplo concreto puede dejar de ser una estrategia útil.
Esa distinción es importante. La investigación no dice que entrenar con obras ajenas sea irrelevante ni que la discusión legal esté cerrada. Lo que muestra es algo más incómodo: puede llegar un punto en que el modelo siga dependiendo del conjunto completo de datos, pero ya no de una pieza individual de manera demostrable. Para un debate público que suele buscar responsables claros y cadenas de influencia precisas, ese resultado vuelve el problema mucho más difícil de encajar.
When AI art has no author: Study finds generated images often can’t be traced to training data · MIT News Research
Ciencias.uy / MiniMax image-01 · Imagen generada con MiniMax image-01 para Ciencias.uy; uso editorial no comercial; CC BY 4.0 · Fuente de imagen
Dai, Z., & Gifford, D. K. (2026). Outputs of generative diffusion models are often unattributable. Nature Communications, 17, 6974. https://doi.org/10.1038/s41467-026-75667-5
Relacionadas por categoría
Ver masUn método combina mapas moleculares e imágenes para leer la organización de un tejido
SpaMOAL integra imágenes histológicas, ubicación y señales moleculares para distinguir regiones de un tejido con mayor detalle.
Un método busca que la IA generativa respete límites de seguridad sin reentrenarse
HardFlow guía modelos generativos para que sus resultados cumplan restricciones estrictas, como evitar choques en una trayectoria robótica, sin tener que volver a entrenarlos.
Un sistema ayuda a anticipar cuándo puede fallar un vehículo autónomo
Un método del MIT traduce en conceptos comprensibles parte del razonamiento de un vehículo autónomo y ayuda a que humanos anticipen mejor sus errores.
Más de la misma fuente
Ver masUn programa de reparación del intestino puede ayudar al cáncer colorrectal a diseminarse
Experimentos con organoides, ratones y datos de pacientes muestran cómo un programa normal de reparación puede facilitar la llegada de células tumorales al hígado.
Un dispositivo recoge células vivas sin perder la muestra para patología
Un prototipo microfluídico recuperó células vivas de zonas precisas de trompas de Falopio recién extraídas y conservó el tejido restante para el análisis patológico.
Cómo el cerebro mantiene separadas las opciones al decidir
Un experimento con dos macacos muestra que grupos flexibles de neuronas reorganizan su actividad para distinguir las opciones antes y después de una elección.
Más del mismo autor
Ver masUn biorreactor sólido acerca mejor el metano a las bacterias
Unos andamios impresos en 3D mejoraron la conversión de metano en succinato en pruebas de laboratorio al evitar una barrera habitual de los reactores líquidos.
Así se degradan los escudos térmicos durante la reentrada
Imágenes de rayos X y análisis computacional muestran cómo cambia por dentro un material que se sacrifica para proteger naves durante la reentrada.
Un programa de reparación del intestino puede ayudar al cáncer colorrectal a diseminarse
Experimentos con organoides, ratones y datos de pacientes muestran cómo un programa normal de reparación puede facilitar la llegada de células tumorales al hígado.