Una de las dificultades más incómodas de la seguridad en inteligencia artificial es que, para saber si un modelo puede producir contenido dañino, muchas veces hay que ponerlo a prueba y observar qué genera. Pero ese criterio deja de funcionar cuando el contenido en cuestión es ilegal. Un equipo de MIT y la organización Thorn propuso una alternativa: auditar el modelo sin pedirle nunca que produzca la salida prohibida.
El trabajo se enfocó en modelos generativos de código abierto que pueden ser reajustados para tareas específicas mediante adaptaciones livianas. Esa flexibilidad volvió más fácil personalizarlos para usos legítimos, pero también para fines dañinos. En este caso, los investigadores buscaron detectar si un modelo había sido ajustado para producir material de abuso sexual infantil, un terreno en el que la evaluación tradicional choca con límites legales y éticos evidentes.
En lugar de mirar imágenes generadas, la técnica examina cómo cambió el funcionamiento interno del modelo después del ajuste. El método, que los autores llaman Gaussian probing, introduce datos aleatorios y analiza cómo esas señales se transforman dentro de distintas capas del sistema. La idea es que esas huellas internas permiten inferir si el modelo fue especializado para una capacidad dañina, aunque nunca se lo lleve hasta la etapa final de generación. Según MIT News y el preprint enlazado por la propia nota, el procedimiento distinguió con precisión total, dentro de su conjunto de prueba, entre adaptaciones seguras y adaptaciones diseñadas para producir ese tipo de material ilegal.
La importancia del resultado no está solo en el caso concreto. También ofrece una salida a un problema más amplio: cómo auditar miles de variantes de modelos generativos sin depender siempre de pruebas manuales, costosas o psicológicamente riesgosas para quienes evalúan. Si un enfoque así funciona de manera robusta, plataformas que alojan modelos abiertos podrían detectar adaptaciones peligrosas antes de que se distribuyan con más amplitud, y sumar una capa extra de control en un punto donde hoy hay pocos instrumentos prácticos.
Al mismo tiempo, conviene leer el hallazgo con cautela. El trabajo fue presentado en un workshop asociado a ICML y circula como prepublicación en arXiv, no como un artículo ya consolidado en una revista revisada por pares. Además, la precisión reportada depende del conjunto de modelos y adaptaciones usados en la prueba. Queda por ver cómo responde el método frente a más arquitecturas, estrategias para esquivar la detección y escenarios reales de despliegue. Aún con esas limitaciones, el estudio plantea una idea con valor público claro: en ciertos riesgos de IA, la forma más útil de evaluar un sistema puede ser no dejarlo generar nunca aquello que se quiere impedir.
New method aims to keep kids safe from illegal AI-generated content · MIT News Research
MIT News | Massachusetts Institute of Technology · Imagen acompañante del artículo fuente; atribución preservada · Fuente de imagen
Suriyakumar, V. M., Sekhari, A., Stempfle, L., Wang, R., Simpson, M., Portnoff, R., Ghassemi, M., & Wilson, A. C. (2026). Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM (Version 1). arXiv. https://doi.org/10.48550/arXiv.2604.25119
Relacionadas por categoría
Ver masUna ventana al interior de los chatbots ayuda a anticipar conductas problemáticas
Un estudio del MIT probó una interfaz que muestra señales internas de un chatbot antes de usarlo y encontró que puede ayudar a anticipar rasgos como complacencia excesiva, toxicidad o empatía aparente.
Los modelos de lenguaje ya pueden anticipar resultados de experimentos sociales
Un estudio en Nature halló que modelos de lenguaje como GPT-4 pueden prever, con bastante acierto, el resultado de muchos experimentos de ciencias sociales.
Una plataforma de IA permite seguir en tiempo real el comportamiento animal sin equipos de alto costo
Un equipo presentó una plataforma que combina etiquetado, entrenamiento y análisis en tiempo real para seguir la postura y el movimiento de animales con precisión comparable a sistemas más pesados y costosos.
Más de la misma fuente
Ver masNubes difusas de materia bariónica “pérdida” rodean a la mayoría de las galaxias
Un análisis con ráfagas rápidas de radio sugiere que buena parte de la materia ordinaria faltante del universo está dispersa en nubes muy extendidas alrededor de grupos de galaxias.
Un puente de concreto impreso en 3D muestra cómo construir con menos carbono
Un equipo del MIT diseñó e imprimió un puente de concreto de 2,3 metros con un sistema que adapta el diseño a los límites reales de la impresora, una vía para usar menos material en construcción.
Los campos eléctricos del cerebro podrían explicar parte de su variabilidad momento a momento
Un estudio en monos sugiere que parte de las oscilaciones cambiantes de la actividad cerebral no dependen solo de las neuronas, sino también de los campos eléctricos locales que ellas mismas generan.
Más del mismo autor
Ver masEl LHC encuentra nuevas pistas del plasma primordial en choques de oxígeno
Las cuatro grandes colaboraciones del LHC detectaron nuevas señales de plasma de quarks y gluones en colisiones de oxígeno y neón, lo que sugiere que ese estado extremo puede surgir en sistemas más pequeños.
Los castigos previos pueden dificultar aprender de las recompensas
Un estudio con 159 participantes encontró que, cuando una misma opción arrastra un historial de castigos, aprender de sus recompensas se vuelve más difícil y aumenta la exploración.
Lantana camara: una planta invasora que se propaga sin diversidad genética
Un estudio con 359 plantas de India reveló que Lantana camara, una de las especies invasoras más problemáticas del mundo, se reproduce principalmente por autofecundación y existe como líneas genéticas idénticas.