Durante los últimos tres años, las imágenes generadas por IA han sido detectables por ojos entrenados: señales sutiles en las manos, inconsistencias en la iluminación, el extraño valle de rostros que parecían casi correctos pero no del todo. Esa era ha terminado. La última generación de modelos de imágenes ha cruzado un umbral que los investigadores predecían que aún faltaban dos o tres años, y las implicaciones para los medios, las leyes y la confianza del público son profundas.

Los nuevos modelos

Tres modelos lanzados en los últimos seis meses (Midjourney v8, Adobe Firefly 4 e Imagen 4 de Google) han cruzado de forma independiente el umbral del fotorrealismo. En pruebas ciegas realizadas por investigadores del Media Lab del MIT y publicadas en una preimpresión en arXiv, los evaluadores humanos identificaron correctamente las imágenes generadas por IA sólo el 51,3% de las veces, estadísticamente indistinguibles de las conjeturas aleatorias. El estudio utilizó 10.000 pares de imágenes mostradas a 2.400 participantes, lo que la convierte en la evaluación controlada más grande de detección de imágenes con IA hasta la fecha.

Los resultados se mantuvieron en todas las categorías de imágenes: retratos, paisajes, fotografía de arquitectura, fotografías de productos e imágenes documentales de estilo periodístico. Los participantes con experiencia en fotografía profesional no obtuvieron mejores resultados que la población general. La única categoría en la que los humanos conservaron una capacidad de detección significativa fueron las imágenes que representaban eventos específicos del mundo real, donde el conocimiento contextual, no el análisis visual, impulsó la identificación correcta.

Lo que cambió técnicamente

El avance provino de una combinación de arquitecturas de difusión mejoradas, capacitación en conjuntos de datos seleccionados de mayor calidad y una nueva técnica llamada "renderización consciente de la física" que modela el comportamiento de la luz con una precisión sin precedentes. Los modelos anteriores lucharon con reflejos especulares, dispersión subsuperficial en la piel y la compleja interacción de la luz con materiales translúcidos. Los nuevos modelos manejan todo esto correctamente.

Las manos, que durante mucho tiempo fueron el signo revelador de la generación de IA, ahora se representan con precisión anatómica. Los modelos han aprendido no sólo cómo son las manos, sino también cómo se deforman bajo diferentes agarres, cómo aparecen los tendones y las venas bajo diferentes condiciones de iluminación y cómo los dedos se ocluyen entre sí en posturas complejas. El informe técnico de Adobe atribuye esto a un módulo dedicado de generación de manos entrenado en un conjunto de datos de 50 millones de fotografías de manos con anotaciones anatómicas precisas.

La crisis de la verificación

Las implicaciones para los medios, los procedimientos legales y la confianza pública son graves. Las herramientas de detección de IA existentes, incluidas SynthID de Google y Content Credentials de Microsoft, no detectan imágenes de los modelos más nuevos en tasas superiores al 60%. El estándar C2PA (Coalición para la procedencia y autenticidad del contenido), que incorpora metadatos de procedencia criptográfica en las imágenes en el momento de la creación, ofrece una solución más confiable, pero solo para imágenes creadas por herramientas que implementan el estándar, y solo si los metadatos no se eliminan en tránsito.

Las organizaciones de noticias están respondiendo con nuevos protocolos de verificación. Associated Press, Reuters y AFP han actualizado sus pautas de verificación de imágenes en los últimos tres meses, exigiendo verificaciones de procedencia adicionales para cualquier imagen de una fuente que no pueda verificarse de forma independiente. Varios han invertido en equipos dedicados a la detección de IA. Pero el problema fundamental (que el análisis visual por sí solo ya no puede distinguir de manera confiable lo real de lo sintético) no tiene una solución técnica clara.

Implicaciones legales y probatorias

Los tribunales de Australia, el Reino Unido y los Estados Unidos están lidiando con la admisibilidad de la evidencia fotográfica en una era de imágenes sintéticas indetectables. Las Reglas Federales de Prueba en los EE. UU. no se han actualizado para abordar las imágenes generadas por IA, y los jueces están aplicando los estándares de autenticación existentes (que fueron diseñados para una era en la que las fotografías eran presuntamente auténticas) a un panorama probatorio fundamentalmente diferente.

Varios casos de alto perfil ya se han complicado con la evidencia de imágenes de IA. En un caso de difamación en Nueva Gales del Sur, el acusado introdujo imágenes generadas por IA que pretendían mostrar al demandante en una situación comprometedora; Las imágenes finalmente fueron identificadas como sintéticas mediante el análisis de metadatos, pero el caso puso de relieve la vulnerabilidad de los marcos legales existentes.

Aplicaciones creativas

Para usos creativos legítimos, los nuevos modelos son transformadores. Las productoras cinematográficas los utilizan para la previsualización, reduciendo el coste del desarrollo del concepto entre un 80% y un 90%. Las agencias de publicidad están generando fotografías de productos fotorrealistas sin fotografía física. Los arquitectos están produciendo representaciones indistinguibles de fotografías de edificios terminados. La economía creativa se está reestructurando en torno a estas herramientas, ya sea que la industria esté preparada o no.

La perturbación económica de la fotografía comercial es significativa. Las plataformas de fotografía de archivo informan de una disminución del 40% en las presentaciones de nuevos contribuyentes en los últimos 12 meses, ya que los compradores generan cada vez más imágenes personalizadas en lugar de licenciar las existentes. Los fotógrafos profesionales cuyo trabajo se utilizó para entrenar a estos modelos, sin compensación ni consentimiento, están entablando litigios colectivos en múltiples jurisdicciones.

Fuentes y lecturas adicionales