Przez ostatnie trzy lata obrazy generowane przez sztuczną inteligencję były wykrywalne przez wytrenowane oczy – subtelne znaki w dłoniach, niespójność oświetlenia, niesamowita dolina twarzy, które wyglądały prawie dobrze, ale nie do końca. Ta era się skończyła. Najnowsza generacja modeli obrazu przekroczyła próg, który według przewidywań badaczy pozostał jeszcze za dwa lub trzy lata, a konsekwencje dla mediów, prawa i zaufania publicznego są głębokie.
Nowe modele
Trzy modele wypuszczone na rynek w ciągu ostatnich sześciu miesięcy — Midjourney v8, Adobe Firefly 4 i Google Imagen 4 — niezależnie przekroczyły próg fotorealizmu. W ślepych testach przeprowadzonych przez naukowców z Media Lab MIT i opublikowanych w formie wstępnej na arXiv, osoby oceniające prawidłowo zidentyfikowały obrazy wygenerowane przez sztuczną inteligencję tylko w 51,3% przypadków – statystycznie nie da się ich odróżnić od losowego zgadywania. W badaniu wykorzystano 10 000 par obrazów pokazanych 2400 uczestnikom, co czyni je największą jak dotąd kontrolowaną oceną wykrywania obrazów AI.
Wyniki dotyczyły różnych kategorii obrazów: portretów, krajobrazów, fotografii architektury, zdjęć produktów i zdjęć dokumentalnych w stylu wiadomości. Uczestnicy posiadający doświadczenie w fotografii zawodowej wypadli nie lepiej niż populacja ogólna. Jedyną kategorią, w której ludzie zachowali znaczącą zdolność wykrywania, były obrazy przedstawiające konkretne zdarzenia ze świata rzeczywistego – w przypadku których wiedza kontekstowa, a nie analiza wizualna, umożliwiła prawidłową identyfikację.
Co zmieniło się technicznie
Przełom nastąpił dzięki połączeniu ulepszonych architektur dyfuzyjnych, szkolenia na wybranych zbiorach danych o wyższej jakości i nowej technice zwanej „renderowaniem uwzględniającym fizykę”, która modeluje zachowanie światła z niespotykaną dotąd dokładnością. Poprzednie modele borykały się z odblaskami, podpowierzchniowym rozpraszaniem na skórze i złożoną interakcją światła z półprzezroczystymi materiałami. Nowe modele radzą sobie z tym wszystkim poprawnie.
Dłonie – od dawna charakterystyczny znak generacji sztucznej inteligencji – są teraz renderowane z anatomiczną dokładnością. Modelki dowiedziały się nie tylko, jak wyglądają dłonie, ale także, jak odkształcają się pod wpływem różnych chwytów, jak ścięgna i żyły wyglądają w różnych warunkach oświetleniowych oraz jak palce zamykają się w skomplikowanych pozach. Raport techniczny Adobe przypisuje to specjalnemu modułowi generowania dłoni, wyszkolonemu na zestawie danych obejmującym 50 milionów zdjęć dłoni z precyzyjnymi adnotacjami anatomicznymi.
Kryzys weryfikacji
Konsekwencje dla mediów, postępowań prawnych i zaufania publicznego są poważne. Istniejące narzędzia do wykrywania sztucznej inteligencji — w tym SynthID firmy Google i poświadczenia treści firmy Microsoft — nie wykrywają obrazów z najnowszych modeli z szybkością przekraczającą 60%. Standard C2PA (Coalition for Content Provenance and Authenticity), który osadza metadane pochodzenia kryptograficznego w obrazach na etapie tworzenia, oferuje bardziej niezawodne rozwiązanie — ale tylko w przypadku obrazów tworzonych za pomocą narzędzi wdrażających ten standard i tylko wtedy, gdy metadane nie są usuwane podczas przesyłania.
Organizacje informacyjne odpowiadają, przedstawiając nowe protokoły weryfikacji. Associated Press, Reuters i AFP zaktualizowały w ciągu ostatnich trzech miesięcy swoje wytyczne dotyczące weryfikacji obrazów, wymagając dodatkowej kontroli pochodzenia każdego obrazu ze źródła, którego nie można niezależnie zweryfikować. Kilka z nich zainwestowało w dedykowane zespoły ds. wykrywania sztucznej inteligencji. Jednak podstawowy problem – że sama analiza wizualna nie jest już w stanie wiarygodnie odróżnić rzeczywistości od syntetycznej – nie ma czystego rozwiązania technicznego.
Konsekwencje prawne i dowodowe
Sądy w Australii, Wielkiej Brytanii i Stanach Zjednoczonych zmagają się z dopuszczalnością dowodów fotograficznych w epoce niewykrywalnych obrazów syntetycznych. Federalne zasady dowodowe w USA nie zostały zaktualizowane, aby uwzględnić obrazy generowane przez sztuczną inteligencję, a sędziowie stosują istniejące standardy uwierzytelniania – które zostały opracowane z myślą o czasach, gdy zdjęcia były przypuszczalnie autentyczne – w zasadniczo odmiennym krajobrazie dowodowym.
Kilka głośnych spraw zostało już skomplikowanych ze względu na dowody w postaci obrazów AI. W sprawie o zniesławienie w Nowej Południowej Walii pozwany przedstawił obrazy wygenerowane przez sztuczną inteligencję, które miały przedstawiać powoda w kompromitującej sytuacji; Ostatecznie na podstawie analizy metadanych uznano, że obrazy są syntetyczne, ale sprawa uwypukliła słabość istniejących ram prawnych.
Aplikacje kreatywne
W przypadku legalnych zastosowań kreatywnych nowe modele mają charakter transformacyjny. Firmy zajmujące się produkcją filmową wykorzystują je do prewizualizacji, obniżając koszty opracowania koncepcji o 80–90%. Agencje reklamowe generują fotorealistyczne zdjęcia produktów bez fizycznej fotografii. Architekci tworzą wizualizacje nie do odróżnienia od zdjęć ukończonych budynków. Gospodarka kreatywna podlega restrukturyzacji wokół tych narzędzi, niezależnie od tego, czy przemysł jest na to gotowy, czy nie.
Zakłócenia gospodarcze w fotografii komercyjnej są znaczące. Platformy fotografii stockowej odnotowują 40% spadek liczby zgłoszeń nowych autorów w ciągu ostatnich 12 miesięcy, ponieważ kupujący coraz częściej generują niestandardowe obrazy, zamiast licencjonować istniejące. Zawodowi fotografowie, których prace wykorzystano do szkolenia tych modelek – bez wynagrodzenia i zgody – prowadzą postępowania zbiorowe w wielu jurysdykcjach.
Źródła i dalsze czytanie
- arXiv — „Wykrywanie obrazów generowanych przez sztuczną inteligencję: przegląd metod i punktów odniesienia” (2024)
- C2PA — Koalicja na rzecz pochodzenia i autentyczności treści, otwarty standard pochodzenia obrazów
- Adobe — Biała księga inicjatywy Content Authenticity Initiative i dokumentacja techniczna Firefly 4
- MIT Media Lab — badania nad detekcją mediów syntetycznych i badania ludzkiej percepcji
- Midjourney — prezentacja wersji 8 i dokumentacja możliwości