В течение последних трех лет изображения, созданные искусственным интеллектом, можно было обнаружить тренированным глазом — тонкие жесты в руках, несоответствия освещения, жуткая долина лиц, которые выглядели почти правильно, но не совсем. Эта эпоха закончилась. Последнее поколение имиджевых моделей преодолело порог, до которого, по прогнозам исследователей, оставалось еще два или три года, и последствия для средств массовой информации, законодательства и общественного доверия весьма значительны.
Новые модели
Три модели, выпущенные за последние шесть месяцев — Midjourney v8, Adobe Firefly 4 и Google Imagen 4 — независимо друг от друга перешагнули порог фотореализма. В слепых тестах, проведенных исследователями из Медиа-лаборатории Массачусетского технологического института и опубликованных в препринте на arXiv, оценщики правильно идентифицировали изображения, сгенерированные ИИ, только в 51,3% случаев, что статистически неотличимо от случайного угадывания. В исследовании использовалось 10 000 пар изображений, показанных 2400 участникам, что сделало его крупнейшей на сегодняшний день контролируемой оценкой обнаружения изображений ИИ.
Результаты были получены по категориям изображений: портреты, пейзажи, архитектурные фотографии, снимки продуктов и документальные изображения в новостном стиле. Участники с профессиональным фотографическим опытом показали себя не лучше, чем остальные участники. Единственной категорией, в которой люди сохраняли значимую способность обнаружения, были изображения, изображающие конкретные события реального мира, где контекстное знание, а не визуальный анализ, способствовало правильной идентификации.
Что изменилось технически
Прорыв произошел благодаря сочетанию улучшенной диффузионной архитектуры, обучения на тщательно подобранных наборах данных более высокого качества и новой методике под названием «рендеринг с учетом физики», которая моделирует поведение света с беспрецедентной точностью. Предыдущие модели боролись с зеркальными бликами, подповерхностным рассеянием на коже и сложным взаимодействием света с полупрозрачными материалами. Новые модели справляются со всем этим правильно.
Руки — долгое время являвшиеся контрольным признаком поколения ИИ — теперь визуализируются с анатомической точностью. Модели узнали не только, как выглядят руки, но и как они деформируются под разным хватом, как появляются сухожилия и вены при разном освещении и как пальцы перекрывают друг друга в сложных позах. В техническом отчете Adobe это объясняется специальным модулем генерации рук, обученным на наборе данных из 50 миллионов фотографий рук с точными анатомическими аннотациями.
Кризис проверки
Последствия для средств массовой информации, судебных разбирательств и общественного доверия будут серьезными. Существующие инструменты обнаружения искусственного интеллекта, в том числе SynthID от Google и Content Credentials от Microsoft, не могут обнаружить изображения новейших моделей с частотой выше 60%. Стандарт C2PA (Коалиция за происхождение и подлинность контента), который внедряет метаданные криптографического происхождения в изображения во время создания, предлагает более надежное решение — но только для изображений, созданных инструментами, реализующими этот стандарт, и только если метаданные не удаляются при передаче.
Новостные организации отвечают новыми протоколами проверки. Associated Press, Reuters и AFP за последние три месяца обновили свои рекомендации по проверке изображений, требуя дополнительных проверок происхождения любого изображения из источника, который не может быть проверен независимо. Некоторые из них вложили средства в специальные группы по обнаружению ИИ. Но фундаментальная проблема — что один только визуальный анализ уже не может надежно отличить настоящее от синтетического — не имеет чистого технического решения.
Юридические и доказательные последствия
Суды в Австралии, Великобритании и США пытаются решить вопрос о допустимости фотографических доказательств в эпоху необнаружимых синтетических изображений. Федеральные правила доказывания в США не были обновлены с учетом изображений, созданных ИИ, и судьи применяют существующие стандарты аутентификации, которые были разработаны для эпохи, когда фотографии считались предположительно подлинными, к принципиально иному ландшафту доказательств.
Несколько громких дел уже осложнились доказательствами изображений ИИ. В деле о клевете в Новом Южном Уэльсе ответчик представил сгенерированные искусственным интеллектом изображения, якобы показывающие истца в компрометирующей ситуации; в конечном итоге изображения были идентифицированы как синтетические посредством анализа метаданных, но этот случай выявил уязвимость существующей правовой базы.
Творческие приложения
Для законного творческого использования новые модели являются преобразовательными. Кинопроизводители используют их для предварительной визуализации, снижая стоимость разработки концепции на 80–90%. Рекламные агентства создают фотореалистичные снимки продуктов без физической фотографии. Архитекторы создают визуализации, неотличимые от фотографий завершенных зданий. Креативная экономика перестраивается вокруг этих инструментов независимо от того, готова индустрия к этому или нет.
Экономический сбой в коммерческой фотографии значителен. Платформы стоковой фотографии сообщают о 40-процентном снижении количества новых заявок от авторов за последние 12 месяцев, поскольку покупатели все чаще создают собственные изображения, а не лицензируют существующие. Профессиональные фотографы, чья работа использовалась для обучения этих моделей — без компенсации или согласия — подают коллективные иски в нескольких юрисдикциях.
Источники и дополнительная литература
- arXiv — «Обнаружение изображений, созданных искусственным интеллектом: обзор методов и критериев» (2024 г.)
- C2PA — Коалиция за происхождение и подлинность контента, открытый стандарт происхождения изображений.
- Adobe — официальный документ Content Authenticity Initiative и техническая документация Firefly 4
- MIT Media Lab — исследования в области обнаружения синтетических медиа и изучения человеческого восприятия.
- Midjourney — демонстрация v8 и документация по возможностям