Источник перепечатки статьи: Сердце машины.

Как взвесить компромисс между инструментами искусственного интеллекта, которые улучшают изображение, что часто приводит к его искажению, и изображениями, которые выглядят более реалистично, но которым часто не хватает красоты?

Источник изображения: создано Unbounded AI.

В саспенсах и научно-фантастических произведениях мы часто видим такую ​​сцену: на экране компьютера отображается размытая фотография, затем следователь просит улучшить изображение, и тогда изображение волшебным образом становится четким, открывая важные подсказки.

Это выглядит великолепно, но на протяжении десятилетий это был полностью вымышленный сюжет. Это было трудно сделать даже в тот период, когда возможности генерации искусственного интеллекта начали расти: «Если бы вы просто увеличили изображение, оно стало бы размытым. Было бы много деталей, но все было бы неправильно», — Nvidia применяет глубокое обучение», — сказал Брайан Катандзаро, вице-президент по исследованиям.

Однако в последнее время исследователи начали включать алгоритмы искусственного интеллекта в инструменты для улучшения изображений, упрощая и повышая эффективность процесса. Однако объём данных, которые можно извлечь из любого изображения, всё ещё ограничен. Однако, продолжая совершенствовать алгоритмы улучшения, исследователи находят новые способы справиться с этими ограничениями или даже полностью их преодолеть.

За последнее десятилетие исследователи начали улучшать изображения, используя модели генеративно-состязательных сетей (GAN), которые способны генерировать подробные и впечатляющие изображения.

«Изображения внезапно стали выглядеть гораздо лучше», — сказал Томер Михаэли, инженер-электрик из Технологического института Теониум в Израиле. Но он также был удивлён, обнаружив, что изображения, созданные с помощью генеративно-состязательных сетей (GAN), демонстрируют высокий уровень искажений, который измеряет, насколько улучшенное изображение близко к отображаемой реальности. Изображения, созданные с помощью GAN, выглядят красивыми и естественными, но на самом деле они «выдумывают» или «воображают» неточные детали, что приводит к сильному искажению.

Михаэли заметил, что область реставрации фотографий делится на две категории: одна демонстрирует прекрасные изображения, многие из которых были созданы с помощью генеративно-состязательных сетей (GAN), и другая демонстрирует данные, но не показывает много изображений, потому что они выглядят не очень хорошо.

В 2017 году Михаэли и его аспирант Йохай Блау более формально исследовали, как различные алгоритмы улучшения изображений работают с точки зрения искажений и качества восприятия, используя известные метрики качества восприятия, коррелирующие с субъективным суждением человека. Как и ожидал Михаэли, некоторые алгоритмы обеспечивали очень высокое качество изображения, в то время как другие были очень точными с очень низким уровнем искажений. Но ни один из них не сочетал в себе преимущества обоих подходов; приходилось выбирать один из них. Это называется компромиссом между восприятием и искажениями.

Михаэли также бросил вызов другим исследователям, предложив разработать алгоритмы, обеспечивающие наилучшее качество изображения при заданном уровне искажения, чтобы можно было провести объективное сравнение алгоритмов для создания красивых изображений и алгоритмов для качественной статистики. С тех пор сотни исследователей искусственного интеллекта представили данные об искажении и качестве восприятия, полученные с помощью своих алгоритмов, ссылаясь на статью Михаэли и Блау, описывающую этот компромисс.

Иногда влияние компромисса между восприятием и искажением не так уж и велико. Например, компания Nvidia обнаружила, что экраны высокой чёткости некорректно отображают некоторые визуальные материалы низкой чёткости, поэтому в феврале она выпустила инструмент, использующий глубокое обучение для улучшения качества потокового видео. В данном случае инженеры Nvidia предпочли качество восприятия точности, приняв тот факт, что при повышении разрешения алгоритма будут появляться некоторые визуальные детали, которых не было в исходном видео.

«Модель фантазирует. Всё это лишь догадки», — сказал Катанзаро. «Ничего страшного, если модель с суперразрешением в большинстве случаев ошибается, главное, чтобы она была последовательной».

Изображение кровотока в мозге мыши (слева) и то же изображение после использования инструментов искусственного интеллекта для улучшения качества и точности изображения. Автор изображения: Цзюньцзе Яо и Сяои Чжу, Университет Дьюка.

В частности, приложения в исследованиях и медицине потребуют большей точности. Технологии искусственного интеллекта достигли значительного прогресса в визуализации, но «иногда они могут приводить к нежелательным побочным эффектам, таким как переобучение или добавление ложных признаков, поэтому к ним следует относиться с крайней осторожностью», — сказал Цзюньцзе Яо, биомедицинский инженер из Университета Дьюка.

В прошлом году в своей статье он описал, как использовать инструменты ИИ для усовершенствования существующих методов измерения мозгового кровотока и метаболизма, работая безопасно с точной стороны компромисса между восприятием и искажением.

Один из способов обойти ограничения на объём данных, которые можно извлечь из изображения, — это просто объединить данные из нескольких снимков. Исследователи, изучающие окружающую среду с помощью спутниковых снимков, уже добились определённого прогресса в интеграции визуальных данных из разных источников: в 2021 году учёные из Китая и Великобритании объединили данные с двух разных типов спутников, чтобы лучше оценить обезлесение в бассейне реки Конго, втором по величине тропическом лесу в мире и одном из самых богатых биоразнообразием регионов. Исследователи взяли данные с двух спутников Landsat, которые десятилетиями измеряли обезлесение, и использовали методы глубокого обучения для увеличения разрешения изображений с 30 до 10 метров. Затем они объединили этот набор изображений с данными с двух спутников Sentinel-2, которые оснащены несколько разными детекторными решётками. Их эксперименты показали, что такое объединённое изображение «позволяет обнаружить на 11–21% больше нарушенных участков, чем при использовании только снимков Sentinel-2 или Landsat-7/8».

Если прямой прорыв невозможен, Михаэли предлагает другой способ жёстко ограничить доступную информацию. Вместо того, чтобы искать точный ответ на вопрос о том, как улучшить изображение низкого качества, лучше позволить модели продемонстрировать несколько различных интерпретаций исходного изображения. В статье (Explorable Super Resolution) он показал, как инструменты улучшения изображений могут предоставлять пользователям различные рекомендации. Размытое изображение с низким разрешением, на котором человек, одетый в, судя по всему, серую рубашку, может быть преобразовано в изображение с более высоким разрешением, на котором рубашка может быть черно-белой в вертикальные, горизонтальные полосы или в клетку — все эти варианты одинаково разумны.

В другом примере Михаэли сделал низкокачественную фотографию номерного знака и использовал улучшение изображения с помощью искусственного интеллекта, чтобы показать, что цифра 1 на номерном знаке, скорее всего, похожа на 0. Но когда изображение было обработано с помощью другого, более открытого алгоритма, разработанного Михаэли, число с одинаковой вероятностью стало похоже на 0, 1 или 8. Такой подход может помочь исключить другие числа, не делая ошибочного вывода о том, что это число — 0.

Мы можем развеять эти иллюзии, но мощная кнопка «усиления», помогающая раскрывать преступления, остается мечтой.

Поскольку различные дисциплины в различных областях по-своему изучают компромисс между восприятием и искажением, основными вопросами остаются: сколько информации можно извлечь из изображений, полученных с помощью ИИ, и в какой степени этим изображениям можно доверять.

«Мы должны помнить, что для того, чтобы вывести эти прекрасные изображения, алгоритм просто придумывает детали», — сказал Михаэли.

Оригинальная ссылка: https://www.quantamagazine.org/the-ai-tools-making-images-look-better-20230823/