Старые фотографии постепенно теряют детали. Бумага выцветает, на снимке появляются шум и пятна, отдельные участки пропадают, лица расплываются, а цифровые копии после многократного сжатия покрываются дополнительными искажениями. Обычный фильтр способен повысить резкость или приглушить шум, но восстановить человеческое лицо гораздо сложнее. Алгоритму нужно сохранить форму глаз, носа, рта, линию волос, очертания головы, текстуру кожи и другие признаки, по которым можно узнать человека.
Особенно трудно работать со снимками, где одновременно присутствуют несколько дефектов. Фотография может быть размытой, иметь низкое разрешение, содержать шум и потерянные фрагменты. Каждый новый дефект уменьшает количество исходной информации, на которую может опереться программа.
Многие системы на основе искусственного интеллекта учат на парах изображений. Разработчики берут качественную фотографию, искусственно портят ее, а затем показывают нейросети поврежденную и исходную версии. Так алгоритм учится устранять знакомые виды искажений. Подход хорошо работает, пока реальные повреждения похожи на примеры из обучающего набора.
С архивными и бытовыми фотографиями возникает другая ситуация. Заранее собрать обучающие пары для всех сочетаний размытия, шума, царапин, пропавших областей и следов сжатия практически невозможно. Реальный снимок часто портился годами и проходил через несколько способов хранения и оцифровки, поэтому набор дефектов может сильно отличаться от искусственно подготовленных данных.
Система GenR решает задачу иначе. Разработчики создали метод слепой реставрации лиц, которому не нужны пары из поврежденного снимка и заранее известного качественного оригинала. Слово «слепой» означает, что программа заранее не получает точного описания дефекта и должна восстановить лицо по сохранившейся визуальной информации. Исследование опубликовано в журнале Pattern Recognition Letters.
В основе GenR работает генеративная модель StyleGAN3. StyleGAN3 умеет превращать числовое представление из латентного пространства в реалистичное изображение. Латентное пространство можно представить как набор параметров, которыми генератор описывает форму лица, положение головы, черты, волосы, текстуру кожи и множество других визуальных признаков. Сам термин «латентное пространство» используется в русскоязычных материалах по генеративным моделям.
GenR запускает StyleGAN3 в обратном направлении. Вместо генерации случайного лица программа ищет набор параметров, способный воспроизвести конкретного человека с поврежденной фотографии. Процесс называют инверсией генеративной модели. Алгоритм постепенно меняет латентный код и проверяет, насколько полученное лицо соответствует информации, сохранившейся на исходном кадре.
GenR не может физически вернуть сведения, полностью исчезнувшие из фотографии. Если несколько пикселей когда-то содержали изображение глаза, а затем превратились в однородное пятно, точная форма глаза больше не записана в файле. Генеративная модель предлагает правдоподобный вариант на основе знаний о человеческих лицах и одновременно старается согласовать результат с доступными фрагментами снимка.
Главная опасность возникает именно на границе между восстановлением и генерацией. Нейросеть способна получить красивое и четкое лицо, добавив ресницы, изменив форму глаз, скорректировав подбородок или дорисовав фактуру кожи. Визуальная убедительность при этом не гарантирует сходства с человеком на оригинальной фотографии. Исследования слепой реставрации лиц отдельно рассматривают проблему, при которой сильно поврежденный исходник приводит к реалистичному, но неверному с точки зрения личности результату.
Чтобы снизить риск лишней генерации, GenR восстанавливает изображение поэтапно. Сначала алгоритм занимается крупной структурой лица: положением головы, общей геометрией и признаками, от которых зависит узнаваемость. На следующем этапе программа точнее подгоняет глаза, нос, челюсть и другие элементы среднего масштаба. Только после фиксации основной формы начинается работа с мелкой текстурой кожи, волосами и небольшими визуальными деталями.
Постепенное увеличение числа доступных параметров не дает модели сразу подстроить каждый участок изображения независимо от остальных. Если предоставить генератору слишком много свободы в начале оптимизации, программа может начать воспроизводить шум и случайные повреждения или добавлять детали, которых никогда не было на фотографии. Такой эффект относится к переобучению: модель слишком точно приспосабливается к конкретному входному изображению и теряет способность отделять полезную информацию от дефектов.
GenR использует три уровня латентного представления. Сначала оптимизация проходит в пространстве W, где сравнительно небольшое число параметров ограничивает изменения и помогает найти общую структуру лица. Затем алгоритм переходит в W+, позволяющее отдельным слоям генератора работать со своими латентными векторами и точнее корректировать отдельные черты. Заключительный этап использует W++, где число управляемых параметров еще выше и система получает возможность дорабатывать мелкие элементы.
Одного сравнения пикселей для выбора лучшего варианта недостаточно. Небольшой сдвиг изображения способен заметно увеличить математическую разницу между двумя почти одинаковыми фотографиями, хотя человек практически не заметит изменения. GenR поэтому оценивает результат сразу несколькими способами.
Среди используемых критериев есть LPIPS, метрика перцептивного сходства изображений. LPIPS сравнивает не отдельные пиксели, а признаки, извлеченные нейросетью, и помогает оценить визуальную близость двух картинок с учетом особенностей человеческого восприятия. Чем меньше значение LPIPS, тем ближе изображения по используемой метрике.
Дополнительно алгоритм учитывает индекс структурного сходства SSIM. Метрика сравнивает структуру изображений и используется для оценки качества с учетом изменений яркости, контраста и локальных деталей. GenR также анализирует градиенты и применяет L1-функцию потерь, которая измеряет абсолютную разницу между значениями соответствующих элементов.
Сравнение выполняется на нескольких масштабах. Сначала программа сопоставляет крупные структуры, затем постепенно переходит к мелким деталям. Если часть фотографии полностью отсутствует, специальная маска исключает неизвестную область из прямого сравнения. Алгоритму не приходится подгонять результат под пиксели, которых в оригинале нет.
Разработчики проверили GenR на четырех видах повреждений. В первом эксперименте программа удаляла случайный визуальный шум, который проявляется как хаотические изменения яркости или цвета. Во втором повышала разрешение маленьких изображений и восстанавливала более четкие детали лица.
Третья задача проверяла заполнение пропущенных областей. Часть исходной фотографии намеренно закрывали, после чего GenR должна была восстановить недостающий участок так, чтобы новая область согласовывалась с остальным лицом. Четвертый тест касался артефактов изображения, включая размытие и пикселизацию.
Отдельные испытания объединили несколько повреждений. Исследователи составляли последовательности из двух, трех и четырех видов деградации, а интенсивность дефектов менялась от сравнительно небольшой до очень высокой. Проверка приближает эксперимент к реальным архивным фотографиям, где один кадр может одновременно потерять разрешение, покрыться шумом, размыться и лишиться отдельных фрагментов.
Для оценки результата использовали метрики NIQE, MUSIQ и TOPIQ, которые позволяют анализировать визуальное качество без обязательного сравнения с идеальным оригиналом. GenR сопоставляли с другими генеративными, диффузионными и трансформерными методами восстановления. По результатам испытаний система сохраняла конкурентоспособное качество при одиночных и смешанных повреждениях.
Обработка снимка с одним видом дефекта занимала около 30 секунд. Один конвейер справлялся с удалением шума, повышением разрешения, заполнением пропусков и устранением артефактов. Для каждого варианта повреждений не требовалась отдельная обученная модель.
При сильном разрушении фотографии остается серьезное ограничение. Чем меньше исходных деталей сохранилось, тем больше информации генератор вынужден добавлять самостоятельно. GenR способна получить чистое и естественное лицо даже из очень плохого кадра, однако восстановленный человек может отличаться от настоящего.
Ограничение особенно важно для криминалистики. Старую или размытую запись камеры наблюдения можно сделать визуально четче и затем использовать для дополнительного анализа, однако результат генеративной реконструкции нельзя автоматически считать достоверным портретом подозреваемого. Четкость не показывает, какие черты сохранились в исходной записи, а какие добавила нейросеть.
Более безопасный сценарий связан с реставрацией семейных архивов, исторических фотографий и старой кинохроники. GenR также можно применять для улучшения лиц в видеосвязи и социальных сетях. Возможность работать без отдельного набора обучающих пар особенно полезна для изображений, историю повреждения и обработки которых установить невозможно.
Параллельно разработчики исследовали противоположную задачу: генерацию видео по текстовому описанию. Метод Video-ASTAR предназначен для случаев, когда в запросе одновременно присутствуют несколько персонажей, предметов, цветов и действий, а генератор должен сохранить заданные признаки на протяжении всего ролика. Работа представлена на конференции WACV 2026.
Проблему легко увидеть на запросе про девочку, которая бежит по парку с розовым воздушным шариком и смотрит на коричневого котенка возле дерева. Генератор может правильно собрать первый кадр, а затем постепенно потерять часть условий. Розовый шарик меняет цвет, дерево исчезает, предмет оказывается возле другого персонажа или действие перестает соответствовать описанию.
Причина связана с механизмом внимания, который помогает генеративной модели сопоставлять слова запроса с областями изображения. При большом количестве объектов и признаков связь между словом и нужным участком кадра может ослабнуть. Тогда описание шарика перестает достаточно сильно управлять самим шариком, а признаки разных объектов начинают смешиваться.
Video-ASTAR вмешивается в механизм внимания во время генерации и не требует дополнительного обучения базовой видеомодели. Алгоритм обрабатывает карты внимания, которые показывают, какие области кадра связаны с отдельными словами запроса. Система старается удерживать разные понятия за соответствующими объектами во времени, чтобы цвет шарика продолжал относиться к шарику, а описание котенка не влияло на соседние элементы сцены.
Для более точной связи между объектами и действиями разработчики используют дополнительную функцию ошибки, которая учитывает центры областей внимания. В экспериментах Video-ASTAR работал поверх уже обученной модели VideoCrafter2, поэтому авторам не пришлось заново обучать крупный генератор видео.
Еще одна задача касается последовательности движений. Если несколько связанных запросов меняют действие одного персонажа, фон, внешность героя и остальные элементы желательно сохранить. Video-ASTAR использует перестановку токенов и интерполяцию латентных представлений, чтобы соседние состояния лучше согласовывались между собой и переход от одного действия к другому не заставлял генератор заново перестраивать сцену.
Эксперименты показали более точное соответствие текстовому запросу, лучшую композиционную согласованность и более стабильное поведение объектов между кадрами по сравнению с базовыми методами, выбранными авторами для тестирования.
GenR решает задачу восстановления уже существовавшего изображения, а Video-ASTAR создает видеоряд по описанию. В обоих проектах разработчики пытаются ограничить свободу генеративной модели там, где свободная генерация начинает искажать исходные данные. Для GenR главным ограничителем служат сохранившиеся черты человека на фотографии. Video-ASTAR удерживает объекты, цвета и действия возле соответствующих слов текстового запроса.