Кто создал этот белок — человек, природа или ИИ? Google представила SynthID Bio

6535
Кто создал этот белок — человек, природа или ИИ? Google представила SynthID Bio

SynthID Bio переносит идею невидимых водяных знаков из цифрового мира в синтетическую биологию.

image

Белок теперь можно снабдить подписью, которая останется внутри молекулы даже после того, как цифровой проект превратится в физический объект. Google DeepMind представила SynthID Bio, систему невидимой маркировки ИИ-разработок для синтетической биологии. Подход развивает идею SynthID, но вместо текста, изображения или звука метка прячется в аминокислотной последовательности или трёхмерной структуре белка.

SynthID Bio не пытается посмотреть на случайный белок и решить, появился ли тот в природе, лаборатории или нейросети. Система работает иначе. Совместимая модель незаметно меняет выбор аминокислот при проектировании белковой последовательности, формируя статистический сигнал, который затем распознаёт специальный детектор. Поэтому найденная метка подтверждает происхождение из поддерживаемой системы, а её отсутствие ничего не говорит о том, использовал ли кто-то другой ИИ.

Отдельный механизм предназначен для предсказанных трёхмерных структур. Google DeepMind дообучила часть диффузионной сети AlphaFold 3 так, чтобы координаты атомов сразу несли скрытую подпись. Исходный AlphaFold давно помогает восстанавливать форму биомолекул, а новая версия SynthID Bio добавляет к результату ещё и проверяемое происхождение.

Главная сложность заключалась в том, чтобы цифровая подпись не испортила сам белок. Для проверки команда использовала AlphaProteo и модифицированный ProteinMPNN, создав белки, которые связываются с VEGF-A, доменом RBD шиповидного белка SARS-CoV-2 и PD-L1. Лабораторные испытания показали сопоставимые показатели связывания, долю успешных вариантов и разнообразие последовательностей. Возможность проектировать белки без прямого копирования природных последовательностей делает такую проверку происхождения всё актуальнее.

Одна из главных задач SynthID Bio связана с проверкой заказов на синтез ДНК. Такие компании сравнивают полученные последовательности с базами известных опасных организмов и токсинов. Генеративные модели способны создавать молекулы, которые сильно отличаются от известных образцов, поэтому прежняя логика «неизвестная последовательность, значит, скорее всего, природная» постепенно перестаёт работать. Вопрос биобезопасности становится сложнее по мере развития генеративной биологии.

Метка может дать сервису синтеза дополнительный сигнал. Если последовательность пришла из доверенной модели со встроенными ограничениями, проверяющая система сможет подтвердить происхождение и сосредоточить ручной анализ на более подозрительных заказах. Сама подпись не доказывает безопасность молекулы и не заменяет традиционную проверку, а лишь добавляет ещё один уровень происхождения.

Похожий механизм пригодится научным базам Protein Data Bank, UniProt и GenBank, куда исследователи загружают новые биологические данные. Ошибочно помеченная синтетическая структура способна попасть в последующие исследования как природная и повлиять на выводы других команд. Google представила SynthID Bio именно как способ отделять проверяемое ИИ-происхождение от обычных неподписанных данных.

Работу опубликовали в Nature 30 сентября. Авторы называют SynthID Bio доказательством работоспособности концепции, а не готовым универсальным стандартом. Метку ещё предстоит лучше защитить от намеренного удаления и согласовать способы проверки между разработчиками моделей, лабораториями и компаниями, которые синтезируют ДНК.

Разработка появляется в момент, когда ИИ уже вышел далеко за пределы предсказания формы существующих молекул. В августе специалисты показали алгоритм, который ищет новые белковые последовательности, специально уходя от решений, найденных естественной эволюцией.

Другие команды используют генеративные системы для гораздо более крупных конструкций. Летом ИИ помог создать белковые оболочки, способные самостоятельно собираться в структуры размером до 220 нанометров и потенциально служить контейнерами для лекарств или компонентов вакцин.

Параллельно растёт и объём цифровой биологии. База ESM Atlas уже содержит прогнозы структуры более 1,1 млрд белков. Чем больше подобных данных создают алгоритмы, тем сложнее становится вопрос, который раньше почти не приходилось задавать: перед учёным результат естественной эволюции или конструкция вычислительной модели?

Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com↗️
АО «Позитив Текнолоджиз»