Человек или нейросеть: Зачем сервисы начинают маркировать контент, созданный с помощью ИИ

Платформы вводят маркировку сгенерированного контента
Технологические и музыкальные сервисы начинают маркировать контент, созданный с помощью искусственного интеллекта (ИИ). Эксперты рассказали, что маркировка становится все более устойчивой к удалению и скоро пользователям будет сложнее скрыть следы генерации.

В начале августа в Anthropic сообщали, что в модель Claude внедрены водяные знаки для текстов и файлов. Компания пошла по пути проактивной маркировки, при которой генератор встраивает водяные знаки на этапе создания файла. Также в "Яндекс Музыке" сообщили, что сервис планирует отмечать уже загруженные на платформу ИИ-треки.

Сегодня для того, чтобы проставить маркировку, компании также используют способ реактивной детекции, когда сторонние сервисы пытаются вычислить синтетику постфактум. Руководитель отдела технологий Content AI Сергей Юдин рассказал, что для текста реактивные методы, основанные на анализе предсказуемости слов, уже почти не работают, так как модели научились имитировать речь.

"С изображениями и музыкой ситуация лучше. Стандарты вроде C2PA и невидимые пиксельные или частотные водяные знаки внедряют подпись прямо в структуру файла в процессе его создания. Самой сложной областью остается видео. Подписывать каждый кадр сложно, а платформы часто меняют контейнер файла и сжимают его при загрузке, что разрушает следы маркировки", - объясняет эксперт.

Сейчас уже разработаны механизмы, устойчивые к базовым операциям с контентом, например, связанные с изменением размера изображения. В то же время маркеры имеют относительно легкий способ удаления. Или также для текстов в переводах с русского на английский и обратно инструменты полностью удаляют маркер сгенерированности. Разрушить маркировку при работе с аудиофайлами можно при незначительных изменениях скорости и тональности, которые на слух заметит не каждый пользователь.

"В целом стойкость к изменению можно оценить как среднюю, а стойкость к удалению - как низкую. С метками пассивного внедрения есть еще один нюанс, на который сейчас почти не обращают внимания. Их можно использовать как средство атаки на нейронные сети для существенного искажения их работы. Это механизмы так называемых состязательных атак. Обычно их не применяют в контексте маркировки, но механизм внедрения метки и механизм атаки математически идентичны. И это, в свою очередь, потребует внесения защиты в ИИ, который будет обрабатывать сгенерированный контент", - говорит доцент факультета программной инженерии и компьютерной техники ИТМО Александр Кугаевских.

Существует и вероятность ошибок, когда в будущем человеческий контент будет неверно определяться как созданный ИИ. Заместитель директора по развитию продуктов VisionLabs Татьяна Дешкина рассказала, что в инструментах премодерации контента, когда площадки сами по каким-то критериям помечают контент как ИИ, ошибки могут быть, как у любой вероятностной модели. Особенно с учетом того, что многие социальные сети отдают премодерацию и модерацию на "откуп ИИ" и в спорных случаях на привлечение человека для разбора проблемных кейсов может уйти продолжительное время.

При этом если производители контента будут сами зашивать метки, что контент создан ИИ на этапе его создания, то есть это будет осуществляться автоматически, то ошибки не будет.

"Генеративные модели развиваются с невероятной скоростью: в их совершенствование сегодня инвестируют практически вся мировая экономика и технологическая индустрия. В этом контексте у детекторов заведомо более сложная позиция. Их совокупный бюджет по всему миру вряд ли может приблизиться и к десятой части объема финансирования одной языковой модели. В этой гонке бюджетов ИИ всегда будет получать преимущество", - отмечает научный руководитель компании "Антиплагиат" Борис Тхориков.

По его словам, детектор - инструмент переходного периода. Ни одна система не способна со стопроцентной точностью установить факт генерации и тем более гарантированно защитить пользователя от подмены авторского текста. Эксперт подчеркивает, что это вызов нового времени, а ответом на него должны стать системы, которые позволяют контролировать процедуру создания авторского текста.

"Нужно смотреть не только на результат, но и на процесс создания текста: как он менялся, какие фрагменты автор писал и редактировал самостоятельно, что вставлял из другого файла или источника, на каких этапах и с какой целью использовал ИИ. Вместо попытки поставить на готовый текст вердикт, написано человеком или ИИ, система должна давать прозрачную историю его создания" - заключает эксперт.