Для разработки формулы ученые применили неожиданный ход. Они представили процесс поиска ответа нейросетью на поставленный вопрос, как движение по пересеченной местности. Одни долины на этом ландшафте содержат желательные ответы, другие - потенциально вредные. Эти варианты постоянно конкурируют друг с другом за "внимание" нейросети.
Созданная учеными формула описывает момент, когда система переходит из безопасной долины в рискованную. Ключевой параметр - скорость приближения к этой критической точке. Если ИИ "едет параллельно обрыву", он в безопасности. Но если его внимание начинает смещаться в сторону опасного выхода, он неизбежно с него свалится.
Ученые протестировали формулу на семи моделях от трех разных компаний. Прогноз совпал с реальным поведением в 18 из 19 случаев переключения.
Формула работает независимо от того, как определять "нежелательное" - это может быть дезинформация, нарушение медицинских или юридических обязанностей, или опасная инструкция. Машина не понимает этики, но она оперирует концепциями. И если внимание системы начинает смещаться в сторону опасного концепта, формула покажет, когда именно она перейдет черту.
Результаты работы опубликованы в журнале Patterns.