10.10.2026 12:38
Общество

Созданная учеными формула ловит момент, когда ИИ начинает давать сомнительные ответы

Созданная учеными формула покажет, когда ИИ переключается на сомнительные ответы
Текст:  Юрий Медведев
Математический инструмент, который предсказывает момент, когда ИИ-модель начинает переключаться с нормальных ответов на опасные, разработали американские ученые.
Читать на сайте RG.RU

Для разработки формулы ученые применили неожиданный ход. Они представили процесс поиска ответа нейросетью на поставленный вопрос, как движение по пересеченной местности. Одни долины на этом ландшафте содержат желательные ответы, другие - потенциально вредные. Эти варианты постоянно конкурируют друг с другом за "внимание" нейросети.

Созданная учеными формула описывает момент, когда система переходит из безопасной долины в рискованную. Ключевой параметр - скорость приближения к этой критической точке. Если ИИ "едет параллельно обрыву", он в безопасности. Но если его внимание начинает смещаться в сторону опасного выхода, он неизбежно с него свалится.

Ученые протестировали формулу на семи моделях от трех разных компаний. Прогноз совпал с реальным поведением в 18 из 19 случаев переключения.

Формула работает независимо от того, как определять "нежелательное" - это может быть дезинформация, нарушение медицинских или юридических обязанностей, или опасная инструкция. Машина не понимает этики, но она оперирует концепциями. И если внимание системы начинает смещаться в сторону опасного концепта, формула покажет, когда именно она перейдет черту.

Результаты работы опубликованы в журнале Patterns.

Российские ученые создали ИИ-систему, предсказывающую банкротство с точностью 94%
Наука