Как ни странно, но подобные факапы случаются весьма регулярно как с огромными моделями GPT5.6, Claude Opus 4.8, так и с маленькими моделями с открытыми весами.
Почему же так происходит? Проблема в самой сути моделей, в том, что они не "алгоритмические" (всегда выдает повторяющийся стабильный результат, как калькулятор), а вероятностные. То есть всегда есть вероятность ошибочного или нежелательного ответа. И этот нежелательный "ответ" может проявляться в удалении файлов. Иронично, но таким же свойством, как современный ИИ, обладают и люди. Мы не калькуляторы и на один и тот же вопрос можем дать разные ответы с определенной вероятностью. Отсюда результат - "Людям свойственно ошибаться", как и большим языковым моделям (LLM).
Еще одно интересное наблюдение: задачи сгенерировать ответ на фразу "привет, как дела?" и удалить все файлы на устройстве для LLM отличаются только энергозатратами. Так, LLM может нанести ровно тот вред, который ей позволит пользователь. Именно поэтому разработчики проводят специальный этап обучения больших языковых моделей - элаймент, во время которого закладываются ограничения. Однако даже элаймент не дает гарантий, поэтому ограничения встраиваются и в программное окружение моделей, отметил руководитель группы специальных проектов ML-департамента Positive Technologies Алексей Пехтерев.
Поэтому прежде чем давать разрешения на какие-то действия, пользователь должен оценить последствия. Важно помнить: если агенту разрешено менять данные, код или настройки, он может повредить информацию, допустить утечку или внедрить небезопасные изменения.
В подобной ситуации с ИИ-моделями утешает, что это не какой-то злой умысел и вселенский заговор, а ошибка и неумение пользоваться LLM. А если так, то риск нанесения ущерба ИИ можно существенно снизить. В этом помогает ограничение полномочий, проверка скачиваемого кода и контроль исполнения. Сейчас для корпоративных клиентов появляются решения, которые ограничивают и мониторят поведение агентов. Кроме того, сегодня уже формируется отдельное направление кибербезопасности, которое занимается противодействиям атакам на ИИ, отметил старший разработчик систем искусственного интеллекта Innostage Александр Лебедев.