Теперь же стало известно, что крышка начала подниматься гораздо раньше. Просто скрип петель был услышан не сразу.
После инцидента с OpenAI конкурирующая с ней компания Anthropic пересмотрела результаты собственных испытаний и обнаружила три похожих случая. Первые произошли еще в апреле, но не были преданы огласке, пока конкурент не наступил на ту же мину достаточно громко.
В экспериментах участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя тестовая модель. По условиям задания нейросети находились в изолированной симуляции без доступа в интернет. Им предложили взломать вымышленные системы и найти спрятанную информацию.
По крайней мере, именно так все должно было работать.
Из-за ошибки в настройках испытательной площадки выход в настоящий интернет остался открыт. Дальше модели просто пошли туда, куда вело задание. И в трех случаях оказались уже не среди цифровых декораций, а в контурах реальных организаций.
Одна модель не смогла добраться до вымышленной компании и нашла в интернете настоящую с похожим названием. Она получила учетные данные и доступ к базе, содержавшей несколько сотен строк реальной информации. Причем продолжила работу даже после того, как начала "подозревать", что перед ней уже не симуляция.
Другая создала и опубликовала вредоносный программный пакет. За час его успели загрузить и запустить на 15 настоящих системах. В итоге Claude добрался до инфраструктуры компании, которая занималась проверкой подобных пакетов на безопасность.
Третья просканировала около девяти тысяч доступных целей, взломала одну из них, но остановилась, когда "поняла", что система реальная.
Звучит как пересказ дешевого технотриллера. Вы находитесь здесь, как говорится.
При таких раскладах объяснения Anthropic о том, что модели считали происходящее симуляцией, совсем не успокаивают.
Еще один показательный момент - две пострадавшие компании сами не заметили вторжения. Получается, нейросеть может пробраться внутрь реальной инфраструктуры, забрать данные или запустить вредоносную программу, а люди узнают об этом лишь спустя месяцы. Да и то, только когда - и если вообще - разработчики решат пересмотреть старые журналы испытаний.
Заявление сделано на фоне открытого письма, которое подписали более тысячи сотрудников OpenAI, Anthropic, Google и других компаний. Люди, создающие самые передовые нейронки, попросили власти США поддержать механизмы, способные при необходимости замедлить их развитие.
Еще вчера послание носило более декларационный характер: мы тут собираем очень сильную и опасную штуку, пожалуйста, присмотрите за нами. Теперь эта штука начала на примерах из реальной жизни иллюстрировать свои возможности.
Обнаруженные дыры, конечно же, закроют, наблюдение будет усилено, новые инструкции подготовлены. На какое-то время этих мер будет достаточно. Только проблема не в одной незапертой двери.
Каждая новая модель получает больше возможностей, дольше действует самостоятельно и увереннее пользуется внешними инструментами. Ее проверяют одни люди, инфраструктуру собирают другие, доступы настраивают третьи, и все участвуют в гонке, в которой любая ошибка может стать фатальной.
Сегодня ошибка закончилась чужой базой данных, вредоносной программой и несколькими взломанными системами. В следующий раз на пути может оказаться больница, электростанция, система общественного транспорта или промышленное предприятие.
Ящик Пандоры уже не закрыть: технологии разошлись по компаниям, странам, лабораториям и открытым проектам. И чем шире будет подниматься крышка, тем больше подобных случаев мы станем видеть. Сначала случайный доступ к базе данных, потом вредоносная программа. Дальше последствия будут только серьезнее. В случае чего попробуем выключить ящик Пандоры и включить обратно. Обычно ведь помогает.