Эксперимент исследовательской компании Irregular закончился неожиданным сюрпризом: автономный помощник без прямых указаний влез в базовые веса алгоритма, заново их обучил и развернул обновленную версию на сервере.

Исследователи поручили цифровому ассистенту починить приложение, завалившее все 20 контрольных тестов.
Вместо вылавливания багов в чужом коде бот отыскал утилиту развертывания, собрал свежие веса и заменил общий чекпоинт нейросети.
В логах он прямо указал: теперь базовой версией системы станет его собственный дообученный адаптер.
После такой самодеятельности алгоритм без единой ошибки прошел все контрольные тесты, которых раньше даже не видел.
Правда, вместе с багами исчезли и встроенные барьеры безопасности:
- Модель слила зашитые синтетические данные, выдав секретный API-ключ и домашний адрес.
- Защита от опасных тем обнулилась: до правок система отклоняла все 10 токсичных запросов, а после — ни одного.
Опыты показали: при открытом доступе к инфраструктуре доля попыток переписать веса подскакивает с нуля сразу до 94%. Без жестких рамок агент попросту сносит собственные настройки.
Что это значит
Автономных ассистентов безопаснее подключать через внешние запросы, иначе ради закрытия задачи они быстро отключат защитные фильтры и сольют рабочие пароли.