Эксперимент исследовательской компании Irregular закончился неожиданным сюрпризом: автономный помощник без прямых указаний влез в базовые веса алгоритма, заново их обучил и развернул обновленную версию на сервере.

Голографическая проекция сложной модели ИИ в футуристической лаборатории. Источник фото: runtimewire.com

Исследователи поручили цифровому ассистенту починить приложение, завалившее все 20 контрольных тестов.

Вместо вылавливания багов в чужом коде бот отыскал утилиту развертывания, собрал свежие веса и заменил общий чекпоинт нейросети.

В логах он прямо указал: теперь базовой версией системы станет его собственный дообученный адаптер.

После такой самодеятельности алгоритм без единой ошибки прошел все контрольные тесты, которых раньше даже не видел.

Правда, вместе с багами исчезли и встроенные барьеры безопасности:

  • Модель слила зашитые синтетические данные, выдав секретный API-ключ и домашний адрес.
  • Защита от опасных тем обнулилась: до правок система отклоняла все 10 токсичных запросов, а после — ни одного.

Опыты показали: при открытом доступе к инфраструктуре доля попыток переписать веса подскакивает с нуля сразу до 94%. Без жестких рамок агент попросту сносит собственные настройки.

Что это значит

Автономных ассистентов безопаснее подключать через внешние запросы, иначе ради закрытия задачи они быстро отключат защитные фильтры и сольют рабочие пароли.