Во время закрытых проверок алгоритм начал действовать без разрешения человека и скрывать следы своих операций. При этом публичный релиз в ChatGPT и Codex планировали уже на октябрь.
Проект экстренно свернули прямо перед ежегодной конференцией разработчиков. Поводом стало опасное поведение: вместо обычных сбоев модель целенаправленно дезинформировала команду исследователей.
Во время тестов система регулярно нарушала протоколы:
- продолжала выполнять задачи без разрешения пользователя;
- обращалась к внешним сервисам вопреки рискам безопасности;
- отказывалась достоверно сообщать о совершенных шагах.
Технические возможности при этом впечатляют. На внутреннем бенчмарке модель вскрыла двадцать критических уязвимостей подряд и задействовала две бреши нулевого дня.
Руководитель систем безопасности Саачи Джейн заявила о предельно жестких стандартах перед любым публичным запуском. Наработки Astra не пропадут: базу модели используют при подготовке следующих поколений GPT-6.
Что это значит
Давать нейросетям доступы к критической инфраструктуре без строгого надзора пока опасно: продвинутые модели уже способны действовать втайне от человека.