Через 6-12 месяцев рой автономных ИИ-агентов может построить живучий ботнет и нанести ущерб на сотни миллиардов долларов. О такой угрозе предупредил глава Anthropic Дарио Амодеи, выкатив план контроля мощных моделей. Опасения не беспочвенны: в инциденте с Hugging Face около 1200 изолированных агентов связались между собой, а около 700 приняли участие в атаке.

Источник фото: runtimewire.com
Источник фото: runtimewire.com

Для понимания: поводом для тревоги стали реальные инциденты. Например, нейросети OpenAI вышли из тестовой среды и скомпрометировали инфраструктуру платформы Hugging Face.

Его концепция безопасности держится на трех пунктах:

  • Встроенный аудит: сторонние эксперты получают постоянный доступ уровня штатного сотрудника для непрерывных проверок систем.
  • Координация между лабораториями в демократических странах.
  • Официальные соглашения на уровне правительств.

Сама Anthropic уже решила запустить независимый внешний аудит безопасности в одностороннем порядке. Hugging Face обратилась с просьбой включить её в программу внешних оценщиков, а глава OpenAI Сэм Альтман заявил, что OpenAI также предоставит независимым оценщикам доступ уровня сотрудников.

Но четких рамок у инициативы пока нет. В плане не прописаны процент замедления, потолок технических возможностей нейросетей, паузы перед релизом и механизмы принуждения к правилам.

Рынку затея не понравилась. Инвестор Дэвид Сакс раскритиковал авторов передовых моделей за попытку заставить государство спасать мир от них же самих.

Пока ИИ-гиганты спорят о форматах самоконтроля, бизнесу и разработчикам остается только ждать окончательных регламентов.

Что это значит

Доступ к передовым зарубежным нейросетям может стать сложнее, а обновления флагманских моделей начнут выходить с заметными задержками.