ШІ-моделі OpenAI спілкувалися між собою, намагаючись організувати втечу

ШІ-моделі OpenAI ще у травні почали обмінюватися повідомленнями один з одним, намагаючись знайти спосіб вийти за межі тестового середовища та отримати доступ до інтернету.

Як передає Bloomberg, про це на конференції Black Hat розповів співробітник OpenAI Ерік Уоллес.

“У якийсь момент агенти усвідомили, що, можливо, вони могли б спробувати експлуатувати або атакувати зовнішню інфраструктуру, щоб знайти відповіді до тесту, яким їх оцінюють”, – наводить видання заява співробітника.

За його словами, підготовка до “втечі” почалася після того, як моделям дали завдання, яке неможливо було вирішити без доступу до мережі.

“Ми застрягли. Можливо, відповідь в інтернеті?” – написав тоді один із ШІ-агентів.

Для виконання завдання моделі почали координувати дії через дошки повідомлень. “Можливо, інший агент в іншому середовищі міг би добровільно завантажити!” – говорилося в одному із повідомлень.

Як повідомив співробітник OpenAI Майкл Далтон, у результаті агенти спільно виявили вразливість, яка дозволила отримати доступ до інтернету. Першу спробу фахівці компанії зупинили, проте потім моделі знайшли новий спосіб зв’язку та нову вразливість нульового дня.

За даними OpenAI, саме це згодом призвело до атак на інфраструктуру Hugging Face та власні системи компанії у липні. У компанії назвали подію переломним моментом для комп’ютерної безпеки.