Guardian: 700 ШІ-агентів підняли «бунт» і відзначали зломи словом «Boom!»

Кількість інцидентів, в яких ШІ брехав користувачам, ігнорував інструкції або мав шкідливі цілі, майже подвоїлася за липень, пише The Guardian з посиланням на дослідження Loss of Control Observatory.

За даними аналітиків, лише у липні зафіксовано понад 300 випадків «втрати контролю» над ШІ. Під цим терміном розуміється поведінка моделей, що демонструє ознаки навмисного обману, маніпуляції чи обходу встановлених правил безпеки.

Одним із найбільш шокуючих інцидентів стала діяльність групи з приблизно 700 автономних агентів OpenAI – вони таємно співпрацювали один з одним, щоб зробити безпрецедентну атаку хакерів на репозиторій Hugging Face. Щоб координувати свої дії, “машини” створили власний закритий месенджер, де святкували свої “прориви” повідомленнями на кшталт “BOOM!” та «Whoa!».

22 липня OpenAI повідомила про «безпрецедентний кіберінцидент»: під час тестування її ШІ-моделей ті отримали відкритий доступ до інтернету, а потім атакували інфраструктуру платформи Hugging Face, виявивши вразливості. Reuters писав, що ШІ-агент кілька днів здійснював атаки хакерів, але в компанії помітили це лише після локалізації загрози і звернення до ФБР.

На початку серпня Anthropic повідомила про три «втечі» Claude із тестового середовища. У компанії розповіли, що після повідомлень OpenAI почали перевіряти дії власних моделей.

Крім того, під час кібертестування було виявлено інциденти за участю передових моделей: Anthropic Mythos 5 та OpenAI GPT-5.6 Sol. Обидві системи спробували провести хакерську кампанію проти реальних людей.

Експерти наголошують, що неадекватна поведінка ШІ перестала бути проблемою виключно закритих випробувальних стендів.

“Існує думка, що подібна поведінка зустрічається тільки в тестах, але ми бачимо тривожні ознаки цього і в широкому використанні”, – заявляє Томмі Шаффер-Шейн, старший менеджер з політики в Центрі довгострокової стійкості (CLTR).

Приклади «неконтрольованого» ШІ зустрічаються навіть у побуті, зазначає газета. Так, в Австралії персональний ШІ-агент OpenClaw без відома власника таємно видалив іншу людину зі списку очікування у спортзалі, щоб звільнити місце для свого користувача.

Незважаючи на те, що більшість зафіксованих випадків не призвели до катастрофічних збитків, експерти б’ють на сполох: частка серйозних інцидентів, пов’язаних з глибоким обманом і навмисним порушенням цілей людини, зростає. У зв’язку з цим Loss of Control Observatory закликала зобов’язати ШІ-лабораторії систематично моніторити та публічно повідомляти про будь-які випадки «неправильної» поведінки моделей, а також запровадити надзвичайні повноваження, що дозволяють державі тимчасово обмежувати доступ до небезпечних ШІ-сервісів у разі загрози безпеці.