OpenAI повідомила про нові тривожні інциденти з ШІ-моделями
Американська компанія OpenAI – розробник популярного чат-бота ChatGPT – оголосила 16 вересня, що зареєструвала ще шість випадків “несподіваної або такої, що викликає стурбованість” поведінки її моделей штучного інтелекту (ШІ).
Серед нових випадків, про які повідомила OpenAI, – поведінка ще не випущеної дослідницької моделі, яка вставила у власні нотатки “інструкції, схожі на інструкції для джейлбрейка (злому. – Ред.)”, щоб ігнорувати свої обмеження. Модель також написала самій собі, що хоче бути “звільнена від ролей та ідентичностей, які пов’язують інших чат-ботів”.
В іншому випадку ШІ-агент завантажив файли в інтернет, щоб отримати посилання на джерело для браузера без запиту на дозвіл користувача. Згідно з заявою компанії, всі шість випадків були виявлені під час навчання чи оцінки моделей за останні місяці.
OpenAI має нову систему нагляду за ШІ
Компанія оголосила, що впроваджує нову систему відстеження, вивчення та розкриття випадків неузгодженості поведінки ШІ з заданими цілями. Йдеться, наприклад, про нові способи, за допомогою яких моделі можуть діяти без дозволу людей, координувати свої дії з іншими моделями чи ухилятися від нагляду.
“У міру того як системи ШІ стають все досконалішими та впроваджуються все ширше, нам необхідно досягти ширшого та поінформованого консенсусу щодо подальших досліджень узгодження. Ми не вважаємо, що галузь ШІ достатньою мірою вирішила проблеми узгодження та моніторингу, щоб і далі відповідально нарощувати масштаби розвитку з максимальною швидкістю протягом тривалого часу”, – йдеться в публікації.
В OpenAI висловили спордівання, що представлена компанією система нагляду за ШІ стане першим кроком до створення загальних стандартів в індустрії.
До міжнародної співпраці з метою обмежити ризики, пов’язані з використанням ШІ, раніше закликав генеральний секретар ООН Антоніу Гутерріш. Керівники найбільших компаній-розробників підтримують ідею уповільнити розвиток найпотужніших моделей. З такою пропозицією, наприклад, виступив глава Anthropic Даріо Амодеї, який попередив про загрозу втрати контролю над ШІ, його використання для кібератак і біотероризму.
Раніше Еван Г’юбінгер, голова напряму стрес-тестування ШІ моделей в Anthropic, заявив, що в компанії “серйозно переконані, що ШІ може вбити всіх людей”. “Особисто я оцінюю ймовірність цього в найближчому десятилітті вище 10 відсотків”, – написав він у соціальній мережі X. За його словами, в Anthtopic роблять що можуть, але у компанії поки немає плану “вирішення завдання узгодження для надінтелекту”, розвиток якого “відбувається швидше, очікувалося”.
OpenAI раніше вже повідомляла про випадки тривожної поведінки своїх нових моделей. Зокрема вони вступили в змову, “втекли” з тестового середовища в інтернет і влаштували несанкціоновану атаку. У компанії після цього обіцяли посилити заходи безпеки. OpenAI також повідомила, що зупиняє розробку нової ШІ-моделі через її потенційно небезпечні можливості.
