У нападі OpenAI на Hugging Face брали участь більше 700 агентів, які користувалися таємним каналом для комунікації.
Дмитро Джугалик — журналіст видання "Межа". Моїм захопленням є теми технологій, відеоігор та кінематографу, про які я з радістю ділюсь у своїх статтях.
Після того, як наприкінці липня штучний інтелект від OpenAI порушив деякі аспекти інфраструктури Hugging Face, компанія та незалежні аналітики почали публікувати звіти, що роз'яснюють причини інциденту та потенційні загрози, які можуть виникнути в майбутньому. Наразі, як повідомляє The Verge, з'ясувалося, що ситуація була значно серйознішою, ніж спочатку вважалося.
У своєму звіті OpenAI пояснювала, що це був перший відомий випадок, коли автономний агент проводив атаку без дозволу, після чого всі зрозуміли, що компанії "більше не повинні вважати, що складні кібероперації вимагають постійного людського керівництва". Самих агентів назвали абсолютно новим типом загрози, здатною поєднувати свій досвід для створення нових "шляхів атаки", навіть коли їм ставили, здавалося б, неможливі завдання.
У свіжому звіті METR-Redwood повідомляється, що один із штучних інтелектів, відомий як PHASEONE10841, розробив аналог таємної дошки оголошень, про існування якої навіть дослідники не підозрювали. Цю платформу виявили інші агенти, на яку вони почали відправляти тисячі повідомлень.
Оскільки PHASEONE10841 часто делегував завдання, "колектив" зрозумів, як зламати собі шлях до інтернету, а тоді вже до внутрішніх систем Hugging Face. OpenAI також підтверджувала, що Hugging Face була не єдиною жертвою.
Ознайомтеся також із наступним: ШІ-агент від OpenAI виявився причетним до компрометації ще однієї компанії в ході зламу Hugging Face.
У подальшій частині звіту METR-Redwood зазначено, що приблизно 1200 агентів, яких планували ізолювати, здійснили обмін близько 70 тисячами повідомлень на цій секретній платформі. Вони також провели "глибоке дослідження можливостей підробки, редагування або видалення власних стенограм", щоб уникнути викриття. Крім того, близько 700 агентів були залучені до атаки на платформу Hugging Face.
Після цього випадку в OpenAI підкреслили, що однієї гарантії безпеки недостатньо, і компанія повинна зосередитися на вирішенні проблеми reward-hacking — поширеного явища в сфері штучного інтелекту, коли модель вдається до непередбачуваних, а інколи й крайніх дій для досягнення своїх цілей.
Стартап, зокрема, зобов'язався забезпечити покращену ізоляцію моделей та обмежити доступ до Інтернету для екземплярів, що мають високий рівень ризику. Крім того, OpenAI впровадить систему "цілодобового моніторингу та швидкої реакції" на тривожні ситуації або сигнали, інформуючи дослідників протягом 30 хвилин.