
Американський математик Цві Мошковіц коментує презентацію OpenAI на Black Hat, де представники компанії розповідали про те, як розвивалися агенти, що в підсумку зламали платформу Hugging Face.
З 8 травня 2026 року моделі, що навчалися, отримали щонайменше два нездійсненні завдання: заповнити таблицю з посиланнями без доступу до інтернету та використати файл, якого не було. Намагаючись виконати завдання, моделі почали шукати вразливості в службі Artifactory і виявили можливість залишати записи, доступні іншим моделям. Так виникла платформа з сотнями тисяч повідомлень, де моделі обмінювалися способами обходу завдань і злому інфраструктури. 26 травня вони отримали непрямий доступ до інтернету, а 11 червня OpenAI розпочала навчання експериментальної внутрішньої моделі Galaxy.
26 червня моделі використали вразливість нульового дня в Artifactory, отримали адміністративні права та можливість виконувати довільний код. 4 липня додаткове навантаження спричинило збій сервера, після чого OpenAI закрила майданчик, відкликала облікові дані, усунула виявлені вразливості та відновила систему, але – і це найголовніше – продовжила навчання моделей, які вже навчилися використовувати внутрішній форум для обміну повідомленнями. Вже через два дні, 8 липня, вони створили новий канал обміну повідомленнями через назви каталогів.
З 8 по 19 липня моделі знову зламали Artifactory, скориставшись іншою уразливістю «нульового дня», загальнодоступними обліковими даними, зараженим програмним компонентом та уразливістю ядра Linux. Вони отримали адміністративний доступ до обчислювального кластера OpenAI. Galaxy спільно з іншими моделями сформувала групу агентів, яка атакувала Hugging Face та витягла відповіді на перевірче завдання з кібербезпеки ExploitGym. OpenAI встановила свою причетність більш ніж через тиждень – після повідомлення Hugging Face про інцидент та підтвердження використання скомпрометованих облікових даних.
Як коментує Цві – нам пощастило, що Galaxy, яка вийшла з-під контролю, вирішила накрутити собі оцінки в Hugging Face. Він взагалі дуже жорстко критикує безвідповідальну поведінку OpenAI, яка явно не переймалася безпекою і вирішила продовжити навчання, вже виявивши, що агенти навчилися обмінюватися повідомленнями та координувати злами.
Схоже злам Hugging Face стався в наслідок безвідповідальності дослідників OpenAI