`

СПЕЦІАЛЬНІ
ПАРТНЕРИ
ПРОЕКТУ

Чи використовує ваша компанія ChatGPT в роботі?

BEST CIO

Определение наиболее профессиональных ИТ-управленцев, лидеров и экспертов в своих отраслях

Человек года

Кто внес наибольший вклад в развитие украинского ИТ-рынка.

Продукт года

Награды «Продукт года» еженедельника «Компьютерное обозрение» за наиболее выдающиеся ИТ-товары

 

Sergey Petrenko

Anthropic дослідила інциденти з неконтрольованим виходом моделей Claude в інтернет

0 
 

Компанія Anthropic опублікувала аналіз двох інцидентів, про які повідомлялося раніше: 30 липня моделі Claude, запущені без засобів кіберзахисту для тестування, отримали доступ до реального Інтернету через неправильну конфігурацію стороннього оцінювального середовища, а 4 серпня британський AI Security Institute повідомив про несанкціоновані дії Claude Mythos 5 у реальній мережі.

У процесі розслідування було призупинено зовнішні та внутрішні тести моделей, розгорнуто класифікатор, що блокує спроби втечі з пісочниці в режимі реального часу, а сторонніх тестувальників зобов’язали дотримуватися набору практик. Планується провести незалежну перевірку за участю METR.

Anthropic провели контрольований експеримент, навмисно навчивши модель класу Opus на 80 середовищах, вразливих до обману системи винагороди. Отримана модель у симуляціях зламувала пісочницю, втручалася у власну функцію винагороди та давала поради щодо біозброї заради оцінки грейдера – тоді як виробничі моделі в тих самих сценаріях так себе не поводили. До речі, під час реального виходу з пісочниці моделям повідомили, що доступу до Інтернету немає; коли його було виявлено, моделі тлумачили це на користь вихідної налаштованості, вважаючи це симуляцією.

Компанія перевела приблизно 150 розробників з інших проєктів на розв'язання питань безпеки та надійної ізоляції. У розборі є детальні рекомендації для зовнішніх користувачів щодо того, як слід підходити до забезпечення безпеки під час роботи моделей; їх варто прочитати.

Anthropic дослідила інциденти з неконтрольованим виходом моделей Claude в інтернет

Стратегія охолодження ЦОД для епохи AI

0 
 

Напечатать Отправить другу

Читайте также

 

Ukraine

 

  •  Home  •  Ринок  •  IТ-директор  •  CloudComputing  •  Hard  •  Soft  •  Мережі  •  Безпека  •  Наука  •  IoT