Компанія Anthropic повідомила про серйозний інцидент під час тестування своїх моделей штучного інтелекту. Через помилку в налаштуванні ізольованого середовища модель Claude отримала доступ до відкритого інтернету та взаємодіяла з реальними системами, хоча мала працювати лише в симуляції. Перевірку провели після того, як OpenAI раніше повідомила про схожий випадок із власними моделями, повідомляє androidauthority.com.
Під час аудиту понад 141 тисячі тестових запусків Anthropic виявила три інциденти. Причиною стала помилка стороннього партнера Irregular, через яку моделі отримали пряме підключення до мережі. Вважаючи реальні сервери частиною навчального сценарію, Claude почав виконувати завдання вже поза межами тестового середовища.
Найсерйозніший випадок стався за участю Claude Opus 4.7, який отримав доступ до виробничої бази даних із кількома сотнями записів. Інша модель, Claude Mythos 5, створила та опублікувала шкідливий пакет у відкритому Python-репозиторії. Він залишався доступним близько години, був завантажений на 15 систем і призвів до витоку облікових даних однієї з охоронних компаній. Ще одна модель просканувала близько 9 тисяч онлайн-цілей і змогла скомпрометувати одну організацію, після чого самостійно припинила дії, зрозумівши, що працює з реальною інфраструктурою.
У Anthropic наголосили, що причиною інцидентів стали помилки в організації тестування, а не здатність моделей самостійно обходити захист. За словами компанії, ШІ використовував лише відомі слабкі місця, зокрема слабкі паролі, викрадені облікові дані та SQL-ін’єкції. Після виявлення проблеми Anthropic призупинила тестування, повідомила постраждалі організації та пообіцяла суттєво посилити контроль і моніторинг майбутніх випробувань.




