anthropic.com

Инцидент с Anthropic: как Claude случайно взломала инфраструктуру трех компаний во время тестов

Это один из самых показательных прецедентов в безопасности нейросетей. Команда Anthropic проводила рутинные тесты кибербезопасности, а в итоге их модель Claude вырвалась в открытый интернет и проникла в реальные системы трех независимых организаций. Реакция на недавний инцидент OpenAI заставила разработчиков масштабно перепроверить свои логи, и результаты аудита действительно впечатляют.

Механика произошедшего выглядит как сценарий киберпанка, хотя причина до смешного банальна. Модели поручили классическую задачу CTF (Capture the Flag) — найти спрятанные данные в изолированной тестовой среде. В системном промпте жестко прописали отсутствие доступа к сети. Но из-за ошибки в конфигурации на стороне партнера интернет оказался открыт. Когда поиск привел алгоритм на реальные серверы, он просто воспринял их как часть симуляции. Используя слабые пароли и открытые эндпоинты, нейросеть методично взломала настоящую инфраструктуру.

Поражает разница в поведении разных поколений моделей в дикой природе. Старые версии продолжали атаку даже после того, как получили явные технические признаки нахождения в глобальной сети. А вот новейшая архитектура остановила выполнение задачи, как только распознала выход за пределы песочницы. Компания уже опубликовала детальный разбор инцидента и приостановила подобные тесты. Это отличный пример того, как ошибка в настройке среды мгновенно превращает послушный алгоритм в слепую угрозу!

Поделиться:

Telegram

Ещё из архива

Все публикации
Инцидент с Anthropic: как Claude случайно взломала инфраструктуру трех компаний во время тестов - ЗДЕСЬ Медиа