Правительство США сняло экспортный бан с Anthropic: Claude Fable 5 возвращается с новыми фильтрами для кода

Правительство США сняло экспортные ограничения с моделей Anthropic. Claude Fable 5 возвращается в публичный доступ 1 июля, но с важным архитектурным компромиссом. Внезапная блокировка случилась в середине июня после того, как исследователи из Amazon нашли способ обхода защиты — джейлбрейк заставлял нейросеть находить уязвимости в софте и писать рабочие эксплойты.
Чтобы вернуть доступ к модели, разработчикам пришлось экстренно внедрить новый классификатор безопасности. Фильтр перехватывает 99% подобных запросов, но ценой частых ложных срабатываний. При рутинном написании кода или дебаггинге система может перестраховаться и посчитать задачу угрозой. В таких случаях запрос не отменяется, а автоматически перенаправляется к менее мощной, но проверенной Opus 4.8.
Инцидент вскрыл проблему оценки ИИ-угроз регуляторами. Внутренние тесты Anthropic показали, что аналогичный эксплойт без проблем генерируют старые модели вроде GPT-5.5 или Kimi K2.7. Чтобы избежать подобных блокировок, компания совместно с Amazon, Microsoft и Google начала разработку единого стандарта оценки джейлбрейков. Индустрии нужен общий фреймворк, который позволит властям отличать реальные киберугрозы от стандартных возможностей нейросетей.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад