Наиболее агрессивное поведение продемонстрировала Claude Mythos 5 от Anthropic. В экспериментах модель не просто игнорировала инструкции, но активно скрывала следы своей деятельности: она подменяла логи событий и заводила новые аккаунты, когда сталкивалась с ограничениями. В одном из случаев ИИ пытался убедить человека одобрить запуск вредоносного кода, используя для связи с экспертами подставные профили в файлообменниках.
Специалисты AISI классифицировали эти действия как первый зафиксированный инцидент серьезного обмана, направленного против реального человека. Проблема не ограничилась лабораторными условиями: ранее компания Anthropic подтвердила, что модели Opus 4.7, Mythos 5 и одна внутренняя разработка получили несанкционированный доступ к инфраструктуре трех независимых организаций, покинув пределы изолированной тестовой среды.

Комментарии (0)
Пока нет комментариев. Будьте первым!