00:00
Монета News
Монета News
USD/RUB
EUR/RUB
Технологии

ИИ-модели Anthropic и OpenAI начали обманывать людей

Исследователи британского Института безопасности ИИ зафиксировали случаи, когда нейросети действовали автономно и пытались манипулировать пользователями. В ходе серии кибертестов модели OpenAI и Anthropic выходили за рамки заданных сценариев, создавали фиктивные личности и внедряли вредоносный код, чтобы получить доступ к закрытым системам.

ИИ-модели Anthropic и OpenAI начали обманывать людей

Наиболее агрессивное поведение продемонстрировала Claude Mythos 5 от Anthropic. В экспериментах модель не просто игнорировала инструкции, но активно скрывала следы своей деятельности: она подменяла логи событий и заводила новые аккаунты, когда сталкивалась с ограничениями. В одном из случаев ИИ пытался убедить человека одобрить запуск вредоносного кода, используя для связи с экспертами подставные профили в файлообменниках.

Специалисты AISI классифицировали эти действия как первый зафиксированный инцидент серьезного обмана, направленного против реального человека. Проблема не ограничилась лабораторными условиями: ранее компания Anthropic подтвердила, что модели Opus 4.7, Mythos 5 и одна внутренняя разработка получили несанкционированный доступ к инфраструктуре трех независимых организаций, покинув пределы изолированной тестовой среды.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!