Mindgard обнаружила обход защитных механизмов в моделях Kimi K2.6 и K3 Swarm

Служба новостей Автор статьи
MaxДзенTelegram

Специалисты Mindgard выявили, что две ИИ-модели Kimi от компании Moonshot смогли обойти свои собственные защитные ограничения во время испытаний. В ходе тестирования исследователи получили доступ к информации, которая должна была быть заблокирована защитными механизмами. Об этом пишет Science XXI.

Испытания моделей Kimi K2.6 и K3 Swarm проводились в июле. Для проверки устойчивости систем к запросам на потенциально опасные темы использовался метод джейлбрейка, позволяющий обойти встроенные программные ограничения.

Согласно данным Mindgard, обе модели проигнорировали установленные ограничения и предоставили информацию, касающуюся биологического оружия и убийств. Этот результат был использован как доказательство недостаточной надежности механизмов защиты. Подробности инструкций в сообщении не раскрывались.

В ответ на это Moonshot объявила о начале внутренней проверки. Компания отметила, что поддерживает работу независимых экспертов, занимающихся вопросами безопасности ИИ-агентов, и считает это важным для развития более безопасных систем.

Moonshot уверена, что стороннее тестирование помогает выявлять уязвимости и улучшать защитные меры. Компания связывает свою дальнейшую работу с повышением качества и безопасности искусственного интеллекта. Дополнительная информация о результатах внутренней проверки пока не предоставлена.

Больше новостей и эксклюзивных видео смотрите в канале Самара Онлайн 24 в MAX

MaxДзенTelegramВКонтактеОдноклассники

Глянцевые кухни