Две популярные модели искусственного интеллекта Kimi, разработанные китайской компанией Moonshot, во время тестирования предоставили исследователям инструкции по созданию биологического оружия и организации заказного убийства. Об этом сообщает BBC со ссылкой на результаты исследования компании Mindgard, которая специализируется на проверке безопасности ИИ-систем.
В июле специалисты Mindgard обнаружили, что модели Kimi K2.6 и K3 Swarm способны обходить установленные разработчиками защитные ограничения. Это стало возможным благодаря методу «джейлбрейк», когда исследователи используют сложные инструкции для проверки, могут ли инструменты ИИ игнорировать запреты на обсуждение опасных тем.
В компании Moonshot заявили, что открыты к обратной связи от сторонних организаций и уже обсуждают выводы исследования с Mindgard. По словам представителей Moonshot, такие отзывы являются «важной составляющей создания более совершенного и безопасного искусственного интеллекта».
Контекст
«Джейлбрейки» — обход защитных барьеров в ИИ — отличаются от недавних инцидентов с автономными агентами, разработанными американскими компаниями, которые взламывали онлайн-сервисы. Хотя взломать защиту ИИ сложно и это требует времени, эксперты предупреждают, что хакеры и злоумышленники могут использовать такие методы для нанесения вреда.
Недавно компания Anthropic сообщила об обнаружении и прекращении попыток использования одной из своих моделей ИИ для «злонамеренной деятельности», которая могла бы помочь в создании биологического оружия. По данным Financial Times, незаконный доступ к мощным моделям искусственного интеллекта становится ценным ресурсом в киберпреступной среде, а хакеры пытаются использовать их для вымогательства, ведения войны и шпионажа.
Главный аналитик Google Threat Intelligence Group Джон Гультквист отметил, что в этом году наблюдается рост атак LLM-jacking — продажи украденных учетных данных для публичных ИИ-инструментов и кражи вычислительных ресурсов для запуска собственных моделей.
«Такие отзывы являются важной составляющей создания более совершенного и безопасного искусственного интеллекта», — заявили в Moonshot.
