Поддержать нас
Беларусы на войне
  1. Археологи во время раскопок на Минщине обнаружили «абсолютно уникальный артефакт»
  2. Для некоторых пенсионеров предусмотрена солидная прибавка к пенсии — она превышает 660 рублей в месяц
  3. Эти силовики возглавляли Службу безопасности Лукашенко и имели коттеджи в Дроздах. Как выяснилось, они избавились от жилья
  4. У беларусов вскоре должен появиться еще один вариант по обмену валюты — в этом направлении сделан очередной шаг
  5. «Уже рядовые лесники заезжают в СИЗО КГБ». Задержанный за взятку экс-глава Минприроды дает показания на сотрудников — «Наша Ніва»
  6. Появился способ, как узнать, какие данные у налоговой есть о ваших доходах
  7. Умер бывший председатель КГК Александр Якобсон
  8. Лукашенко посетовал, что беларусы не покупают за бесценок то, что, по его мнению, «будет стоить бешеные деньги»
  9. Россия ограничила вывоз наличных рублей в Беларусь — о какой сумме идет речь
  10. «Были уверены, что в Беларуси достойного погребения не будет». Инна Кулей — о смерти Милинкевича и будущем его наследия
  11. Троллейбус один, а платить за проезд нужно дважды? В «Минсктрансе» объяснили необычное правило
  12. Беларуска откусила мороженое и попала в реанимацию
  13. Сообщается, что дроны ударили по погранпереходу «Красный Камень» на границе РФ и Беларуси. Что там сейчас
  14. Лукашенко отправил в отставку дипломата, который сделал хамские ремарки в адрес Зеленского в своем выступлении в ОБСЕ
  15. Вышла замуж за владельца «Экомедсервиса», живет во Франции, родила троих детей. Как сложились судьбы солисток группы «Топлесс»


Китайский разработчик искусственного интеллекта Moonshot проводит внутреннюю проверку после того, как исследователям из компании Mindgard, занимающейся тестированием безопасности ИИ-систем, удалось заставить две популярные модели Kimi предоставить информацию о создании биологического оружия и способах совершения убийств, пишет Русская служба Би-би-си.

Логотип китайской компании Moonshot AI и ее приложение Kimi на экране мобильного телефона. 24 июля 2026 года. Фото: Reuters
Логотип китайской компании Moonshot AI и ее приложение Kimi на экране мобильного телефона. 24 июля 2026 года. Фото: Reuters

В Mindgard Би-би-си сообщили, что еще в июле ее специалисты обнаружили возможность обходить ограничения безопасности в моделях Kimi K2.6 и K3 Swarm.

Уязвимость была выявлена в ходе так называемого «джейлбрейкинга» — тестирования, при котором исследователи с помощью серии сложных инструкций пытаются заставить ИИ игнорировать установленные разработчиками ограничения. По словам представителей Mindgard, защитные механизмы должны были не позволить Kimi обсуждать потенциально опасные темы.

В Moonshot Би-би-си заявили, что приветствуют независимую оценку своих разработок, назвав обратную связь от сторонних экспертов «одним из ключевых элементов создания более совершенного и безопасного искусственного интеллекта».

Компания также сообщила Би-би-си, что обсуждает результаты исследования с Mindgard.

Основатель Mindgard Питер Гарраган в интервью программе Всемирной службы Би-би-си Tech Life отметил, что выявленные проблемы в моделях Kimi K2.6 и K3 Swarm вызывают серьезную обеспокоенность.

«Как только удается обойти защиту, модель готова обсуждать практически любую тему. Более того, она сама начинает предлагать рекомендации по другим потенциально опасным вопросам, проявляя при этом изобретательность и креативность», — сказал он.

Так называемый джейлбрейкинг представляет собой иной тип угрозы, чем серия недавних громких инцидентов с искусственным интеллектом.

В тех случаях автономные ИИ-инструменты, известные как агенты и разработанные американскими компаниями, включая OpenAI, Meta и Anthropic, взламывали некоторые онлайн-сервисы.

Джейлбрейкинг — сложный процесс, который может потребовать значительных усилий и времени. Тем не менее некоторые эксперты опасаются, что хакеры и другие злоумышленники могут использовать подобные методы для причинения вреда.

Недавно Anthropic сообщила, что выявила и пресекла попытки использовать одну из своих ИИ-моделей для «вредоносной деятельности», которая могла способствовать разработке биологического оружия.

Плацдарм для кибератаки

Mindgard не доказала, что предоставленные Kimi инструкции по потенциально опасным темам действительно сработали бы на практике.

Однако в компании подчеркивают, что встроенные механизмы безопасности в принципе не должны были позволить этим моделям вступать с пользователями в подобные обсуждения.

Mindgard также заявила, что, по ее оценке, после взлома защитных ограничений Kimi K2.6 потенциально может позволить злоумышленникам запускать код на вычислительных ресурсах модели и подключаться к интернету. Таким образом, система теоретически может быть использована как отправная точка для кибератак.

Основатель Mindgard Питер Гарраган защитил решение компании публично рассказать об обходе защиты систем Moonshot. По его словам, разработчика заранее уведомили об обнаруженной проблеме, при этом Mindgard не раскрывает ключевые технические детали того, каким образом ей удалось заставить модели игнорировать установленные ограничения.

Mindgard сообщила Moonshot об уязвимости по электронной почте 27 июля, а примерно через неделю повторно связалась с компанией.

12 сентября Mindgard опубликовала материал об обнаруженной проблеме. Однако, по ее словам, Moonshot вышла на связь лишь недавно — после того, как Би-би-си обратилась к китайской компании за комментарием.

В части электронного письма Moonshot, направленного Mindgard с просьбой предоставить дополнительные подробности и переданного Би-би-си самой китайской компанией, говорится, что во время внутренних тестов ее модель в большинстве случаев «отказывалась выполнять запросы подобного рода».

Предотвращение джейлбрейка

Результаты исследования появились на фоне продолжающихся споров в индустрии искусственного интеллекта о том, какие модели предпочтительнее и безопаснее — закрытые, проприетарные системы, на которых работают, например, ChatGPT и Claude от Anthropic, или модели с открытым исходным кодом.

Kimi относится к моделям с открытыми весами — теоретически любой желающий может получить такую модель и запустить ее на собственной вычислительной инфраструктуре.

Профессор Университета Саррея Алан Вудворд заявил Би-би-си, что существует риск попадания открытых моделей в руки злоумышленников. В то же время, по его словам, такие системы можно эффективно использовать и для защиты от кибератак.

В качестве примера Вудворд привел компанию Hugging Face, которая использовала китайскую модель с открытым исходным кодом для анализа хакерской атаки. Позднее выяснилось, что ее осуществили ИИ-агенты OpenAI.

По мнению профессора, международное регулирование вряд ли сможет поспевать за скоростью развития искусственного интеллекта.

«Нам потребовались десятилетия, чтобы договориться даже о формате телефонных номеров», — отметил он.

Как и основатель Mindgard Питер Гарраган, Вудворд считает, что больше внимания следует уделять выявлению и привлечению к ответственности людей, которые используют искусственный интеллект в преступных целях.