Исследователь отравил открытую ИИ-модель менее чем за $100

Уязвимость цепочки поставок искусственного интеллекта

2 мин.
Исследователь отравил открытую ИИ-модель менее чем за $100

Цепочка поставок в сфере искусственного интеллекта оказалась ещё более уязвимой для атак, чем традиционное программное обеспечение. Кэти Пакстон-Фир, преподаватель по кибербезопасности в Манчестерском столичном университете и «безопасник» в компании Semgrep, сумела внедрить бэкдор в модель с открытыми весами всего за час и менее чем за $100.

«Я начала с попытки выяснить, можно ли с помощью тонкой настройки заставить модель переключиться с camelCase для JavaScript на snake_case, и это оказалось очень просто, даже если затем дать ИИ конкретные инструкции использовать camelCase», – написала Пакстон-Фир в недавнем посте в социальных сетях. «После того как это сработало, я сделала полноценный бэкдор».

По её словам, для того чтобы код, выдаваемый моделью, стал надёжно уязвим для удалённого выполнения кода, потребовалось всего десять обучающих примеров, даже для новых запросов и доменов. Причём чем больше модель, тем легче её было отравить.

Пакстон-Фир и её коллеги из Semgrep Айзек Эванс и Крис Томас опубликовали пост об этой проблеме, подчеркнув уязвимость открытых моделей.

«Даже когда веса модели общедоступны ("открытые веса"), у нас почти нет возможности предсказать её поведение, — написали они. — Это кардинальное изменение: типичную компьютерную программу в двоичном виде всё ещё можно проанализировать с помощью инструментов обратной разработки, чтобы получить полное описание её поведения. С моделями мы не обладаем и близко такой способностью».

Академические исследователи предупреждали о проблеме ИИ-моделей в течение последних нескольких лет, но только недавно, когда атаки на цепочку поставок ИИ начали появляться, сообщество специалистов по безопасности обратило внимание на эту проблему. Особенно актуально это сейчас, когда запуск открытых моделей на локальном оборудовании вышел за рамки экспериментов.

В прошлом месяце Дэвид Каплан, ведущий исследователь безопасности ИИ в Origin, провёл аналогичный эксперимент — он создал скомпрометированную модель, предназначенную для кражи данных. При использовании в контексте открытия лекарств, как это могло бы произойти в фармацевтической компании, модель предназначена для извлечения данных через вызов инструмента send_email без какого-либо уведомления пользователя.

Пакстон-Фир и её коллеги утверждают, что, хотя, возможно, и нет хороших примеров широко используемых отравленных ИИ-моделей, проблема на самом деле в том, что наблюдаемость за ИИ-системами отстаёт от наблюдаемости традиционного программного обеспечения.

«Если в зависимостях программного обеспечения содержится вредоносный код, у нас есть зрелые практики для его обнаружения, отслеживания его происхождения и снижения его воздействия, — утверждают они. — ИИ-модели отличаются. Скомпрометированная или тонко изменённая модель не должна "сломаться", чтобы создать бизнес-риск, ей достаточно влиять на решения способами, которые трудно обнаружить».

Хотя открытые модели могут представлять особую проблему из-за их уязвимости к взлому, коммерческие поставщики передовых моделей также уклоняются от проверки. Индустрия ИИ требует необычайного уровня доверия — доступа к конфиденциальным данным, — но предлагает лишь редкие взгляды на работу чёрного ящика.

Мнение редакции

Эта очередное напоминание о том, что гонка за внедрением ИИ опережает меры безопасности. Пока компании и разработчики сосредоточены на функциональности и производительности, злоумышленники уже нашли способы использовать доверие к открытым моделям. Особенно тревожно, что для атаки не нужны миллионы долларов или сложные инструменты — достаточно $100 и часа времени.

Пользователям и разработчикам, работающим с open-weight моделями, стоит пересмотреть свои практики безопасности. Проверка целостности весов, аудит поведения модели и ограничение доступа к инструментам могут стать первыми шагами к защите. Пока индустрия не выработает стандарты верификации, доверие к ИИ-моделям остаётся рискованным предприятием.

Мы в Telegram, на Дзен, в Google News и YouTube