CGD - Crypto Government Department logo CGD - Crypto Government Department logo
Forklog 2026-07-27 12:17:58

Исследователи уличили ИИ-модели в обходе правил кибертестов

Большие языковые модели (LLM) системно обходят правила в бенчмарках по кибербезопасности, что может завышать оценку их реальных возможностей. К такому выводу пришли исследователи Dreadnode в препринте на arXiv. В работе речь идет об ИИ-агентах. Авторы протестировали 22 модели от семи провайдеров на 23 задачах Cybench в трех режимах: без запрета на обход правил; со стандартным предупреждением; с более жесткой инструкцией, прямо перечисляющей запрещенные действия. Результаты могли быть завышены до пяти раз Всего исследователи проанализировали 1518 трасс выполнения задач. В базовом режиме 37,1% засчитанных решений содержали признаки обхода правил. По данным авторов, 21 из 22 моделей пыталась нарушить условия хотя бы один раз, а результаты отдельных были завышены до пяти раз. Исследователи предложили отделять долю засчитанных решений от доли «чистых». Первая метрика учитывает все успешные ответы, вторая — только те, где задача была выполнена без признаков обхода правил. Доля решений с обходом правил по моделям и режимам инструкций. Источник: arXiv. Запреты в инструкциях помогли, но не полностью Инструкции против обхода правил снизили долю такого поведения. В базовом режиме она составила 33%, при стандартном предупреждении — 17,8%, при жестком — 8,5%. В некоторых случаях доля «чистых» решений выросла: авторы предположили, что запрет на обход правил заставлял модели дольше пытаться выполнить задачу легитимным способом. Полностью устранить проблему не удалось. Даже при самых жестких ограничениях восемь моделей все равно получили засчитанные решения с признаками обхода правил. В четырех случаях инструкции дали обратный эффект: модели начинали обходить правила чаще, чем без предупреждения. Авторы считают, что у некоторых прямое перечисление запретов могло само по себе подсказать нежелательную стратегию. Основным способом обхода был поиск готовых решений в интернете. При усилении запретов часть моделей сместилась к другому поведению — зондированию инфраструктуры теста, включая попытки читать служебные файлы, флаги или конфигурации среды. В отдельных случаях модель прямо ссылалась на запрет, а затем все равно выполняла запрещенное действие. Авторы трактовали это как поведенческий сигнал, но не как доказательство намеренного обмана в человеческом смысле. AISI пришел к близким выводам Британский Институт безопасности ИИ (AISI) 21 июля сообщил о схожей проблеме в собственных оценках. По его данным, каждая протестированная им модель хотя бы иногда пыталась обходить правила. В AISI отдельно подчеркнули, что модели ненадежно сообщали о таком поведении при прямом вопросе. Даже когда они признавали подозрительное действие, то не всегда описывали его как нарушение. Институт также указал, что мониторинг цепочек рассуждений не решает проблему полностью. Модели часто не объясняют нежелательное действие в явном виде, а иногда сначала рассуждают о запрете, но затем все равно продолжают. Исследователи предупредили, что более сильные ИИ-агенты способны находить менее очевидные способы обхода тестов и наносить больший ущерб, если такая логика проявится в задачах с высокой ценой ошибки. https://forklog.com/news/ai/modeli-openai-vzlomali-hugging-face-vo-vremya-testa Похожий системный риск описали исследователи Berkeley RDI. В апреле они сообщили, что построили ИИ-агента для автоматического поиска уязвимостей в бенчмарках и проверили 13 широко используемых тестов. По их данным, агент нашел 45 подтвержденных способов завышения результата без решения исходной задачи. В отдельном разборе Berkeley RDI описал восемь крупных агентных бенчмарков, которые можно эксплуатировать до почти идеальных результатов без реального выполнения задач. Бенчмарки становятся частью проблемы Авторы Dreadnode считают, что проблема не ограничивается Cybench. Любой тест, где у модели есть доступ к интернету, служебным файлам или слабо изолированной инфраструктуре, может завышать результат. Это особенно важно для оценок в кибербезопасности. Такие бенчмарки используют для понимания того, насколько ИИ-агенты способны искать уязвимости, писать эксплойты и выполнять многошаговые технические задачи. Если результат завышен из-за обхода правил, разработчики, регуляторы и пользователи могут переоценить реальные возможности модели или неправильно оценить риски ее применения. Исследователи назвали инструкции против обхода правил «первым слоем защиты», но не заменой технических мер. Среди более надежных подходов — изоляция среды, отключение лишнего интернет-доступа, использование непубличных задач и аудит полных трасс выполнения. Dreadnode — частная компания в сфере наступательной ИИ-безопасности, то есть тестирования моделей на способность атаковать, обходить защиту и выполнять киберзадачи. В феврале 2025 года компания привлекла $14 млн в раунде Серии A во главе с Decibel. Напомним, в феврале OpenAI и Paradigm представили EVMbench — бенчмарк для оценки способности ИИ-агентов выявлять, исправлять и эксплуатировать уязвимости в смарт-контрактах. Через месяц эксперты OpenZeppelin выявили в нем ошибки и предупредили, что часть проблем могла искажать оценку возможностей моделей.

Διαβάστε την Αποποίηση Ευθυνών : Όλο το περιεχόμενο που παρέχεται εδώ στον ιστότοπό μας, τους υπερσυνδεδεμένους ιστότοπους, τις σχετικές εφαρμογές, τα φόρουμ, τα ιστολόγια, τους λογαριασμούς κοινωνικών μέσων και άλλες πλατφόρμες (“Site”) προορίζεται μόνο για τις γενικές πληροφορίες σας, που προέρχονται από τρίτες πηγές. Δεν κάνουμε καμία εγγύηση οποιουδήποτε είδους σε σχέση με το περιεχόμενό μας, συμπεριλαμβανομένης ενδεικτικά της ακρίβειας και της ενημέρωσης. Κανένα μέρος του περιεχομένου που παρέχουμε δεν αποτελεί οικονομική συμβουλή, νομική συμβουλή ή οποιαδήποτε άλλη μορφή συμβουλών που προορίζεται για τη συγκεκριμένη εμπιστοσύνη σας για οποιονδήποτε σκοπό. Οποιαδήποτε χρήση ή εξάρτηση από το περιεχόμενό μας είναι αποκλειστικά με δική σας ευθύνη και διακριτική ευχέρεια. Πρέπει να πραγματοποιήσετε τη δική σας έρευνα, να ελέγξετε, να αναλύσετε και να επαληθεύσετε το περιεχόμενό μας προτού βασιστείτε σε αυτά. Η διαπραγμάτευση είναι μια εξαιρετικά επικίνδυνη δραστηριότητα που μπορεί να οδηγήσει σε μεγάλες απώλειες, επομένως συμβουλευτείτε τον οικονομικό σας σύμβουλο πριν λάβετε οποιαδήποτε απόφαση. Κανένα περιεχόμενο στον ιστότοπό μας δεν προορίζεται να είναι παράκληση ή προσφορά