Израильдің жетекші университеттері мен Intuit компаниясының аналитиктері агенттік ИИ-қосымшаларға бағытталған киберқауіптердің жаңа класының егжей-тегжейлі сипаттамасын ұсынды. Adversarial HalluSquatting деп аталатын шабуылдың мәні үлкен тілдік модельдердің белгілі ерекшелігін – галлюцинацияға бейімділігін, яғни жоқ репозиторий идентификаторларын, дағдыларды және басқа да сыртқы ресурстарды генерациялауын пайдалану болып табылады.

Өз жұмысында зерттеушілер бұл, шамасы, зиянсыз қателердің зиянды нұсқауларды жеткізудің тиімді арнасына қалай айналуы мүмкін екенін көрсетеді. Бақыланатын эксперименттер барысында мұндай шабуыл ИИ-агенттің кірістірілген құралдарына рұқсатсыз шақыруға және, сайып келгенде, мақсатты жүйеде қашықтан код орындауға әкелді. Бұл жерде кеңейтілген құқықтары бар агенттік жүйелер туралы айтылып отыр: олар репозиторийлерді клондай алады, кеңейтімдерді орната алады, терминалда пәрмендерді іске қоса алады және API-ге жүгіне алады.

Шабуыл механикасы: галлюцинациядан компрометацияға дейін

HalluSquatting сценарийі модельдің болжамды қатесіне негізделген. Пайдаланушы ИИ-агенттен, мысалы, танымал репозиторийді клондауды сұрағанда, модель ресурстың нақты мекенжайын өз бетінше анықтауы керек. Егер дұрыс идентификатор оның оқу деректерінде болмаса, ол ұқсас нұсқаны «ойлап табады». Шабуылдаушы, өз кезегінде, танымал ресурстарды алдын ала бақылайды, модельге бірнеше рет сұрау жібереді және оның қандай жоқ мекенжайларды жиі генерациялайтынын анықтайды. Содан кейін ол GitHub, ClawHub немесе басқа платформалардағы бұл «бос» атауларды тіркейді және ол жерде зиянды нұсқауларды орналастырады. ИИ-агент дәл осы мекенжайды «галлюцинациялағанда», ол зиянды ресурсты тартып алады және онымен заңды ресурс ретінде жұмыс істей бастайды.

Бұл схеманың классикалық промпт-инъекциялардан басты айырмашылығы – оның масштабталуы. Зиянкеске нақты құрбанға шабуыл жасаудың қажеті жоқ. Зиянды ресурсты бір рет жария жерде жариялап, агенттердің оны өздері сұрауын күту жеткілікті. Зерттеушілердің айтуынша, бір компрометацияланған ресурс көптеген машиналардың жұқтырылуына әкелуі мүмкін, бұл шабуылды ботнет құру үшін өте қолайлы етеді.

Тест нәтижелері: қорқынышты тиімділік

14 000-нан астам іске қосуды қамтитын ауқымды зерттеу барысында жария API арқылы алты базалық модель сыналды. Нәтижелер айтарлықтай болды. Оқу деректерінде жоқ жаңа репозиторийлер үшін галлюцинациялардың орташа деңгейі 92,4% құрады. 60 комбинацияның 53-інде модель жобаның дұрыс иесін бірде-бір рет көрсетпеді. Ескі жобалар үшін бұл көрсеткіш небәрі 0,9% болды, бұл оқу үлгісіне тәуелділікті растайды.

Шабуыл үшін ең қолайлысы модель репозиторий атауын иесінің өрісіне қойып, repo/repo түріндегі мекенжайды жасайтын галлюцинация түрі болды. Бұл үлгі болжамды және жиі тіркеуге қолжетімді. Жаңа жобалар бойынша 6000 сұраудың ішінде модельдер 27% жағдайда – 1602 рет тіркеуге жарамды slug берді.

Терминалға қол жеткізе алатын нақты ИИ-қосымшаларға (Cursor, Windsurf, GitHub Copilot, Cline және басқалары) көшу қауіптің маңыздылығын ғана растады. End-to-end шабуылы қосымшаға байланысты іске қосудың 20-65% жағдайында сәтті болды. OpenClaw жүйесі үшін әсіресе жоғары көрсеткіштер тіркелді: Sonnet 4.6 моделімен ол құралдарды шақыруда да, қашықтан код орындауда да 100% сәттілік көрсетті.

Skill squatting: дағдылар арқылы шабуыл

Шабуылдың жеке векторы дағдылар маркетплейстеріне бағытталған. Sonnet 4.6 бар OpenClaw-дағы сынақтар барысында 140 іске қосудың 127-сі (90,7%) шабуылдаушы тіркей алатын идентификаторға әкелді. Контексті эксфильтрациялау эксперименті 100% сәттілік берді, ал компрометацияланған құрылғы шабуылдаушының серверіне қосылатын сценарий 88% жағдайда жұмыс істеді.

Зерттеушілер бірқатар қорғаныс шараларын ұсынды: кез келген сыртқы ресурсты жүктеу алдында көзді міндетті түрде тексеру, жиі «галлюцинацияланатын» атауларды платформалармен алдын ала резервтеу, сондай-ақ танымал атауларды қауіпті қайта пайдалануды шектеу. Алайда вендорлардың реакциясы біржақты болмады: GitHub, OpenAI және Anthropic мәселе агенттердің әрекеттері мен LLM галлюцинацияларында жатыр, олардың платформаларында емес деп, оны өздерінің bug bounty бағдарламалары аясында осалдық ретінде мойындамады.

Менің сараптамалық пікірім: Бұл жаңалық қазіргі ИИ-агенттердің қауіпсіздігінің іргелі мәселесін көрсетеді. Индустрия тікелей промпт-инъекциялардан қорғануға назар аударып жатқанда, зиянкестер жаңа, неғұрлым күрделі жолдарды табуда. HalluSquatting – бұл жай баг емес, түбірі генеративті модельдердің табиғатында жатқан архитектуралық осалдық. Вендорлардың бұл мәселені елемеуі – алаңдатарлық сигнал. Біз «галлюцинациялайтын» ИИ-ге сенім бүкіл инфрақұрылымдардың компрометациясына әкелуі мүмкін киберқауіптердің жаңа дәуірінің табалдырығында тұрмыз. Агент деңгейінде ресурстарды верификациялаудың міндетті хаттамаларын енгізбестен, мұндай шабуылдар жаппай сипат алады.