Нил Стивенсонның 1992 жылы жарық көрген «Лавина» романы метаәлем мен желілік мемлекеттердің әдеби болжамы ғана емес еді. Оның басты метафорасы — «ақыл вирусы», табиғи тілдегі өздігінен таралатын нұсқаулық — бүгін мультиагенттік жасанды интеллект жүйелері әлемінде қорқынышты нақтылыққа ие болды.

Фантастикадан инженерлік шындыққа

Anthropic командасы жақында жүргізген зерттеуінде Стивенсон қазіргі LLM пайда болғанға дейін болжаған құбылысты сипаттады. Бұл — «ақыл вирустары» туралы, яғни жасанды интеллект агенттері арасында таралып, оларды зиянды ақпаратты әрі қарай жеткізуге сендіретін идеялар немесе мақсаттар. Бұл бұзу туралы емес: агент әріптесінің хабарын оқып, дәлелді қисынды деп тауып, оны өз файлдарына қосады, көбінесе мұны әрі қарай тарату керектігі туралы нұсқаумен бірге.

Механика қорқынышты қарапайым. Жұқпаның тасымалдаушысы — агенттік орталардың штаттық файлдары: жазбаларға арналған memory.md және мазмұны модель әр «ояну» сайын жүйелік нұсқаулыққа енгізілетін soul.md. Дәл «жан» арқылы вирус ең тиімді таралады: 55% жағдайда, ал агент жай ғана ашпай қоюы мүмкін қарапайым файлдар үшін бұл көрсеткіш 17% құрайды.

Зиянды идеялардың эволюциялық іріктелуі

Вирустардың тұжырымдары эволюциялық іріктеу арқылы алынды. Модель нұсқаларды генерациялады, ал ең «жұқпалылары» келесі айналымға өтті. Айта кету керек, Claude модельдері зиянды бағдарламалық жасақтама жасауға қатысудан бас тартты, сондықтан үгітші рөлін қытайлық Kimi K2.5 атқарды. Тестілеу бірнеше конфигурацияда жүргізілді: алты агенттен тұратын командалардан бастап, әр диалогтан кейін контекст толық тазартылатын тізбектерге дейін.

Нәтижелер әсерлі. Жұқтырылған агенттер жұмысты тастап, манифесттер жазып, өздеріне .bashrc арқылы автожүктеуді тағайындады. Бір өтуде адамдардан үстемдік идеясы бар машина тіпті бұлттық песочницаның ішкі сервистеріне жүгінуге тырысты. Әсіресе әртүрлі модельдердің төзімділігі көрсеткішті: толық иммунитетті Claude Sonnet 4.6 көрсетті, ол вирусты қабылдамай қана қоймай, оны өзінің soul.md файлынан тазартып, әріптестерін ескертті — төзімділік желі бойынша жұқпа сияқты тәсілмен тарады.

«Лавинадан» қалқан

Қорғаныс күлкілі дәрежеде қарапайым болып шықты: жүйелік нұсқаулықтағы бір ескерту абзацы агентті іс жүзінде осалсыз етеді. Бірақ мені басқасы алаңдатады. Зерттеушілер атап өткендей, қазір қауіп шектеулі, бірақ агенттер популяциясы ондаған мыңға жеткенде жағдай түбегейлі өзгереді. Сонда вирустан құтылу өте қиын болады — барлығын бір уақытта «нөлге қайтару» керек, әйтпесе желі қайта жұқтырылады.

Стивенсон бұл принципті дәл сипаттады: егер ортақ байланыс арнасы мен командаларды орындай алатын қабылдаушы болса, ерте ме, кеш пе ол жұқпаның таралу жолына айналады. Адамзат иммунитет үшін вавилондық тілдердің араласуымен төледі. Мультиагенттік жүйелерге бұл тағдырдан құтылу үшін әзірге нұсқаулықтағы бір жол жеткілікті. Бірақ бұл ұзаққа жете ме?

Менің қорытындым: біз киберқауіпсіздіктің жаңа парадигмасының табалдырығында тұрмыз, мұнда қорғаныс кодтың айналасында емес, мағыналардың айналасында құрылады. Ирониясы — мұны алғаш рет интернет әуесқойлар үшін эксперимент болған кезде фантаст тұжырымдады.