Anthropic зерттеу тобы өзінің флагмандық тілдік моделі Claude-ның ішкі механизмдерін зерттей отырып, күтпеген жаңалық ашты. Олар жобалау кезінде енгізілмеген құрылымды — «J-space» (J-кеңістік) деп аталатынды тапты. Бұл жай ғана қате немесе оқыту артефактісі емес; бұл тапсырмаларды орындау кезінде модельдің әртүрлі компоненттері жүгінетін толыққанды ішкі жұмыс кеңістігі.

J-space дегеніміз не және ол қалай жұмыс істейді?

J-space-ті ЖИ ішіндегі виртуалды «тақта» ретінде елестету оңай. Claude сұраныс алғанда, тапсырманы шешкенде немесе нұсқаулықты орындағанда, негізгі ақпарат — фактілер, контекст, аралық қорытындылар — дәл осы жерде жиналады. Бұл модельдің әртүрлі бөліктері жауап генерациялау үшін деректерді ала алатын жаһандық алмасу буферінің бір түрі.

Anthropic J-lens деп аталатын арнайы құралдың көмегімен осы кеңістікке үңіле алды. Бақылаулар J-space оқыту процесінде өздігінен қалыптасатынын көрсетті — әзірлеушілер оны архитектурада анық көрсетпеген. Сонымен қатар, зерттеушілер J-space мазмұнын сұраныс бойынша оқып қана қоймай, оны өзгерте алатынын анықтады. Ал олар бұл кеңістіктегі деректерді қолмен түзеткенде, Claude-ның жауаптары мен мінез-құлқы сәйкесінше өзгерді.

Бұл когнитивті нейроғылымдағы «жаһандық жұмыс кеңістігі» (Global Workspace) тұжырымдамасын таңқаларлықтай еске түсіреді. Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа бір уақытта қол жеткізуді қамтамасыз етеді. Мысалы, сұрақты естігенде, ми есте сақтау, логика және сөйлеу орталықтарын біріктіреді. Claude таңқаларлық ұқсас механизмді көрсетеді.

Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге серпіліс?

J-space ашылуы жасанды интеллект қауіпсіздігі үшін орасан зор маңызға ие. Осы «саналы» өңдеу қабатындағы белсенділікті бақылау мүмкіндігі ғалымдарға модель мінез-құлқындағы жасырын мотивтерді анықтау үшін принципті түрде жаңа құрал береді. Біз жүйе сенімсіз жұмыс істей бастаған немесе шабуылға ұшыраған сәттерді әлдеқайда тиімді байқай аламыз.

Атап айтқанда, J-space мониторингі модель жауабын басқаруға тырысатын зиянды нұсқауларды енгізу — prompt-инъекция әрекеттерін нақты уақытта көруге мүмкіндік береді. Бұл жаңа буын қорғаныс жүйелерін құруға жол ашады.

Әрине, мүмкіндіктер әлі де шектеулі: Claude-дағы ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен, Anthropic J-lens іске асыруының бастапқы кодын және Neuronpedia-дағы демо-нұсқасын жариялап, зерттеушілер қауымдастығын нәтижелерді тәжірибеде тексеруге шақырды. Бұл нейрожелілердің «қара жәшігін» сәл мөлдірірек ету жолындағы маңызды қадам.

Сарапшы пікірі: J-space ашылуы — бұл жай ғана академиялық жаңалық емес. Бұл қазіргі LLM-дердің біз бұрын тек биологиялық интеллекттің айрықша құқығы деп санаған күрделі, иерархиялық когнитивті архитектураларға қарай эволюцияланатынының тікелей дәлелі. ЖИ нарықтарды талдау және активтерді басқару үшін жиі қолданылатын криптоиндустрия үшін осы «ішкі процестерді» түсіну сенім мен қауіпсіздіктің маңызды факторына айналады. Модельдің қалай «ойлайтынын» неғұрлым жақсы түсінсек, соғұрлым оған сенімді түрде сене аламыз.