Anthropic зерттеушілері үлкен тілдік модельдердің ішкі архитектурасын түсінуде серпіліс жасады. Өздерінің Claude моделін талдау барысында олар жобалау кезеңінде әзірлеушілер салмаған, бірақ оқу процесінде өздігінен пайда болған құрылымды анықтады. «J-space» деп аталатын бұл ішкі механизм нейрожелінің әртүрлі компоненттері жүгінетін әмбебап жұмыс кеңістігі ретінде жұмыс істейді.

J-space дегеніміз не және ол қалай жұмыс істейді?

Жасанды интеллект ішіндегі виртуалды «тақтаны» елестетіңіз. Claude сұраныс алғанда, тапсырманы шешкенде немесе нұсқаулықты орындағанда, негізгі ақпарат дәл J-space-те жиналады. Бұл модельдің әртүрлі бөліктеріне тиімді әрекеттесуге және деректермен алмасуға мүмкіндік береді. Бұл құрылымды анықтау үшін Anthropic «J-lens» деп аталатын арнайы құралды әзірледі. Оның көмегімен ғалымдар тапсырмаларды орындау кезінде ақпараттың модель ішінде қалай қозғалатынын нақты уақыт режимінде бақылай алды.

Айта кету керек, J-space инженерлер бағдарламаламаған — ол оқытудың жанама өнімі ретінде эмерджентті түрде пайда болды. Бұл тұжырымдама танымдық нейроғылымдағы «жаһандық жұмыс кеңістігі» (Global Workspace Theory) ұғымымен таңғаларлықтай үндеседі, ол адам миының шешім қабылдау үшін әртүрлі салалардан ақпаратты қалай біріктіретінін сипаттайды. Зерттеушілер J-space мазмұнын оқып қана қоймай, оны өзгерте алатындықтарын көрсетті, бұл модельдің жауаптары мен мінез-құлқына тікелей әсер етеді.

Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге өте маңызды?

Бұл жаңалық жасанды интеллект қауіпсіздігінің болашағы үшін үлкен маңызға ие. J-space белсенділігін бақылау мүмкіндігі бізге нейрожелілердің «капотының астына қарауға» түбегейлі жаңа құрал береді. Біз ЖИ мінез-құлқындағы жасырын себептерді анықтай аламыз, жүйе сенімсіз жұмыс істей бастаған сәттерді таба аламыз және, ең бастысы, prompt-injection (модель жауабын басқаратын зиянды нұсқауларды енгізу) шабуылдарының әрекеттерін тани аламыз.

Қазіргі уақытта Claude-тегі ақпаратты өңдеудің көп бөлігі әлі де J-space-тен тыс жерде жүрсе де, мүмкіндіктер шектеулі болса да, алға жасалған қадам орасан зор. Anthropic ғылыми жұмысты жариялап, J-lens бастапқы кодын ашып қана қоймай, сонымен қатар Neuronpedia платформасында демо-нұсқасын ұсынып, барлық ғылыми қоғамдастықты нәтижелерді тексеруге шақырады. Атап өту маңызды: компания Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейді. «Санала қолжетімді ақпарат» термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді.

Сарапшының пікірі: J-space анықтау — бұл шынайы интерпретацияланатын және басқарылатын ЖИ құрудағы ең маңызды қадамдардың бірі. Егер біз модельдердің «ойларын» осындай іргелі деңгейде оқуды үйренсек, бұл олардың қауіпсіздігін арттырып қана қоймай, күрделірек және ашық пайымдауларға қабілетті жаңа буын алгоритмдерін жасауға әкелуі мүмкін. Технологиялардың болашағына қызығушылық танытатындардың барлығы осы жаңалықты мұқият қадағалауы керек.