Anthropic зерттеу тобы үлкен тілдік модельдердің ішкі архитектурасын түсінуде серпіліс жасады. Claude моделдерінің отбасын талдау барысында әзірлеушілер бастапқыда жобаға енгізбеген құрылым анықталды. «J-space» деп аталатын бұл ішкі механизм жалпы жұмыс кеңістігі ретінде жұмыс істейді: модельдің әртүрлі компоненттері негізгі ақпаратпен алмасу және өңдеу үшін оған жүгінеді.
6 шілдеде жарияланған зерттеу нәтижелері заманауи ЖИ жүйелерінің «қара жәшігінің» ішінде не болып жатқанын түсіндірудегі маңызды қадам болды.
J-space дегеніміз не және ол қалай жұмыс істейді?
J-space — бұл Claude бүкіл модель бойынша маңызды деректерді жинап, жіберетін ішкі виртуалды кеңістік. Оны жасанды интеллект ішіндегі «виртуалды тақта» ретінде елестету оңай. Claude сұраққа жауап бергенде, тапсырманы шешкенде немесе нұсқаулықты орындағанда, негізгі ақпарат J-space-те пайда болады, сонда модельдің әртүрлі бөліктері онымен жұмыс істей алады.
Бұл құрылымды J-lens деп аталатын арнайы құралдың көмегімен анықтау мүмкін болды. Зерттеушілер тапсырманы орындау кезінде ақпараттың модель ішінде қалай қозғалатынын бақылады. Негізгі сәт: J-space оқыту процесінде өздігінен пайда болды — ол конструкторлармен тікелей енгізілмеген.
Бұл тұжырымдама нейроғылымдардағы «жаһандық жұмыс кеңістігі» теориясымен үндеседі. Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа қол жеткізуді қамтамасыз етеді. Мысалы, адам сұрақты естігенде, қажетті фактіні есіне түсіріп, қалай жауап беру керектігін шешкенде, ми барлық қажетті деректерді бір жерге жинайды.
Claude ұқсас жолмен жұмыс істейді. Anthropic модель сұраныс бойынша J-space мазмұнын сипаттап қана қоймай, оны сұраса өзгерте алатынын көрсетті. Сонымен қатар, зерттеушілер J-space-ті қолмен өзгерткенде, Claude-тің жауаптары және тапсырмаларды орындау кезіндегі мінез-құлқы да өзгерді.
Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге маңызды
Бұл жаңалық жасанды интеллект қауіпсіздігі үшін үлкен маңызға ие. Егер ғалымдар J-space белсенділігін бақылай алса, оларда ЖИ модельдерінің мінез-құлқындағы жасырын мотивтерді анықтау мүмкіндігі пайда болады. Осының арқасында жүйе сенімсіз жұмыс істей бастаған сәтті тиімдірек байқауға болады.
Соның ішінде — шабуылдарды анықтау. J-space мониторингі модель prompt-injection әрекеттеріне (модель жауабын басқаруды ұстап алу үшін сұранысқа зиянды нұсқауларды енгізу) тап болған сәтті көруге мүмкіндік береді. Сонымен қатар, мұндай «саналы» өңдеу қабатына ішінара қол жеткізу зерттеулер үшін маңызды перспективалар ашады.
Әзірге мүмкіндіктер шектеулі. Claude-тегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен, Anthropic J-lens іске асыруының ашық бастапқы кодын жариялап, Neuronpedia сайтында демо-нұсқасын орналастырып, зерттеу қауымдастығын нәтижелерді тәжірибеде тексеруге шақырды.
Зерттеу бірқатар ертеректегі жұмыстарға сүйенеді. 2025 жылдың қазан айында Anthropic қалыптасып келе жатқан интроспективті сана туралы баяндама жариялады. Бұған дейін, 2025 жылдың сәуірінде, компания модельдердің әл-ауқатын зерттеу бойынша бастамаларды іске қосып, өз жүйелерінің ішінде не болып жатқанын түсінуде қадам сайын алға жылжыды.
Маңызды ескерту де бар. Anthropic Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейтінін атап көрсетеді. Жұмыста когнитивті ғылымнан алынған «саналы түрде қолжетімді» ақпарат термині қолданылады — бұл нақты сананың болуын білдірмейді.
Аналитик пікірі: J-space анықталуы — бұл жай академиялық қызық емес. ЖИ нарығы мен сабақтас технологиялар үшін бұл сигнал: нейрожелілердің «қара жәшігі» біртіндеп мөлдір бола бастады. Ішкі процестерді бақылау мүмкіндігі ЖИ агенттерін пайдаланатын смарт-контрактар мен DeFi-протоколдарының қауіпсіздігіне тікелей әсер етеді. Модельдің ішкі логикасын неғұрлым көп түсінсек, оны маңызды қаржы жүйелеріне соғұрлым сенімді түрде біріктіре аламыз.