Anthropic зерттеу тобы күтпеген жаңалық ашты: олардың Claude тілдік моделінің ішінде әзірлеушілер бастапқыда қарастырмаған ішкі құрылым қалыптасқан. Бұл «J-space» деп аталатын жаһандық жұмыс кеңістігі туралы, ол модельдің әртүрлі компоненттері арасында деректер алмасуға арналған ортақ тақта ретінде жұмыс істейді.

J-space дегеніміз не және ол қалай жұмыс істейді?

J-space — бұл Claude модель бойынша негізгі ақпаратты жинап, жіберетін ішкі виртуалды кеңістік. Модель сұраққа жауап бергенде немесе нұсқаулықты орындағанда, маңызды деректер J-space-те пайда болады, осылайша нейрожелінің әртүрлі бөліктері олармен жұмыс істей алады. Бұл когнитивті ғылымдағы «жаһандық жұмыс кеңістігі» концепциясын еске түсіреді — адам миының мәселені шешу үшін әртүрлі көздерден алынған ақпаратты біріктіруін сипаттайтын тұжырымдама.

«J-lens» деп аталатын бақылау құралы зерттеушілерге тапсырмаларды орындау кезінде модель ішіндегі ақпараттың қозғалысын қадағалауға мүмкіндік берді. Ең бастысы: J-space оқыту процесінде өздігінен пайда болды — ол инженерлермен бағдарламаланбаған.

Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге маңызды?

Бұл жаңалық жасанды интеллект қауіпсіздігі үшін тікелей маңызға ие. Егер ғалымдар J-space белсенділігін қадағалай алса, олар ЖИ-модельдерінің мінез-құлқындағы жасырын ниеттерді анықтау мүмкіндігіне ие болады. Атап айтқанда, J-space мониторингі модель prompt-инъекциясы (сұранысқа зиянды нұсқаулықтар енгізу) әрекеттеріне тап болған сәтті байқауға мүмкіндік береді.

Сонымен қатар, зерттеушілер J-space мазмұнын қолмен өзгерту Claude-тың жауаптарына және оның тапсырмаларды орындау кезіндегі мінез-құлқына тікелей әсер ететінін көрсетті. Бұл модельдерді тиімдірек бақылау үшін жаңа перспективалар ашады.

Anthropic J-lens іске асыруының бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын орналастырып, зерттеу қауымдастығын нәтижелерді тәжірибеде тексеруге шақырды. Жұмыс бұрынғы зерттеулер сериясына, соның ішінде «интроспективті сана» туралы баяндамаға (қазан 2025) және модельдердің әл-ауқатын зерттеу бастамаларына (сәуір 2025) сүйенеді.

Менің талдауым: Бұл соңғы жылдардағы ЖИ интерпретациялануы саласындағы ең маңызды жаңалықтардың бірі. J-space-тің өздігінен пайда болуы үлкен тілдік модельдердің адамның когнитивтік процестеріне ұқсас ішкі құрылымдарды дамыта алатыны туралы гипотезаны растайды. Смарт-келісімшарттардың қауіпсіздігі мен шабуылдардан қорғау өте маңызды болып табылатын криптоиндустрия үшін мұндай мониторинг механизмдері ЖИ-агенттерін аудиттеудің жаңа стандартына айналуы мүмкін. Дегенмен, есте сақтау маңызды: Anthropic «саналы түрде қолжетімді» ақпарат термині когнитивті ғылымнан алынғанын және модельде сананың болуын білдірмейтінін атап көрсетеді.