Anthropic зерттеу тобы үлкен тілдік модельдердің ішкі архитектурасын түсінуде серпіліс жасады. Claude модельдерінің отбасын талдау барысында әзірлеушілер жобалау кезеңінде енгізбеген құрылым анықталды. Бұл «J-space» деп аталатын — модельдің әртүрлі компоненттері жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейтін ішкі механизм туралы.
Жарияланған мәліметтерге сәйкес (6 шілдедегі зерттеу), J-space — бүкіл модель бойынша негізгі ақпарат жиналатын және берілетін виртуалды «тақта». Claude сұраққа жауап бергенде, мәселені шешкенде немесе нұсқаулықты орындағанда, маңызды деректер осы кеңістікте пайда болады, осылайша модельдің әртүрлі бөліктері олармен жұмыс істей алады. Зерттеушілер модель ішіндегі ақпараттың қозғалысын нақты уақыт режимінде бақылауға мүмкіндік беретін «J-lens» деп аталатын құралды пайдаланды. Таңқаларлығы, J-space оқыту процесінде өздігінен пайда болды — оны конструкторлар тікелей енгізбеген.
Бұл тұжырымдама нейроғылымдарда «жаһандық жұмыс кеңістігі» деп аталатын нәрсемен таңғаларлықтай үндеседі. Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа қол жеткізуді қамтамасыз етеді. Мысалы, адам сұрақты естігенде, қажетті фактіні еске түсіріп, қалай жауап беру керектігін шешкенде, ми барлық қажетті деректерді бір жерге жинайды. Claude ұқсас жолмен жұмыс істейді: модель сұраныс бойынша J-space мазмұнын сипаттай алады және оны сұраса, тіпті өзгерте алады. Сонымен қатар, зерттеушілер J-space-ті қолмен өзгерткенде, Claude-тің жауаптары да, тапсырмаларды орындау кезіндегі мінез-құлқы да өзгерді.
Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге маңызды?
Бұл жаңалық жасанды интеллект қауіпсіздігі үшін үлкен маңызға ие. Егер ғалымдар J-space белсенділігін бақылай алса, оларда ЖИ модельдерінің мінез-құлқындағы жасырын мотивтерді анықтау мүмкіндігі пайда болады. Бұл жүйе сенімсіз жұмыс істей бастаған сәттерді, соның ішінде prompt-injection (сұранысқа зиянды нұсқауларды енгізу) шабуылдары кезінде тиімдірек белгілеуге мүмкіндік береді. Мұндай «саналы» өңдеу қабатына ішінара қол жеткізудің өзі зерттеулер үшін маңызды перспективалар ашады.
Әзірге мүмкіндіктер шектеулі: Claude-тегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен, Anthropic J-lens бастапқы кодын ашып, Neuronpedia-да демо-нұсқасын жариялады, зерттеу қауымдастығына нәтижелерді тәжірибеде тексеруді ұсынды.
Бұл зерттеу бірқатар ертеректегі жұмыстарға негізделген. 2025 жылдың қазан айында компания қалыптасып келе жатқан интроспективті сана туралы баяндама жариялады, ал 2025 жылдың сәуірінде модельдердің әл-ауқатын зерттеу бастамаларын іске қосты. Маңызды ескерту: Anthropic Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейтінін атап көрсетеді. Жұмыста когнитивті ғылымнан алынған «саналы түрде қолжетімді» ақпарат термині қолданылады — бұл нақты сананың болуын білдірмейді.
Сарапшының пікірі: J-space анықтауы — бұл жай академиялық қызық емес, «қара жәшіктерден» «ақ жәшіктер» жасауға бағытталған қадам. Криптоиндустрия үшін, мұнда ЖИ нарықтарды талдауда және активтерді басқаруда белсенді қолданылады, модельдің «басына» қарап, оның мотивтерін түсіну мүмкіндігі сенім мен қауіпсіздік мәселесі болып табылады. J-space мониторингі DeFi-дегі ЖИ агенттерін верификациялау стандартына айналуы мүмкін.