Anthropic зерттеушілер тобы өздерінің Claude модельдерінің ішінде күтпеген жаңалық ашты. Ішкі процестерді талдау барысында олар әзірлеушілер жобалау кезінде енгізбеген құрылымға тап болды. Бұл модельдің әртүрлі компоненттері жүгінетін «J-space» деп аталатын жаһандық жұмыс кеңістігі механизмі туралы болып отыр.

6 шілдеде жарияланған зерттеу үлкен тілдік модельдердің «капотының астында» не болып жатқанын түсінудегі маңызды қадам болды. J-space виртуалды тақта ретінде жұмыс істейді: Claude сұраққа жауап бергенде, есепті шешкенде немесе нұсқаулықты орындағанда, негізгі ақпарат осы кеңістікте пайда болады, осылайша модельдің әртүрлі бөліктері онымен әрекеттесе алады.

J-space қалай жұмыс істейді?

J-space-ті анықтау үшін Anthropic мамандары «J-lens» деп аталатын арнайы құралды әзірледі. Оның көмегімен олар тапсырманы орындау кезінде ақпараттың модель ішінде қалай қозғалатынын бақылады. Ең таңғаларлығы: J-space оқыту процесінде өздігінен пайда болды — оны архитектураға тікелей енгізбеген.

Бұл идея нейроғылымдағы «жаһандық жұмыс кеңістігі» тұжырымдамасын еске түсіреді. Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа қол жеткізуді қамтамасыз етеді. Мысалы, адам сұрақты естігенде, қажетті фактіні еске түсіріп, қалай жауап беру керектігін шешкенде, ми барлық қажетті деректерді бір жерге жинайды.

Claude да осыған ұқсас жұмыс істейді. Зерттеушілер модельдің J-space мазмұнын сұрау бойынша сипаттай алатынын, сондай-ақ оны сұраған жағдайда өзгерте алатынын көрсетті. Оның үстіне, ғалымдар J-space-ті қолмен өзгерткенде, Claude-тің жауаптары да, тапсырмаларды орындау кезіндегі мінез-құлқы да өзгерді.

Бұл ЖИ қауіпсіздігі үшін неге маңызды

Бұл жаңалық жасанды интеллект қауіпсіздігі үшін үлкен маңызға ие. Егер ғалымдар J-space белсенділігін бақылай алса, оларда ЖИ модельдерінің мінез-құлқындағы жасырын себептерді анықтау мүмкіндігі пайда болады. Осының арқасында жүйе сенімсіз жұмыс істей бастаған сәтті тиімдірек белгілеуге болады.

Соның ішінде — шабуылдарды анықтау. J-space мониторингі модель prompt-инъекциясы әрекеттеріне (жауапты басқаруды ұстап алу үшін сұрауға зиянды нұсқаулар енгізу) тап болған сәтті көруге мүмкіндік береді. Өңдеудің мұндай «саналы» қабатына ішінара қол жеткізудің өзі зерттеулер үшін маңызды перспективалар ашады.

Әзірге мүмкіндіктер шектеулі: Claude-тегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен Anthropic J-lens іске асырудың ашық бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын орналастырып, зерттеушілер қауымдастығына нәтижелерді тәжірибеде тексеруді ұсынды.

Зерттеу бірқатар бұрынғы жұмыстарға сүйенеді. 2025 жылдың қазанында Anthropic қалыптасып келе жатқан интроспективті сана туралы баяндама жариялады. Бұған дейін, 2025 жылдың сәуірінде, компания модельдердің әл-ауқатын зерттеу бойынша бастамаларды іске қосып, өз жүйелерінің ішінде не болып жатқанын түсінуде қадам сайын алға жылжыды.

Менің пікірім: Бұл жаңалық бүкіл ЖИ индустриясы үшін бетбұрыс сәті болуы мүмкін. Модельдің «жұмыс кеңістігіне» қарау мүмкіндігі — бұл тек ғылыми қызығушылық емес, қауіпсіздік пен бақылауды арттырудың нақты құралы. Егер біз модельдің шешімдерді қалай қабылдайтынын көре алсақ, біз оны бұзулар мен манипуляциялардан жақсырақ қорғай аламыз. ЖИ нарықтарды талдау және активтерді басқару үшін қолданылатын криптоиндустрия үшін бұл әсіресе өзекті.