Anthropic зерттеу тобы өзінің Claude тілдік моделінің ішінен бұрын белгісіз ішкі құрылымды анықтау арқылы серпіліс жасады. «J-space» деп аталатын бұл механизм модельдің әртүрлі компоненттері жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейді. Маңыздысы: инженерлер бұл архитектураны жобалау кезінде енгізбеген — ол оқу процесінде өздігінен пайда болды.
J-space дегеніміз не және ол қалай жұмыс істейді?
Негізінде, J-space — бұл Claude модель бойынша негізгі деректерді жинап, беретін ішкі виртуалды кеңістік. Оны жасанды интеллект ішіндегі бір түрлі «тақта» ретінде елестетуге болады. Модель сұраққа жауап бергенде немесе тапсырманы шешкенде, маңызды ақпарат J-space-те пайда болады, осылайша модельдің әртүрлі бөліктері онымен әрекеттесе алады. Ғалымдар бұл құрылымды тапсырманы орындау кезінде ақпараттың қозғалысын бақылауға мүмкіндік беретін арнайы «J-lens» құралының көмегімен анықтады.
Айта кету керек, J-space көп жағынан адам ойлауындағы «жаһандық жұмыс кеңістігі» тұжырымдамасын қайталайды. Адам сұрақты естігенде, қажетті фактіні есіне түсіріп, қалай жауап беру керектігін шешкенде, оның миы барлық қажетті деректерді бір жерге жинайды. Claude осыған ұқсас жұмыс істейді. Сонымен қатар, зерттеушілер модельдің сұраныс бойынша J-space мазмұнын сипаттай алатынын және тіпті оны өзгерте алатынын көрсетті, егер одан сұраса. J-space-ке қолмен араласу модельдің жауаптары мен мінез-құлқына тікелей әсер етті.
Бұл неліктен ЖИ қауіпсіздігі үшін ойын ережелерін өзгертеді
Бұл жаңалық жасанды интеллекттің қауіпсіздігі мен интерпретациялануы үшін орасан зор маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын себептерді анықтауға жол ашады. Біз жүйе сенімсіз жұмыс істей бастаған сәттерді тиімдірек байқай аламыз. Атап айтқанда, J-space мониторингі prompt-инъекциялар әрекеттерін — модельдің жауабын басқаруды ұстап алу үшін сұрауға зиянды нұсқауларды енгізуді көруге мүмкіндік береді.
Әрине, мүмкіндіктер әзірге шектеулі. Claude-тегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен, Anthropic J-lens іске асыруының бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын орналастырып, зерттеу қауымдастығын нәтижелерді тәжірибеде тексеруге шақырды.
Бұл зерттеу бірқатар бұрынғы жұмыстарға негізделген. 2025 жылдың қазан айында Anthropic модельдердің қалыптасатын интроспективті «хабардарлығы» туралы баяндама жариялады, ал сәуірде олардың әл-ауқатын зерттеу бойынша бастамаларды іске қосты. Маңызды ескерту: компания Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейді. «Санала қолжетімді» ақпарат термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді.
Cryptalist сарапшысының пікірі: J-space анықтауы — бұл жай академиялық қызық емес. Бұл нейрондық желілерге «рентген аппаратын» жасауға бағытталған қадам. Шешім қабылдаудың «қара жәшігіне» үңілу мүмкіндігі — шынымен қауіпсіз және бақыланатын ЖИ жүйелерін құрудың кілті, бұл олардың қаржылық және басқару процестеріне интеграциясы үшін өте маңызды.