Anthropic зерттеушілері өздерінің үлкен тілдік модельдерінің нақты қалай жұмыс істейтінін түсінуде серпіліс жасады. Claude ішкі процестерін зерттеу барысында инженерлер бастапқыда архитектураға енгізбеген құрылым табылды. Бұл модель оқу процесінде өзі жасаған «J-space» деп аталатын ішкі жұмыс кеңістігі туралы.
J-space тапсырмаларды орындау кезінде негізгі ақпарат жиналатын «виртуалды тақта» немесе ортақ жұмыс кеңістігі ретінде жұмыс істейді. Модельдің әртүрлі компоненттері өз әрекеттерін үйлестіру және келісілген жауап беру үшін осы кеңістікке жүгінеді. Зерттеушілер бұл механизмді модель ішіндегі деректердің нақты уақыттағы қозғалысын бақылауға мүмкіндік беретін арнайы «J-lens» құралы арқылы бақылай алды.
Ең бастысы — J-space жобаланбаған. Ол күрделі жүйенің эмердженттік қасиеті ретінде табиғи түрде пайда болды. Бұл жаңалық когнитивтік ғылымдағы «жаһандық жұмыс кеңістігі» тұжырымдамасымен үндеседі — бұл адам миының шешім қабылдау үшін әртүрлі көздерден ақпаратты біріктіруін түсіндіретін теория. Claude сұраққа жауап бергенде, мәселені шешкенде немесе нұсқаулықты орындағанда, маңызды деректер J-space-те пайда болады, осылайша модельдің әртүрлі бөліктері олармен жұмыс істей алады.
Бұл ЖИ қауіпсіздігі үшін неге маңызды
J-space ашылуы жасанды интеллекттің қауіпсіздігі мен интерпретациялануы үшін үлкен маңызға ие. Бұл кеңістіктегі белсенділікті бақылау мүмкіндігі модельдің мінез-құлқындағы жасырын мотивтер мен ауытқуларды анықтауға жол ашады. Мысалы, зиянды нұсқаулар модельдің жауабын басқаруға тырысатын prompt-injection шабуылдарын тиімдірек анықтауға болады. J-space мониторингі модельдің араласу әрекетіне тап болған сәтін көруге мүмкіндік береді.
Сонымен қатар, эксперименттер J-space мазмұнын қолмен өзгерту Claude жауаптарына және оның тапсырмаларды орындау кезіндегі мінез-құлқына тікелей әсер ететінін көрсетті. Бұл зерттеушілерге дәл баптау және бақылау үшін қуатты құрал береді.
Anthropic J-lens бастапқы кодын және Neuronpedia-дағы демо-нұсқасын жариялап, ғылыми қоғамдастықты нәтижелерді тексеруге шақырды. Бұл компанияның 2025 жылдың сәуірінде басталған «пайда болып келе жатқан сана» және модельдердің әл-ауқатын зерттеу жұмыстарының жалғасы.
Сарапшы пікірі: J-space ашылуы — бұл жай академиялық қызық емес. Криптовалюта және DeFi нарығы үшін, мұнда ЖИ агенттері портфельдерді басқарып, тәуекелдерді талдай бастағанда, модельдің ішкі логикасын түсіну активтер қауіпсіздігінің мәселесіне айналады. «Капоттың астына қарап», модельдің шешімдерді қалай қабылдайтынын көру мүмкіндігі — шынайы ашық және бақыланатын ЖИ жүйелерін құруға жасалған қадам.