Anthropic әзірлеушілер тобы үлкен тілдік модельдердің ішкі механизмдерін түсінуде серпіліс жасады. Claude жұмысын талдау барысында инженерлер жобалау кезеңінде архитектураға енгізбеген құрылым табылды. «J-space» деп аталатын бұл ішкі механизм нейрожелінің әртүрлі компоненттері маңызды ақпаратпен алмасу және өңдеу үшін жүгінетін әмбебап жұмыс кеңістігі ретінде жұмыс істейді.

6 шілдеде жарияланған зерттеу ЖИ интерпретациялануындағы маңызды қадам болып табылады. J-space — бұл жасанды интеллект ішіндегі виртуалды тақтаның бір түрі, оған есептерді шешу, сұрақтарға жауап беру немесе нұсқауларды орындау кезінде негізгі деректер жиналады. Осының арқасында модельдің әртүрлі бөліктері бір ақпаратпен синхронды жұмыс істей алады.

J-space қалай жұмыс істейді және бұл неліктен сенсация

Anthropic J-space-ті «J-lens» деп аталатын арнайы құралдың көмегімен анықтады. Оның көмегімен зерттеушілер тапсырмаларды орындау кезінде Claude ішінде ақпараттың қалай қозғалатынын бақылады. Таңқаларлығы, J-space оқыту процесінде өздігінен пайда болды — ол әзірлеушілермен тікелей бағдарламаланбаған. Бұл тұжырымдама когнитивті нейроғылымдар адам миында «жаһандық жұмыс кеңістігі» деп атайтын нәрсені таңқаларлықтай еске түсіреді.

Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды деректерге бір мезгілде қол жеткізуді қамтамасыз етеді. Мысалы, біз сұрақты естігенде, фактіні еске түсіргенде және жауапты тұжырымдағанда, ми барлық қажетті ақпаратты біріктіреді. Claude ұқсас үлгіні көрсетеді. Сонымен қатар, зерттеушілер J-space мазмұнын қолмен өзгерту арқылы модельдің жауаптарына әсер ете алды. Бұл виртуалды кеңістіктің мазмұны өзгерген кезде, ЖИ жауаптары мен тапсырмаларды орындау кезіндегі мінез-құлқы түбегейлі өзгерді.

Қауіпсіздік және интерпретацияланудың болашағы

J-space ашылуы жасанды интеллект қауіпсіздігі үшін орасан зор маңызға ие. Осы «жұмыс кеңістігіндегі» белсенділікті бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын ниеттер мен қажетсіз үлгілерді анықтауға жол ашады. Атап айтқанда, J-space мониторингі зиянкес нұсқауларды сұрауға енгізуге тырысатын prompt-injection шабуылдарын нақты уақыт режимінде анықтауға көмектеседі.

Claude-дегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жерде жүрсе де, мұндай құрылымның болу фактісі болашақ зерттеулер үшін күшті құрал болып табылады. Anthropic J-lens бағдарламалық кодының бастапқы нұсқасын жариялап, Neuronpedia платформасында демо-нұсқасын ұсынып, ғылыми қоғамдастықты нәтижелерді тексеруге шақырды.

Аналитик пікірі: Бұл ашылу ЖИ жүйелерінің аудиті мен қауіпсіздігіне деген көзқарасты түбегейлі өзгертуі мүмкін. Модельдің орталық шешім қабылдау процесіне «қарау» мүмкіндігі — бұл жай ғана ғылыми қызық емес, кез келген коммерциялық нейрожелілердің сенімділігін тексерудің әлеуетті стандарты. Дегенмен, антропоморфты терминологияға қарамастан, Anthropic тікелей мәлімдейді: Claude санаға немесе субъективті тәжірибеге ие емес. «Саналы түрде қолжетімді ақпарат» термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді.