Anthropic зерттеушілері өздерінің Claude тілдік модельдерінің ішінен күтпеген және өте маңызды жаңалық ашты. Олар модельдің әртүрлі компоненттері үшін ортақ жұмыс кеңістігі болып табылатын ішкі құрылымды тапты. «J-space» деп аталатын бұл құрылым әзірлеушілер тарапынан жобалау кезінде енгізілмеген — ол оқыту барысында өздігінен пайда болды. 6 шілдеде жарияланған бұл жаңалық үлкен тілдік модельдердің «қара жәшігінің» ішінде не болып жатқанын түсінудегі маңызды қадам болып табылады.
J-space дегеніміз не және ол қалай жұмыс істейді?
Жеңілдетіп айтқанда, J-space-ті Claude сұраққа жауап беру немесе тапсырманы орындау кезінде негізгі ақпаратты орналастыратын виртуалды «тақта» ретінде елестетуге болады. Модельдің әртүрлі бөліктері өз жұмысын синхрондау үшін осы тақтаға жүгіне алады. J-space-ті анықтау үшін «J-lens» деп аталатын арнайы құрал жасалды. Оның көмегімен ғалымдар тапсырманы орындау кезінде ақпараттың модель ішінде қалай қозғалатынын бақылады. Негізгі сәт: J-space анық бағдарламаланбаған — ол оқыту процесінде өздігінен қалыптасты, бұл когнитивтік ғылым мен нейроғылымдардағы «жаһандық жұмыс кеңістігі» тұжырымдамасын еске түсіреді.
Адам миында бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратты бір уақытта ұстап тұруға мүмкіндік береді. Мысалы, сұрақты естігенде, біз фактіні еске түсіреміз және бір уақытта қалай жауап беру керектігін шешеміз. Claude ұқсас жолмен жұмыс істейді. Сонымен қатар, зерттеушілер J-space мазмұнын оқып қана қоймай, оны өзгерте алатынын анықтады, бұл модельдің жауаптары мен мінез-құлқына тікелей әсер етеді.
Бұл AI қауіпсіздігі үшін ойын ережелерін неге өзгертеді?
Бұл жаңалық жасанды интеллекттің қауіпсіздігі мен интерпретациялануы үшін орасан зор маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын мотивтерді анықтауға тікелей жол ашады. Біз жүйенің сенімсіз жұмыс істей бастаған немесе «алдауға» тырысқан сәттерін әлдеқайда тиімді байқай аламыз.
Атап айтқанда, бұл модельдің жауабын басқаруға тырысатын зиянды нұсқаулар prompt-injection шабуылдарына қарсы күшті құрал. J-space мониторингі мұндай шабуылмен соқтығысу сәтін көруге мүмкіндік береді. Айта кету керек, Claude ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді және мүмкіндіктер әзірге шектеулі. Дегенмен, Anthropic J-lens бастапқы кодын және Neuronpedia-дағы демо-нұсқасын жариялап, ғылыми қоғамдастықты нәтижелерді тәжірибеде тексеруге шақырды.
Менің талдауым: Бұл жаңалық жай академиялық қызық емес. Ол бізге, аналитиктер мен әзірлеушілерге, AI мінез-құлқын бақылаудың түбегейлі жаңа деңгейін береді. Модельдің «жұмыс кеңістігіне» қарап, тіпті оған әсер ету мүмкіндігі — бұл анағұрлым ашық, болжамды және ең бастысы, қауіпсіз жүйелерді құрудың тікелей жолы. Біз кіріс және шығыс деректерін жай бақылаудан шешім қабылдаудың ішкі логикасын түсінуге көшеміз.