Anthropic зерттеу тобы жасанды интеллект интерпретациясы саласында серпіліс жасады. Claude моделінің ішкі процестерін талдау барысында әзірлеушілер бастапқыда архитектураға енгізбеген құрылым табылды. Бұл «J-space» деп аталатын — нейрожелінің әртүрлі компоненттері үшін жаһандық жұмыс кеңістігі ретінде жұмыс істейтін ішкі механизм туралы.

J-space дегеніміз не және ол қалай жұмыс істейді?

Негізінде, J-space — бұл Claude сұрауды өңдеу кезінде негізгі ақпаратты жинайтын виртуалды «тақта». Модель тапсырманы шешкенде немесе сұраққа жауап бергенде, маңызды деректер осы кеңістікте пайда болады және жүйенің барлық бөліктеріне қолжетімді болады. Anthropic бұл құрылымды модель ішіндегі деректердің нақты уақыттағы қозғалысын бақылауға мүмкіндік беретін өзінің J-lens құралының көмегімен анықтады.

Айта кетерлігі, J-space оқыту процесінде өздігінен пайда болды. Конструкторлар оны тікелей бағдарламалаған жоқ. 6 шілдедегі бұл жаңалық үлкен тілдік модельдердің «капотының астында» не болып жатқанын түсінудегі маңызды қадам болып табылады.

Адам миымен ұқсастық және қауіпсіздікке әсері

J-space тұжырымдамасы адам миындағы «жаһандық жұмыс кеңістігінің» нейробиологиялық теориясымен таңғаларлықтай үндеседі. Адамдарда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа бір уақытта қол жеткізуді қамтамасыз етеді. Мысалы, біз сұрақты естігенде, фактіні еске түсіргенде және жауапты тұжырымдағанда — ми барлық деректерді бір нүктеге жинайды.

Эксперименттер Claude сұрау бойынша J-space мазмұнын сипаттап қана қоймай, сонымен қатар сұралса, оны өзгерте алатынын көрсетті. Оның үстіне, J-space-қа қолмен араласу модельдің жауаптары мен мінез-құлқына тікелей әсер етті. Бұл AI қауіпсіздігі үшін орасан зор перспективалар ашады. J-space белсенділігін бақылау модельдің мінез-құлқындағы жасырын мотивтерді анықтауға, prompt-injection шабуылдарын табуға және жүйе сенімсіз жұмыс істей бастаған сәттерді бақылауға мүмкіндік береді.

Перспективалар мен шектеулер

Anthropic J-lens бастапқы кодын жариялап, демо-нұсқасын Neuronpedia платформасына беріп, зерттеушілер қауымдастығын нәтижелерді тексеруге шақырды. Маңыздысы: компания Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейді. «Саналы түрде қолжетімді» ақпарат термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді.

Сарапшының пікірі: J-space анықтауы — бұл жай академикалық қызық емес. Бұл AI жүйелерінің аудиті мен қауіпсіздігіне көзқарасты түбегейлі өзгерте алатын алғашқы практикалық құрал. Егер біз модельдің «ойларын» нақты уақытта «оқи» алсақ, бұл бізге оның мінез-құлқына теңдессіз бақылау беріп, ақаулар мен шабуылдардың орын алуына жол бермеуге мүмкіндік береді. Дегенмен, Claude-дегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тан тыс жерде жүреді, сондықтан «қара жәшіктің» толық ашықтығы туралы айту әлі ерте.