Anthropic зерттеушілері күтпеген жаңалық ашты: олардың флагмандық тілдік моделі Claude ішінде әзірлеушілер бастапқыда архитектураға енгізбеген ішкі құрылым қалыптасқан. «J-space» деп аталатын бұл механизм модельдің әртүрлі компоненттері тапсырмаларды орындау барысында жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейді.

J-space дегеніміз не?

Негізінде, J-space — бұл нейрожелі ішіндегі виртуалды «тақта», оған сұрауларды өңдеу кезінде негізгі ақпарат жиналады. Claude сұраққа жауап бергенде немесе тапсырманы шешкенде, маңызды деректер осы аймақта пайда болады, осылайша модельдің әртүрлі бөліктері олармен өзара әрекеттесе алады. Anthropic аналитиктері бұл құрылымды модель ішіндегі ақпараттың қозғалысын нақты уақыт режимінде бақылауға мүмкіндік беретін «J-lens» деп аталатын арнайы құралдың көмегімен анықтады.

Айта кететін жайт, J-space оқыту процесінде өздігінен пайда болды — бұл инженерлер бағдарламалаған жоқ. Бұл тұжырымдама нейроғылымда «жаһандық жұмыс кеңістігі» деп аталатын механизммен таңқаларлықтай үндеседі — бұл адамда бірнеше ойлау процестері үшін маңызды ақпаратқа қол жеткізуді қамтамасыз етеді. Мысалы, сіз сұрақты естігенде, фактіні еске түсіргенде және жауапты тұжырымдағанда, миыңыз осы деректердің барлығын бір нүктеге жинақтайды.

Эксперименттер Claude сұрау бойынша J-space мазмұнын сипаттап қана қоймай, оны өзгерте алатынын көрсетті. Сонымен қатар, бұл құрылымға қолмен араласу модельдің жауаптары мен мінез-құлқына тікелей әсер етті.

Бұл ЖИ қауіпсіздігі үшін неге маңызды

Бұл жаңалық жасанды интеллекттің қауіпсіздігі мен интерпретациялануы үшін орасан зор маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын ниеттерді анықтауға және prompt-injection шабуылдары сияқты ауытқуларды, яғни зиянды нұсқаулар жауапты басқаруды ұстап алуға тырысқанда, табуға жол ашады.

Қазіргі уақытта, әрине, мүмкіндіктер шектеулі: Claude-дегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жүреді. Дегенмен, команда J-lens бастапқы кодын жариялап, Neuronpedia сайтында демо-нұсқасын орналастырып, зерттеу қауымдастығын нәтижелерді тексеруге шақырды.

Бұл зерттеу — Anthropic компаниясының модельдердің «ішкі өмірін» зерттеу бойынша кеңірек жұмыс сериясының бөлігі. Компания ЖИ-дің «капот астында» не болып жатқанын түсінуге дәйекті түрде ұмтылуда және бұл, менің ойымша, қазіргі уақытта саладағы ең маңызды үрдістердің бірі.

Сарапшының пікірі: J-space анықталуы — бұл жай академиялық қызық емес. Бұл шынымен басқарылатын және ашық ЖИ құруға бағытталған қадам. Егер біз модельдердің ішкі жұмыс кеңістігі деңгейінде «ойларын оқи» алсақ, біз бүгінде бүкіл саланың алдында тұрған іргелі қауіпсіздік мәселелерін шешудің кілтін аламыз.