Anthropic зерттеушілері күтпеген жаңалық ашты: олардың флагмандық тілдік моделі Claude ішінде әзірлеушілер жобалау кезеңінде қарастырмаған құрылым қалыптасқан. «J-space» деп аталатын бұл ішкі механизм модельдің әртүрлі компоненттері деректер алмасу үшін жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейді.

6 шілдеде жарияланған зерттеу нәтижелері үлкен тілдік модельдердің (LLM) «капотының астында» не болып жатқанын түсінудегі маңызды қадам болып табылады. J-space — бұл Claude желі бойынша негізгі ақпаратты жинап, беретін виртуалды «тақта». Модель сұраққа жауап бергенде немесе нұсқаулықты орындағанда, маңызды деректер J-space-те пайда болады, бұл оларды барлық қатысатын нейрондық тізбектерге қолжетімді етеді.

J-space қалай жұмыс істейді және бұл неге маңызды

Anthropic J-space-ті J-lens деп аталатын арнайы визуализация құралының көмегімен анықтады. Ғалымдар модель ішіндегі ақпараттың тапсырмаларды орындау кезіндегі қозғалысын бақылай отырып, бұл құрылымның оқыту процесінде өздігінен пайда болғанын анықтады. Ол инженерлермен тікелей бағдарламаланбаған.

Тұжырымдамалық тұрғыдан J-space когнитивті нейроғылымда «жаһандық жұмыс кеңістігі» деп аталатын нәрсені таңқаларлықтай еске салады. Адамда бұл жүйе бірнеше ойлау процестерінің маңызды ақпаратқа бір уақытта қол жеткізуін қамтамасыз етеді — мысалы, сіз сұрақты естігенде, фактіні еске түсіргенде және жауапты тұжырымдағанда, ми барлық деректерді біріктіреді. Claude ұқсас жұмыс істейді: модель J-space мазмұнын сұрау бойынша сипаттап қана қоймай, оны өзгертуді сұраса, өзгерте алады. Сонымен қатар, J-space-ке қолмен араласу модельдің жауаптары мен мінез-құлқын тікелей өзгертті.

ЖИ қауіпсіздігі мен интерпретациялануы үшін салдары

Бұл жаңалық жасанды интеллект қауіпсіздігі үшін үлкен маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын мотивтерді анықтауға жол ашады — мысалы, зиянды нұсқаулар жауапты басқаруға тырысатын prompt-injection шабуылдарының әрекеттерін анықтау. Ақпаратты өңдеудің осы «саналы» қабатына ішінара қол жеткізудің өзі зерттеушілерге жүйелердің сенімділігін бақылау үшін күшті құрал береді.

Атап өту маңызды: Anthropic Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейді. «Саналы түрде қолжетімді ақпарат» термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді. Дегенмен, компания J-lens бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын орналастырып, ғылыми қоғамдастықты нәтижелерді тәжірибе жүзінде тексеруге шақырды.

Сарапшының пікірі: J-space ашылуы — бұл жай академиялық қызық емес. Бұл ЖИ үшін «рентген көруін» жасауға бағытталған практикалық қадам. Алдағы жылдары осындай ішкі құрылымдарды бақылау барлық маңызды LLM жобалары үшін қауіпсіздік стандартына айналады. Егер біз модельдің шешімдерді қалай қабылдайтынын «көре» алсақ, біз оларды қауіпсіз, болжамды және, ең бастысы, манипуляциялардан қорғалған ете аламыз.