Anthropic зерттеу тобы өзінің Claude тілдік моделінің ішкі архитектурасын талдау барысында күтпеген жаңалық ашты. J-lens визуализация құралымен жұмыс істеу барысында мамандар жобалау кезеңінде жоспарланбаған құрылымды анықтады. Бұл «J-space» деп аталатын ішкі жұмыс кеңістігі туралы, ол модельдің әртүрлі компоненттері үшін ортақ деректер шинасы ретінде жұмыс істейді.

J-space дегеніміз не және ол қалай жұмыс істейді

J-space-ті тапсырманы орындау кезінде нейрондық желінің әртүрлі бөліктері жүгінетін виртуалды «тақта» ретінде елестетуге болады. Claude сұраныс алған кезде, негізгі ақпарат (контекст, нұсқаулар, аралық нәтижелер) осы кеңістікке орналастырылады, осылайша модельдің барлық модульдері онымен үйлесімді жұмыс істей алады. Бұл инженерлер тікелей енгізбеген — құрылым модельді оқыту процесінде өздігінен пайда болды.

Негізінде, J-space — бұл когнитивті ғылымда адам санасының механизмі ретінде қарастырылатын «жаһандық жұмыс кеңістігінің» (global workspace) аналогы. Мида бұл жүйе әртүрлі сенсорлық және когнитивті процестерден алынған деректерді біріктіріп, оларды саналы шешім қабылдау үшін қолжетімді етеді. Claude-де де осыған ұқсас нәрсе болып жатыр: зерттеушілер J-space мазмұнын бақылап қана қоймай, оны қолмен өзгерте алды, бұл модельдің мінез-құлқына тікелей әсер етті.

J-space у Claude во многом повторяет то, что ученые называют «глобальным рабочим пространством» в человеческом мышлении.
Claude-дегі J-space — бұл адам ойлауындағы жаһандық жұмыс кеңістігінің аналогы.

Бұл ЖИ қауіпсіздігі мен түсіндірмелілігі үшін неге маңызды

Бұл жаңалық жасанды интеллект қауіпсіздігі үшін тікелей маңызға ие. Егер біз J-space белсенділігін бақылай алсақ, модельдің мінез-құлқындағы жасырын мотивтерді анықтау құралына ие боламыз — мысалы, шектеулерді айналып өту әрекеттері немесе зиянды нұсқауларды орындау (prompt injection). Бұл қабатты бақылау модель қажетсіз жауап бермес бұрын, оның шабуылға ұшыраған сәтін байқауға мүмкіндік береді.

Сонымен қатар, «саналы түрде қолжетімді» ақпаратқа ішінара қол жеткізу зерттеулер үшін жаңа перспективалар ашады. Anthropic «саналы» термині когнитивті ғылымнан алынғанын және Claude-де субъективті тәжірибе немесе сананың болуын білдірмейтінін атап өтеді. Дегенмен, модельдің ішкі кеңістігіне әсер ету және өзгерістерді бақылау мүмкіндігінің өзі — бұл анағұрлым ашық және бақыланатын жүйелерді құруға бағытталған қадам.

Қазіргі уақытта Claude-дегі ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жерде жүреді, ал құралдың мүмкіндіктері шектеулі. Дегенмен, компания J-lens іске асырудың бастапқы кодын және Neuronpedia-дағы демо-нұсқасын жариялап, ғылыми қоғамдастықты нәтижелерді тексеруге шақырды.

Cryptalist сарапшылық пікірі

Бұл жаңалық — жай академиялық қызық емес. Ол күрделі нейрондық желілердің біз оларға анық енгізбеген өзіндік үйлестіру механизмдерін жасауға қабілетті екенін растайды. ЖИ индустриясы үшін бұл бір мезгілде сын-қатер де, мүмкіндік те: біз «қара жәшікті» аудиттеудің жаңа құралына ие боламыз, бірақ сонымен бірге модельдің өз компоненттері арасында жасырын «байланыс арналары» болуы мүмкін екендігіне тап боламыз. DeFi-протоколдары мен крипто-инфрақұрылым қауіпсіздігі контекстінде, мұнда ЖИ талдау және шешім қабылдау үшін жиі қолданылады, мұндай ішкі құрылымдарды түсіну өте маңызды болады.