Anthropic зерттеу тобы күтпеген жаңалық ашты: олардың Claude тілдік моделінің ішкі құрылымынан бастапқыда әзірлеушілер салмаған ішкі құрылым табылды. «J-space» деп аталатын бұл құрылым модельдің әртүрлі компоненттері жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейді.

6 шілдеде жарияланған зерттеуге сәйкес, J-space виртуалды «тақта» болып табылады, оған Claude есептерді шешу барысында негізгі ақпаратты жинайды. Бұл кеңістік инженерлер жобаламаған — ол модельді оқыту барысында өздігінен пайда болды. «J-lens» арнайы құралының көмегімен зерттеушілер тапсырмаларды орындау кезінде деректердің ЖИ ішінде қалай қозғалатынын бақылай алды.

Адам миымен ұқсастық

J-space тұжырымдамасы нейроғылымдарда «жаһандық жұмыс кеңістігі» деп аталатын нәрсемен таңғаларлықтай үндеседі. Адамда бұл жүйе бірнеше ойлау процестері үшін маңызды ақпаратқа бір мезгілде қол жеткізуді қамтамасыз етеді. Мысалы, біз сұрақты естігенде, қажетті фактіні еске түсіргенде және қалай жауап беру керектігін шешкенде, ми осы деректердің барлығын біріктіреді.

Эксперименттер Claude сұраныс бойынша J-space мазмұнын сипаттап қана қоймай, оны өзгерте алатынын көрсетті. Сонымен қатар, бұл кеңістікке қолмен араласу модельдің жауаптары мен мінез-құлқына тікелей әсер етті.

ЖИ қауіпсіздігі үшін маңызы

Бұл жаңалық жасанды интеллекттің қауіпсіздігі мен түсіндірілуі үшін орасан зор маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын себептерді анықтауға жол ашады. Бұл кеңістікті бақылау зиянды нұсқаулар модельдің жауабын басқаруға тырысатын prompt-injection шабуылдарын тиімдірек анықтауға мүмкіндік береді.

Мүмкіндіктер әлі де шектеулі болса да — ақпаратты өңдеудің үлкен бөлігі әлі де J-space-тен тыс жерде жүреді — Anthropic J-lens іске асырудың бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын ұсынды, ғылыми қоғамдастықты нәтижелерді тексеруге шақырды.

Атап өту маңызды: компания Claude санасы немесе субъективті тәжірибесі бар деп мәлімдемейді. «Саналы түрде қолжетімді» ақпарат термині когнитивті ғылымнан алынған және нақты сананың болуын білдірмейді.

Сарапшының пікірі: Бұл жаңалық жай техникалық қызық емес. Ол бізді үлкен тілдік модельдердің «қара жәшігін» түсінуге жақындатады. Егер біз ЖИ-дің ойларын нақты уақытта оқуды үйренсек, бұл жасанды интеллект жүйелерін аудиттеу мен тексеру тәсілін түбегейлі өзгертеді, бұл оларды қаржы секторына және басқа да жоғары тәуекелді салаларға енгізу үшін өте маңызды.