Anthropic зерттеушілері өздерінің Claude тілдік моделінің ішкі құрылымына үңіліп, күтпеген жаңалық ашты. Олар инженерлер жобалау кезінде жоспарламаған ішкі құрылымды тапты. «J-space» деп аталатын бұл механизм тапсырмаларды орындау кезінде модельдің әртүрлі компоненттері жүгінетін ортақ жұмыс кеңістігі ретінде жұмыс істейді.

Негізінде, J-space — бұл виртуалды «тақта», оған Claude сұраққа жауап беру, мәселені шешу немесе нұсқаулықты орындау үшін қажетті негізгі ақпаратты жинайды. Бұл ішкі деректер қабаты нейрондық желінің әртүрлі бөліктеріне қолжетімді, бұл олардың жұмысын үйлестіруге мүмкіндік береді. Бұл жаңалық модель ішіндегі ақпараттық ағындардың нақты уақыттағы қозғалысын бақылауға мүмкіндік беретін арнайы «J-lens» визуализация құралының көмегімен жасалды.

Ең таңғаларлығы — J-space оқыту процесінде өздігінен пайда болды. Бұл әзірлеушілер тарапынан енгізілмеген. Бұл тұжырымдама нейробиологияда «жаһандық жұмыс кеңістігі» деп аталатын — адам миының саналы ақпарат өңдеу үшін әртүрлі аймақтардан деректерді біріктіруін сипаттайтын теориямен таңғаларлық түрде үндеседі. Эксперименттер Claude J-space мазмұнын оқып қана қоймай, оны сұрау бойынша өзгерте алатынын көрсетті, бұл оның жауаптары мен мінез-құлқына тікелей әсер етеді.

Бұл AI қауіпсіздігі үшін ойын ережелерін неге өзгертеді?

Бұл жаңалық жасанды интеллекттің қауіпсіздігі мен интерпретациялануы үшін орасан зор маңызға ие. J-space мониторингінің мүмкіндігі бізге модельдің шешім қабылдау процесіне «терезе» береді. Енді біз жасырын мотивтерді бақылай аламыз немесе жүйе тұрақсыз жұмыс істей бастаған сәттерді анықтай аламыз. Мысалы, бұл зиянды нұсқаулар модельдің жауабын басқаруға тырысатын prompt-injection шабуылдарын анықтау үшін жаңа мүмкіндіктер ашады.

Anthropic J-lens бастапқы кодын жариялап, демо-нұсқасын ғылыми қоғамдастықтың тәуелсіз тексеруі үшін Neuronpedia платформасына берді. Компания 2025 жылы басталған модельдердің ішкі процестерін зерттеу жұмыстарын жалғастыруда.

Сарапшының пікірі: J-space ашылуы — бұл AI интерпретациялану саласындағы соңғы кездегі ең маңызды қадамдардың бірі. Біз «қара жәшіктен» үлкен тілдік модельдердің білімді қалай құрылымдайтыны мен өңдейтінін түсінуге көшіп жатырмыз. Криптоиндустрия үшін, мұнда AI нарықтарды талдау және активтерді басқару үшін белсенді қолданылады, мұндай жүйелердің ашықтығы сенімнің маңызды факторы болып табылады. Алгоритмнің «ойына үңілу» мүмкіндігі жаңа буын қауіпсіздік стандартына айналуы мүмкін.