Anthropic зерттеушілері өздерінің Claude модельдерінің ішкі жұмысын түсінуде серпіліс жасады. Олар инженерлер жобалау кезеңінде архитектураға енгізбеген құрылымды анықтады. Бұл «J-space» деп аталатын ішкі жұмыс кеңістігі — модель оқу процесінде өздігінен құрған.
J-space деректерге арналған жаһандық хабарландыру тақтасы ретінде жұмыс істейді. Claude сұрауды өңдегенде, тапсырманы шешкенде немесе нұсқаулықты орындағанда, маңызды ақпарат осы кеңістікте шоғырланады. Модельдің әртүрлі компоненттері деректермен алмасу үшін J-space-ке жүгінеді. Бұл когнитивті нейроғылымдағы «жаһандық жұмыс кеңістігі» тұжырымдамасын еске түсіреді, мұнда ми шешім қабылдау үшін әртүрлі аймақтардан ақпаратты біріктіреді.
Бұл құрылымды анықтау үшін Anthropic командасы J-lens деп аталатын құралды әзірледі. Оның көмегімен зерттеушілер тапсырманы орындау кезінде модель ішінде ақпараттың қалай қозғалатынын бақылады. Негізгі қорытынды: J-space бағдарламаланбаған — ол оқытудың эмердженттік қасиеті ретінде стихиялы түрде пайда болды.
Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге маңызды
J-space ашылуы жасанды интеллект қауіпсіздігі үшін үлкен маңызға ие. Егер ғалымдар осы кеңістіктегі белсенділікті бақылай алса, олар модельдердің мінез-құлқындағы жасырын ниеттерді анықтай алады. Бұл модельдің жауабын басқаруға тырысатын зиянды нұсқаулықтар prompt-injection сияқты шабуылдарды тиімдірек анықтауға жол ашады.
Зерттеушілер сонымен қатар J-space мазмұнын қолмен өзгерте алатындықтарын көрсетті, бұл Claude жауаптары мен мінез-құлқына тікелей әсер етеді. Бұл бақылау мен түсінудің бұрын-соңды болмаған деңгейін береді.
Anthropic J-lens бастапқы кодын жариялап, Neuronpedia-да демо-нұсқасын орналастырып, ғылыми қоғамдастықты нәтижелерді тәжірибеде тексеруге шақырды. Бұл компанияның жұмыс сериясының жалғасы: 2025 жылдың қазанында олар қалыптасатын интроспективті сана туралы баяндама жариялады, ал сәуірде модельдердің әл-ауқатын зерттеу бастамаларын іске қосты.
Сарапшы пікірі: J-space ашылуы — бұл жай академиялық қызық емес. Бұл «мөлдір ЖИ»-ге қадам, біз нейрожелінің «қара жәшігіне» қарап, оның неліктен белгілі бір шешімдер қабылдайтынын түсіне аламыз. ЖИ нарықтарды талдау және активтерді басқару үшін жиі қолданылатын криптоиндустрия үшін бұл сенімділік пен қауіпсіздікті арттырудың тікелей жолы. Модельдің ішкі процестерін бақылау мүмкіндігі — біз ұмтылуымыз керек жаңа қауіпсіздік стандарты.