Anthropic зерттеу тобы өзінің Claude тілдік моделінің ішінде күтпеген жаңалық ашты. Инженерлер ішкі процестерді талдау барысында жобалау кезінде қарастырылмаған құрылымды — «J-space» деп аталатынды анықтады. Бұл ішкі жұмыс кеңістігі модельдің әртүрлі компоненттері тапсырмаларды орындау кезінде жүгінетін ортақ «виртуалды сызба» ретінде жұмыс істейді.
Жаңалықтың мәні — J-space негізгі ақпарат жиналып, өңделетін орталық түйін болып табылады. Claude сұраққа жауап бергенде немесе тапсырманы шешкенде, маңызды деректер осы кеңістікке жиналады, бұл модельдің әртүрлі бөліктеріне тиімді әрекеттесуге мүмкіндік береді. Бұл құрылымды анықтау үшін зерттеушілер модель ішіндегі ақпараттың қозғалысын нақты уақытта бақылауға мүмкіндік беретін арнайы «J-lens» құралын пайдаланды.
Бұл ЖИ қауіпсіздігі мен интерпретациялануы үшін неге маңызды
Бұл жаңалық жасанды интеллект жүйелерінің қауіпсіздігі мен ашықтығы үшін орасан зор маңызға ие. J-space белсенділігін бақылау мүмкіндігі модельдердің мінез-құлқындағы жасырын мотивтерді анықтауға жол ашады. Мысалы, осы кеңістікті бақылау модель жауапты басқаруды ұрлау мақсатында сұранысқа зиянды нұсқауларды енгізу — prompt-инъекция әрекетіне тап болған сәтті анықтауға мүмкіндік береді. Тіпті осы «саналы» өңдеу қабатына ішінара қол жеткізу зерттеулер үшін маңызды перспективалар ашады.
Маңызды ескерту: Anthropic Claude-да сана немесе субъективті тәжірибе бар деп мәлімдемейтінін атап көрсетеді. Жұмыста когнитивті ғылымнан алынған «саналы түрде қолжетімді» ақпарат термині қолданылады — бұл нақты сананың бар екенін білдірмейді.
Зерттеу бірқатар бұрынғы жұмыстарға негізделген. 2025 жылдың қазан айында Anthropic қалыптасып келе жатқан интроспективті сана туралы баяндама жариялады, ал 2025 жылдың сәуірінде модельдердің әл-ауқатын зерттеу бастамаларын іске қосты. Компания сонымен қатар J-lens бағдарламалық кодының бастапқы нұсқасын жариялап, Neuronpedia сайтында демо-нұсқасын орналастырып, зерттеу қауымдастығына нәтижелерді тәжірибе жүзінде тексеруді ұсынды.
Аналитикалық қорытынды: J-space анықталуы — бұл жай техникалық қызық емес, үлкен тілдік модельдердің қалай жұмыс істейтінін түсінудегі іргелі қадам. ЖИ-дің орталық шешім қабылдау процессорына «көз жүгірту» мүмкіндігі қауіпсіздік аудиті мен модельдердің мінез-құлқын тексеру тәсілдерін түбегейлі өзгерте алады. Смарт-келісімшарттар мен орталықсыздандырылған қосымшалар ЖИ-мен жиі біріктірілетін криптоиндустрия үшін бұл жаңалық шынымен сенімді және болжамды жүйелерді құрудың кілті болуы мүмкін.