Anthropic зерттеу тобы жасанды интеллект интерпретациясы саласында серпіліс жасады. Claude моделдерінің отбасын талдау барысында «J-space» деп аталатын ішкі құрылым анықталды. Бұл жаңалықтың негізгі ерекшелігі — бұл механизм әзірлеушілер тарапынан жобалау кезеңінде енгізілмеген, ол модельді оқыту процесінде өздігінен қалыптасқан.
J-space дегеніміз не және ол қалай жұмыс істейді?
J-space-ті нейрожелі ішіндегі виртуалды «жаһандық жұмыс кеңістігі» ретінде елестетуге болады. Бұл сұранысты өңдеу кезінде негізгі ақпарат жиналатын ішкі қабат. Модельдің әртүрлі компоненттері — контексті түсіну модульдерінен жауап генераторларына дейін — деректермен алмасу үшін осы кеңістікке жүгіне алады. Негізінде, Claude өзінің ішкі алгоритмдерінің жұмысын үйлестіру үшін өзінің «тақтасын» жасады.
J-space-ті анықтау үшін Anthropic мамандары арнайы құрал — «J-lens» әзірледі. Оның көмегімен зерттеушілер тапсырмаларды орындау кезінде ақпараттың модель ішінде қалай қозғалатынын нақты уақытта бақылай алды. Сонымен қатар, эксперименттер J-space мазмұнын қолмен өзгерту Claude-тің жауаптары мен мінез-құлқына тікелей әсер ететінін көрсетті. Бұл бұл құрылымның кездейсоқ артефакт емес, архитектураның функционалды маңызды элементі екенін растайды.
Бұл ЖИ қауіпсіздігі үшін неге маңызды?
J-space-тің ашылуы жасанды интеллект жүйелерінің қауіпсіздігі мен бақылауы үшін тікелей маңызға ие. Осы «жұмыс кеңістігіндегі» белсенділікті бақылау мүмкіндігі жасырын мотивтер мен модельдердің әлеуетті қауіпті мінез-құлқын анықтау үшін жаңа көкжиектер ашады. Мысалы, J-space мониторингі prompt-инъекция әрекеттерін анықтауға көмектесуі мүмкін — бұл жауапты басқаруды ұстап алатын зиянды нұсқаулар сұранысқа енгізілетін шабуылдар.
Claude-тегі ақпаратты өңдеудің көп бөлігі әлі де J-space-тен тыс жерде жүретінін атап өткен жөн, бірақ мұндай өзін-өзі ұйымдастыратын құрылымның болу фактісінің өзі — мөлдір және бақыланатын ЖИ жүйелерін құрудағы маңызды қадам. Anthropic J-lens іске асырудың бастапқы кодын жариялап, Neuronpedia платформасында демо-нұсқасын ұсынды, ғылыми қоғамдастықты осы нәтижелерді тексеруге және дамытуға шақырды.
Сарапшының пікірі: J-space-тің ашылуы — бұл жай академиялық қызық емес. Криптовалюта және DeFi нарығы үшін, мұнда ЖИ агенттері активтерді басқару және деректерді талдау үшін жиі қолданылады, модельдердің ішкі архитектурасын түсіну өте маңызды болады. ЖИ-дің «капотының астына» қарап, оның неліктен осы немесе басқа шешім қабылдағанын түсіну мүмкіндігі — алгоритмдік жүйелерге деген сенімді арттырудың және олардың болжауға болмайтын мінез-құлқына байланысты тәуекелдерді азайтудың тікелей жолы.