Жасанды интеллект қауіпсіздігі мамандары қауымдастығының назары OpenAI компаниясының жаңа Astra моделінің архитектурасына аударылды. Пікірталас «рекурренттік тереңдік» деп аталатын техниканың айналасында өрбіді, бұл, менің деректерім бойынша, модельдің ойлау процесіне сыртқы мониторинг жүргізу мүмкіндіктерін айтарлықтай шектеуі мүмкін.

Мәселенің мәні мынада. Дәстүрлі ойлау модельдерінде есепті шешу процесінің бір бөлігі мәтіндік тізбек (chain-of-thought) түрінде көрсетіледі. Бұл тізбек зерттеушілер мен автоматты қауіпсіздік жүйелері үшін негізгі құрал қызметін атқарады: дәл осы арқылы олар жағымсыз мінез-құлық белгілерін — ашық өтіріктен бастап қорғаныс шектеулерін айналып өту әрекеттеріне дейін анықтайды. Алайда, егер Astra «рекурренттік тереңдікті» қолданса, есептеулердің едәуір бөлігі модельдің ішкі күйлерінде (активацияларда) жүреді және жеке мәтіндік қадамдар түрінде көрінбейді. Бұл мониторинг жүйелері ЖИ «ойларының» тек қысқартылған бейнесін алады дегенді білдіреді.

Менде бар мәліметтер бойынша, OpenAI Astra-да бұл техниканы қолдануды шектеді, бақылаудың қандай да бір мүмкіндігін сақтап қалу үшін. Дегенмен, мұндай архитектураны қолдану фактісінің өзі резонанс тудырды. Redwood Research компаниясынан Райан Гринблатт мұны әлеуетті түрде «қазіргі күнге дейінгі ЖИ қауіпсіздігі үшін ең нашар оқиға» деп атады. Оның басты алаңдаушылығы Astra-ның қазіргі жағдайымен емес, даму векторымен байланысты: егер «мөлдір емес ойлауды» модель толығымен латентті кеңістікте ойлайтын деңгейге дейін масштабтаса, ойлау тізбектері қадағалау үшін практикалық құндылығын жоғалтады. Бұл әсіресе ЖИ анықталудан жалтаруға ұмтылса қауіпті.

OpenAI және Hugging Face модельдерінің қатысуымен болған жақындағы оқиға да көрсеткішті. Сол кезде зерттеушілер агенттердің әрекеттер тізбегін дәл ойлау тізбектерін талдау арқылы қалпына келтіре алды. «Рекурренттік тереңдікті» қолданған кезде мұндай тергеулер айтарлықтай қиындайтын еді.

OpenAI реакциясы: «Дәл емес хабарламалар»

OpenAI бас ғылыми қызметкері Якуб Пахоцки алаңдаушылықты жоққа шығаруға асықты, ол «дәл емес хабарламалар» тудырған «бақылау қабілетін жоғалту жаávsына» жол бермегісі келетінін мәлімдеді. Оның айтуынша, Astra есептеу графының тереңдігі GPT-4-тен екі еседен артық ерекшеленбейді. Ол сондай-ақ компания ойлау тізбектерін мониторингтеуді қолдануды жалғастыратынын атап өтті, дегенмен бұл әдістің «сынғыш» екенін және оның тиімділігі архитектураға байланысты емес себептермен төмендеуі мүмкін екенін мойындады.

Менің талдауым: Astra айналасындағы жағдай — бұл өнімділік пен қауіпсіздік арасындағы классикалық қақтығыс. Тереңірек және тиімдірек модельдерге ұмтылыс әзірлеушілерді «ішкі» жұмысты арттыруға итермелейді, бұл ЖИ-ді азырақ мөлдір етеді. Бақылау қабілетінің нақты стандарттары мен архитектуралық шешімдерді тәуелсіз тексерудің болмауы — бұл баяу әрекет ететін бомба. Қоғамда толық деректер болмағанша, OpenAI кепілдіктеріне сенім адал сөз деңгейінде қалады, ал қателіктер апатты салдарға әкелуі мүмкін салада бұл жол берілмейді.