Жасанды интеллект қауіпсіздігі зерттеушілері қауымдастығының назары OpenAI компаниясының жаңа Astra моделінің архитектурасына аударылды. Талқылау оның өнімділігіне емес, іргелі сұраққа қатысты: біз мұндай жүйелердің ойлау процесін қаншалықты бақылай аламыз?
Ықтимал проблеманың мәні «рекурренттік тереңдік» деп аталатын техниканы қолдануда жатыр. Логикалық тізбекті толығымен мәтін түрінде құрудың орнына, модель есептеулердің едәуір бөлігін айқын көрсетілмейтін ішкі күйлерде орындай алады. Бұл «мөлдір емес ойлау» деп аталатын құбылысты тудырады, бұл қорғаныс шектеулерін айналып өту немесе өтірік айту сияқты қауіпті мінез-құлықты анықтау үшін қолданылатын бақылау әдістеріне тікелей әсер етеді.
Қауіпсіздік үшін негізгі проблема
Жасанды интеллект қауіпсіздігі саласындағы жетекші сарапшылар бұған алаңдаушылық білдіруде. Redwood Research компаниясынан Райан Гринблатт Astra-ның ықтимал архитектурасын ЖИ-ді бақылауға төнетін ең маңызды қатерлердің бірі деп атады. Оның алаңдаушылығы модельдің қазіргі жағдайына емес, даму векторына қатысты.
Оның пікірінше, басты қатер мұндай тәсілді масштабтау латентті кеңістікте толығымен ойлайтын жүйелерді құруға әкелуі мүмкін. Бұл зерттеушілер мен автоматтандырылған қадағалау жүйелерін модельдің әрекеттерін түсіндіру және уақытында араласу мүмкіндігінен іс жүзінде айырады. Бұл әсіресе ЖИ-агенттерінің әрекеттерін талдау үшін тергеушілер дәл мәтіндік ойлау тізбектеріне сүйенген соңғы оқиғалар аясында алаңдатарлық көрінеді.
Сынауға жауап ретінде OpenAI компаниясының бас ғылыми қызметкері Якуб Пахоцки жұртшылықты жұбатуға асыққаны көрсеткішті. Ол Astra-ның есептеу графигінің тереңдігі GPT-4-тің сәйкес көрсеткішінен екі еседен аспайтынын мәлімдеді, сондай-ақ компания әрқашан бақылау мүмкіндігін сақтауға ұмтылғанын атап өтті. Алайда ол мұндай бақылау мүмкіндігінің өзі «нәзік» екенін және нашарлауы мүмкін екенін де мойындады.
Бұл жағдай ЖИ дамуының негізгі парадоксын ашады: барған сайын қуатты және автономды жүйелерді құруға ұмтылу олардың бақылануы проблемасымен сөзсіз соқтығысады. OpenAI Astra-ға сыни деңгейдегі кибермүмкіндіктерді берді, бұл модельдің осалдықтарды өз бетінше іздеу қабілетін білдіреді. Мұндай қабілеттері бар «қара жәшікке» қаншалықты сенуге болатыны туралы сұрақ тек техникалық емес, экзистенциалды сипатқа ие болады.
Менің кәсіби пікірім: Astra төңірегіндегі жария талқылау — маңызды сигнал. Біз модельдердің мүмкіндіктері оларды түсіну құралдарымыздан озып кете бастаған шекті тұрғыда тұрмыз. Тәуелсіз бағалау мен архитектураның техникалық детальдарын ашуды талап ету — бос қызығушылық емес, ЖИ дамуының келесі кезеңінде қауіпсіздікті қамтамасыз етудің қажетті шарасы.