ЖИ зерттеушілер қауымдастығының назарында OpenAI компаниясының жаңа Astra моделі тұр. Талқылау оның өнімділігіне емес, ішкі процестердің ашықтығының әлеуетті төмендеуіне байланысты, бұл қолданыстағы қадағалау механизмдерінің тиімділігін күмәнға айналдырады.
Мәселенің мәні: «рекурренттік тереңдік»
Маған жеткен мәліметтерге сәйкес, Astra-да «рекурренттік тереңдік» деп аталатын әдіс қолданылады. Логикалық қадамдар талдауға қолжетімді мәтіндік тізбек түрінде көрсетілетін стандартты пайымдау модельдерінен айырмашылығы, рекурренттік тереңдік келесі мәтіндік қадамды генерациялауға дейін модельдің ішкі көріністерін қайта өңдеуді болжайды. Бұл есептеулердің едәуір бөлігі нейрожелінің жасырын күйлерінде жүретінін және айқын түрде көрсетілмейтінін білдіреді, бұл мониторинг жүйелеріне қолжетімді ақпарат көлемін қысқартуы мүмкін.
Мұндағы негізгі тәуекел — пайымдау тізбектеріне сүйеніп, қалаусыз мінез-құлық белгілерін — мысалы, өтірік айтуды немесе шектеулерді айналып өту әрекеттерін анықтайтын зерттеушілер мен автоматтандырылған қауіпсіздік жүйелері осы маңызды мүмкіндікті жоғалтуы мүмкін. Егер модель ниетін мәтінде ашпай, жасырын кеңістікте «ойлай» алса, оны қадағалау өте қиынға соғады.
Сарапшылардың бағасы және OpenAI ұстанымы
Бұл жаңалық жетекші мамандардың айтарлықтай алаңдаушылығын тудырды. Redwood Research компаниясының бас ғылыми қызметкері Райан Гринблатт мұндай архитектуралық шешімді «ЖИ қауіпсіздігі үшін ең нашар оқиға» деп атады. Оның басты қаупі — «мөлдір емес пайымдауды» масштабтау толығымен жасырын кеңістікте ойлайтын модельдердің құрылуына әкеліп, пайымдау тізбектерін мониторинг үшін практикалық құндылығынан айыруы мүмкін.
Сынға жауап ретінде OpenAI компаниясының бас ғылыми қызметкері Якуб Пахоцки Astra есептеу графының тереңдігі GPT-4-тен екі еседен артық айырмашылығы жоқ екенін жұртшылыққа жеткізуге асықты. Ол компанияның пайымдау тізбектерін мониторингтеу мүмкіндігін сақтауға ұмтылатынын атап өтті, дегенмен бұл мүмкіндіктің «нәзік» екенін және архитектураға байланысты емес себептермен нашарлауы мүмкін екенін мойындады.
Осы сендірулерге қарамастан, жағдай алаңдатарлық күйінде қалуда. Еске салайын, тамыз айында OpenAI кибертәуекелдерге байланысты жаңа модельдердің масштабталуын уақытша баяулатқан болатын, ал Astra-ның өзіне кибермүмкіндіктердің критикалық деңгейі берілген еді. Бұл компанияның әлеуетті қауіптердің барлық ауырлығын түсінетінін көрсетеді.
Менің талдауым: OpenAI-дің бәрін GPT-4-тен «екі еселік факторға» әкеліп тірейтін ұстанымы біршама жалтарушылық сияқты көрінеді. Жасырын кеңістіктегі есептеу «тереңдігінің» шамалы ғана артуы сыртқы жүйелер үшін интерпретация міндетін экспоненциалды түрде қиындатуы мүмкін. Негізгі мәселе архитектураның алдыңғыдан қаншалықты ерекшеленетінінде емес, маңызды пайымдаулардың қанша пайызы мониторинг көзінен тыс қалатынында. Жұртшылыққа нақты тәуекелдерді дұрыс бағалау үшін осы аспектінің неғұрлым егжей-тегжейлі және тәуелсіз бағасы қажет.