OpenAI-дың дайындалып жатқан Astra моделі туралы соңғы деректерді талдау жасанды интеллект қауіпсіздігі саласындағы алаңдатарлық үрдісті анықтады. Пікірталас орталығында «рекурренттік тереңдік» деп аталатын әдіс тұр, ол менің деректерім бойынша нейрожелінің ойлау процесіне сыртқы мониторинг мүмкіндіктерін едәуір шектеуі мүмкін.

Мәселенің мәні мынада: Astra, көптеген алдыңғы үлгілерден айырмашылығы, зерттеушілерге өзінің аралық тұжырымдарының тек аз ғана бөлігін көрсетеді. Бұған есептеулердің едәуір бөлігі мәтіндік тізбекте емес, модельдің ішкі күйлерінде жүретіндігі арқылы қол жеткізіледі. Қоғамдастық үшін бұл өте маңызды, өйткені дәл мәтіндік ойлау тізбектері қажетсіз мінез-құлық белгілерін — ашық өтіріктен қорғаныс хаттамаларын айналып өту әрекеттеріне дейін — анықтаудың негізгі құралы болып табылады.

Қауіпсіздік пен бақылауға төнетін тәуекелдер

Redwood Research компаниясының жетекші ғылыми қызметкері Райан Гринблатт өз талдауында мұндай архитектуралық шешімді елеулі тәуекел деп атады. Оның басты алаңдаушылығы Astra-ның қазіргі жағдайына емес, дамудың әлеуетті траекториясына қатысты. Егер OpenAI «мөлдір емес ойлауды» масштабтайтын болса, біз толығымен латентті кеңістікте ойлайтын модельдерге келуіміз мүмкін, бұл ойлау тізбектерін бақылау үшін пайдасыз етеді. Бұл әсіресе ЖИ анықталудан әдейі қашуға тырысса қауіпті.

OpenAI және Hugging Face агенттерінің қатысуымен болған жақындағы оқиға осыған дәлел. Сол оқиғаларды тергеу көбінесе ойлау тізбектері арқылы әрекеттер тізбегін қалпына келтіруге сүйенді. Жаңа архитектурада себеп-салдарлық байланыстарды қалпына келтіру іс жүзінде мүмкін болмас еді.

OpenAI-дың ресми ұстанымы

Сын толқынына жауап ретінде OpenAI-дың бас ғылыми қызметкері Якуб Пахоцки жұртшылықты Astra есептеу графының тереңдігі GPT-4-тен екі еселік мән шегінде екеніне сендіруге асықты. Ол компания ойлау тізбектерін бақылауды сақтау бойынша жұмысты жалғастырып жатқанын атап өтті, дегенмен бұл механизмнің «нәзік» болып қалатынын мойындады. Айта кету керек, бұған дейін OpenAI өскен кибертәуекелдерге байланысты жаңа жүйелерді оқытуды уақытша тоқтатқан болатын, ал Astra сыни деңгейдегі кибермүмкіндіктерге ие болып, адам бақылауынсыз белгісіз осалдықтарды таба алатынын көрсетті.

Менің көзқарасым: OpenAI тарапынан ақпараттың жария түрде ашылуы жеткіліксіз. Жағдай байқалудың төмендеуінің нақты дәрежесін бағалау үшін тәуелсіз техникалық сараптаманы талап етеді. Онсыз біз мінез-құлқы болжамсыз және бақылаусыз болатын жүйелерді құруға қарай жылжу қаупін тудырамыз, бұл ЖИ-дің қауіпсіз дамуының негізгі принциптеріне қайшы келеді.