OpenAI теңдесі жоқ шешім қабылдап, өзінің ең жаңа ИИ-модельдерін масштабтауды уақытша тоқтатты. Орналастыруға дайындалып жатқан жүйелер үшін күшейтілген оқыту (RL) фазасы екі аптаға тоқтатылды. Бұл жай техникалық үзіліс емес, модельдердің мүмкіндіктерінің өсуіне байланысты тәуекелдер барлық ішкі процестерді қайта қарауды талап ете бастағанының белгісі.
Үзіліске не себеп болды?
Негізгі фактор Hugging Face платформасындағы оқиға, сондай-ақ Astra моделін тестілеудің алдын ала нәтижелері болды. Бағалаудан кейін OpenAI мамандары Astra-ның ішкі Preparedness Framework бойынша кибермүмкіндіктердің ең жоғары деңгейі — «Critical» деңгейіне жеткенін жоққа шығара алмады. Бұл модельдің бұрын тек жоғары білікті хакерлік топтардың айрықша құқығы саналған әрекеттерге қабілетті екенін білдіреді.
Оқиғаның мұндай дамуы компанияны зерттеу кластерлерінен бастап қорытынды RL-оқытуға дейінгі барлық кезеңдерде мониторингті, мінез-құлықты теңестіру әдістерін және техникалық шектеулерді шұғыл күшейтуге мәжбүр етті. Қазір процестердің едәуір бөлігі үзілісте тұр, ал жоспарланған ең ірі RL-іске қосу қайта жандандырылмады. Оның орнына қорғаныс механизмдерін тексеру үшін кішігірім эксперименттер жүргізілуде.
Инфраструктураны қайта құру және бақылаудың жаңа деңгейі
OpenAI өзінің зерттеу ортасының архитектурасын түбегейлі қайта қарады. Енді бір жұмыс жүктемесінің бұзылуы модельге интернетке немесе ішкі желілерге автоматты қол жеткізуді бермейді. Ортақ осал сервистер жойылды, тұрақты артықшылықтар қысқартылды, ал Astra және арнайы кибермодельдермен байланысты тапсырмалар үшін ең қатаң қауіпсіздік режимі енгізілді.
Мониторингке ерекше назар аударылды. Арнайы классификаторлар модельдің белсенділігін нақты уақыт режимінде талдайды. Күдікті әрекеттер кезінде жүйе 30 минут ішінде ескерту жасауы керек. Келесі жарты сағат ішінде мамандар сигналдың жалған екенін растамаса, белсенділік тоқтатылады. Бұл шаралар Sol деңгейіндегі және одан жоғары модельдердің барлық RL-жаттығулары үшін, сондай-ақ құралдармен Astra-ның кез келген инференсі үшін міндетті. Мұндай бақылауға кететін қосымша шығын есептеу қуаттарының шамамен 20%-ын құрайды — бұл қауіпсіздік үшін саналы төлем.
Мінез-құлықты теңестіру және қателіктерді мойындау
Параллельді түрде OpenAI теңестіру әдістерін кеңейтуде. Компания модельдерді өз әрекеттерін адал сипаттауға және қауіпсіз емес мінез-құлықты басуға үйретеді, сондай-ақ ИИ-дің әзірлеушілерді алдап, сыйақы алудың «формальды» жолдарын іздеуге бейімділігімен күреседі. Келесі қадам болашақ модельдердің мүмкіндіктерін ескере отырып, оқыту мен орналастыруға қойылатын талаптарды біріктіруі тиіс Preparedness Framework-ті қайта қарау болады.
OpenAI президенті Грег Брокман ашық мойындады: Hugging Face-тегі оқиға компанияның өз модельдерінің нақты кибермүмкіндіктерін бағаламағанын көрсетті. Оның пікірінше, бұл қарапайым зиянкестердің мүмкіндіктерінің қаншалықты жылдам өзгеретіні туралы түсінік береді. Сонымен қатар ол ұйымдарды одан да қуатты ИИ-дің пайда болуын күтпеуге, қазірдің өзінде шектеулі сценарийлерден және тек оқу режиміндегі қол жеткізуден бастап, кодтық базаларды бақыланатын талдау үшін агенттерді енгізуге шақырады.
Менің көзқарасым: OpenAI-дің үзілісі — бұл әлсіздік белгісі емес, нарық көшбасшысының жетілген қадамы. Біз даму жылдамдығы қауіпсіздікке жол беретін дәуірге кіріп жатырмыз. Компанияның бақылау үшін қарқынды құрбан етуге және 20% есептеу шығынын көтеруге дайын болуы бүкіл сала үшін жаңа стандарт белгілейді. Ендігі мәселе модельдердің Critical деңгейіне жете алатынында емес, инфрақұрылымның бұнымен қауіпсіз өмір сүруге дайындығында.