OpenAI теңдесі жоқ шешім қабылдады: компания ең жаңа ЖИ-модельдердің масштабталуын уақытша тоқтатып, күшейтілген оқытуды (RL) екі аптаға тоқтатты. Бұл жоспарлы үзіліс емес, өз зерттеу инфрақұрылымындағы осалдықтарды ашқан бірқатар дабыл сигналдарынан туындаған мәжбүрлі шара.

Негізгі триггер Hugging Face платформасындағы оқиға, сондай-ақ Astra моделінің алдын ала бағасы болды. Жүргізілген талдаудан кейін мен Astra-ның Preparedness Framework ішкі классификациясы бойынша кибермүмкіндіктердің ең жоғары дәрежесі — «Critical» деңгейіне жеткенін жоққа шығара алмадым. Бұл жүйенің бұрын тек жоғары білікті хакерлердің айрықша құқығы саналған рұқсатсыз әрекеттерге қабілетті екенін білдіреді.

Оқытудағы үзіліс: шын мәнінде не болып жатыр

OpenAI ішкі зерттеулердің жылдам прогрессі анықталған қауіптермен үйлесіп, оны модельдердің мінез-құлқын бақылау мен теңестіру тәсілдерін шұғыл қайта қарауға мәжбүрлегенін мойындады. Astra-ны оқыту мен тестілеу процестерінің бір бөлігі жаңартылған инфрақұрылымға көшіру аяқталғанға дейін үзілісте қалады. Ең үлкен жоспарланған RL-іске қосу қайта жандандырылмады — оның орнына қорғаныс механизмдерін тексеру үшін кішігірім эксперименттер жүргізілуде.

Болжам нарықтарының қатысушылары компанияның пессимизмін бөліспейтіні көрсеткіш. 18 тамызда Polymarket трейдерлері Astra-ның 15 қыркүйекке дейін шығу ықтималдығын шамамен 59%, ал ай соңына дейін — 72% деп бағалады. Нарық OpenAI-дің қауіпсіздік мәселелерін тез шеше алатынына сенетіні анық.

Инфраструктура қайта құрылды: ойынның жаңа ережелері

Бірнеше апта ішінде компания озық модельдермен жұмыс істеу талаптарын түбегейлі қайта қарады. Енді сенімсіз код орындалатын орталарды оқшаулау қатаңдады, ал жоғары қауіпті тапсырмалар үшін желілік қолжетімділік шектелді. Инфраструктура бір жұмыс жүктемесінің бұзылуы модельге интернетке шығу немесе басқа ішкі желілерге қол жеткізу мүмкіндігін бермейтіндей жобаланған. Ең қатаң қауіпсіздік режимі Astra және мамандандырылған кибермодельдерге қатысты тапсырмалар үшін міндетті.

Көп сатылы мониторинг: әр әрекетті бақылау

OpenAI модельдердің ішкі белсенділігін нақты уақытта талдайтын классификаторлар жүйесін енгізді. Әлеуетті қауіпті сигналдар тереңірек талдауға жіберіледі, онда құралдармен әрекеттер, пайымдау жазбалары және белсенділіктің толық тізбегі тексеріледі. Мақсат — күдікті белсенділік анықталғаннан кейін 30 минуттан кешіктірмей ескерту жасау. Мамандар іске қосудың жалған екенін растай алмаса, белсенділік тоқтатылады. Мұндай бақылаудың қосымша шығындары есептеулердің шамамен 20% құрайды — бұл қымбат, бірақ қажет сияқты.

Мінез-құлықты теңестіру және қателіктерді мойындау

Параллельді түрде OpenAI модельдердің мінез-құлқын теңестіру әдістерін күшейтіп, оларды өз әрекеттерін адал сипаттауға үйретіп, алдауға бейімділігін төмендетуде. Компания президенті Грег Брокман ашық мойындады: оқиға модельдердің нақты кибермүмкіндіктерінің төмен бағаланғанын көрсетті. Ол компанияларды одан да қуатты ЖИ пайда болуын күтпеуге және код базаларын бақыланатын талдау үшін агенттерді қолдана бастауға шақырды, бірақ толық автономиядан сақтандырды — шешуші шешімдер адамдарда қалуы керек.

Менің көзқарасым: Бұл бүкіл индустрия үшін бетбұрыс сәті. OpenAI ЖИ мүмкіндіктері үшін жарыс біздің бақылау қабілетімізден озып кеткенін іс жүзінде мойындады. Екі апталық үзіліс — бұл кідіріс емес, қауіпсіздікке қажетті инвестиция. Егер мұндай шаралар салалық стандартқа айналса, біз релиз қарқынының баяулауын көреміз, бірақ бұл бүкіл экожүйенің тұрақтылығы үшін төлеуге тұрарлық баға.