Крипто әлеміндегі жаңалықтар

17.08.2026
10:19

Anthropic биозақығау жүйесіндегі ауқымды ақаулықты ашты: 133 млн ИИ-мен диалог сүзгілерсіз өтті

ii-startap-Anthropic-AI

Менің қолымда Anthropic-тің жаңа есебі пайда болды, ол Claude қауіпсіздік жүйесіндегі алаңдатарлық оқиғаны ашады. Мәселе биологиялық классификаторлардың — ИИ-ді биологиялық қару жасау үшін пайдалану әрекеттерін бұғаттауға тиіс сол тосқауылдардың — жұмысындағы бір жылға жуық ақау туралы болып отыр. Проблеманың ауқымы таңғалдырады: шамамен 50 000 адам және модельдермен шамамен 133 млн өзара әрекеттесу зардап шекті.

Мердігерлер инфрақұрылымындағы сыни осалдық

Оқиғаның мәні — 2025 жылдың мамырынан 2026 жылдың сәуіріне дейін сыртқы мердігерлер модельдерді сынаған кері байланыс жинау платформаларының трафигі биологиялық фильтрлердің бұғаттау әрекетінсіз өткен. Мені ерекше алаңдататын техникалық деталь: трафик ішкі пайдалану жалаушасымен белгіленген, ол бір мезгілде классификаторлардың өзін де, олардың іске қосылуын тіркеу жүйесін де өшірген. Бұл әлеуетті қауіпті сұраулардың бұғатталмай ғана қоймай, кейінгі аудит үшін із қалдырмағанын білдіреді. Одан да жаманы, Anthropic мердігерлердегі қолжетімділікті бақылаудың әлсіздігін мойындады. 2026 жылдың сәуіріне дейін олардың көбінде персоналды тексерудің сенімді рәсімдері болмаған, бұл зиянкестің Red Team командаларына енуін нақты еткен.

Ретроспективті талдау не көрсетті

Қатені анықтағаннан кейін компания барлық дерлік деректерді қалпына келтірді, бір платформадағы шамамен 1% диалогтарды қоспағанда. Тексеру үшін Anthropic Claude Sonnet 5-ті пайдаланды, ол жоғары тәуекел деңгейі бар 1197 транскриптті анықтады. Алайда жақынырақ қарағанда көрініс өзгереді: олардың 757-сі — Anthropic-тің өз ішкі командаларының сұраулары, тағы 378-і — әдейі red teaming. Тек 62 сыртқы диалог қалды, олар тестілеуге қатысы жоқ. Бұл жағдайларды қолмен тексеру биологиялық қару жасаудың айқын әрекеттерін анықтаған жоқ. Компания химиялық-биологиялық тәуекелдің айтарлықтай өсу ықтималдығын «өте екіталай» деп бағалайды, қауіпті сұраулардың аз санын және олардың қысқа мерзімділігін көрсете отырып. Алайда қорғаныстағы осындай ұзақ олқылық фактісінің өзі мені олардың қорытындыларының толықтығына күмәндандырады — егер классификаторлар жұмыс істемесе, терең талдау үшін сигналдар да жеткіліксіз болуы мүмкін еді.

Тәуекел бағаларын қайта қарау

Оқиға Anthropic-ті өз бағалауларын қайта қарауға мәжбүрледі. CB-1 сценарийі бойынша (белгілі биоқауіптерді жасаудағы ИИ көмегі) өткен кезеңдегі тәуекел кейіннен «өте төменнен» «төменге» көтерілді. Ағымдағы деңгей «төмен, бірақ елеусіз емес» деп сипатталады. Сондай-ақ жоғары ставкалы жағдайлардағы мислаймент тәуекелінің бағасы «өте төменнен» «төменге» көтерілді.

Өз модельдеріне тәуелділік

Есептің қызықты деталы — ИИ-дің Anthropic-тің өз жұмысына интеграциялану дәрежесі. Claude қазірдің өзінде компанияның өндірістік репозиторийлеріне түсетін кодтың көп бөлігін жазады. Бұл технологияның жетілу көрсеткіші, бірақ сонымен бірге әлеуетті істен шығу нүктесі: егер модель кодта қателессе, салдары жүйелік болуы мүмкін. Менің үкімім: бұл жағдай — ИИ қауіпсіздігі саласының көшбасшыларында да соқыр аймақтар бар екенінің жарқын мысалы. Anthropic-тің проблеманы жылдам анықтап, талдай алуы үміттендіреді, бірақ қорғаныстағы 11 айлық олқылық фактісінің өзі — бүкіл сала үшін елеулі қоңырау. Регуляторлар бұған назар аударуы керек: ИИ биокауіпсіздігі мәселелеріндегі өзін-өзі реттеу әзірге қалағандай сенімді жұмыс істемейді.