Крипто әлеміндегі жаңалықтар

17.08.2026
10:39

Anthropic биозақтаудың ауқымды ақаулығын мойындады: 133 млн ИИ-диалогтары сүзгілерсіз қалды

ii-startap-Anthropic-AI

Anthropic әзірлеушілері өздерінің қауіпсіздік инфрақұрылымындағы алаңдатарлық бөлшекті ашты: шамамен бір жыл бойы Claude биологиялық қорғаныс жүйесі пайдаланушы трафигінің едәуір сегментіне қатысты іс жүзінде әрекетсіз болды. Мәселе шамамен 50 000 сыртқы мердігерлер пулы мен орасан зор көлемге — модельдермен 133 миллионнан астам өзара әрекеттесуге қатысты. Бұл ақпарат менің 2026 жылғы тамызда жарияланған жаңа аналитикалық тәуекел есебімде қамтылған.

11 айға созылған жүйелік ақау

Мәселенің мәні мынада: 2025 жылғы мамырдан 2026 жылғы сәуірге дейін блоктайтын биологиялық классификаторлар кері байланыс жинау платформаларының трафигіне қолданылмады. Осы инфрақұрылым арқылы сыртқы мердігерлер тек жауаптарды бағалап қана қоймай, модельдермен ашық диалогтар жүргізді. Анықталғандай, бұл трафиктің бәрі қауіпті сұраныстарды блоктауды да, олардың іске қосылуын тіркеуді де бір мезгілде өшіретін ішкі жалаушамен белгіленген.

Бұл әлеуетті қауіпті өтініштердің жай ғана блокталмағанын ғана емес, олардың кейінгі мониторинг жүйелерінен толығымен тыс қалғанын білдіреді. Сонымен қатар, компания мердігерлердегі қолжетімділікті бақылаудың әлсіздігін мойындады: 2026 жылғы сәуірге дейін көптеген жеткізушілердегі персоналды тексеру процедуралары әлеуетті зұлымдарды сенімді түрде сүзіп тастауға мүмкіндік бермеді. Бағалау бойынша, Red Team командасына ену тым күрделі міндет болмас еді.

Аудит тек 62 күдікті диалогты анықтады

Қатені анықтағаннан кейін Anthropic хат-хабарлардың барлық дерлік массивін қалпына келтірді, жіберу түймесін баспайынша хабарламалар сақталмайтын бір платформадағы ~1% деректерді қоспағанда. Барлық сұраныстарды талдау үшін Claude Sonnet 5 моделі қолданылды, ол 1197 транскриптке жоғары биологиялық тәуекел деңгейін берді. Олардың 757-сі Anthropic-тің ішкі командаларына, ал 378-і әдейі red teaming-ке қатысты болды. Осылайша, тек 62 сыртқы диалог тестілеумен байланысты болмады.

Бұл жағдайларды қолмен тексеру және 30 red-team-диалогынан іріктеу зұлымның биологиялық қару жасау мүмкіндіктерін айтарлықтай арттыра алатын айқын қауіпті пайдалануды анықтаған жоқ. Осыған қарамастан, компания бұл оқиға қорғаныстағы басқа белгісіз олқылықтардың жоқтығына деген сенімділікті төмендететінін мойындады.

Тәуекел бағаларын қайта қарау және өз ИИ-іне тәуелділік

Бұл жағдай Anthropic-тің ресми ұстанымына тікелей әсер етті. CB-1 сценарийі бойынша тәуекел деңгейі (белгілі биоқауіптерді жасауда ИИ-дің елеулі көмегі) кейіннен «өте төменнен» «төменге» қайта қаралды. Қазіргі апатты залал тәуекелінің деңгейі «төмен, бірақ елеусіз емес» деп сипатталады. Сол сияқты жоғары ставкалы жағдайлардағы мисалаймент тәуекелінің бағасы да көтерілді.

Есеп сонымен қатар компанияның өз модельдеріне тәуелділігінің таңғаларлық дәрежесін ашады. Claude Anthropic өндірістік кодының көп бөлігін жазады, ал ішкі зерттеулер Mythos 5 және Model 2 негізіндегі агенттерді белсенді пайдаланады. Бұл қызықты парадокс тудырады: ИИ тәуекелдерін бағалайтын компания бір мезгілде оның ең белсенді корпоративтік тұтынушысы болып табылады.

Менің пікірім: Бұл жағдай — ИИ қауіпсіздігі саласындағы көшбасшыларда да «соқыр аймақтар» болатынының жарқын мысалы. Қатенің нақты оқиғаларға әкелмеуі — еңбегінен гөрі сәттілік. Инвесторлар мен реттеушілер мұны сигнал ретінде қабылдауы керек: қорғаныс жүйелерінің аудиті ретроспективті емес, үздіксіз болуы тиіс. Anthropic-тің бұл мәселедегі ашықтығы құрметке лайық, бірақ ол ИИ-дің қарқынды масштабталу дәуірінде биологиялық қауіпсіздіктің қаншалықты нәзік болуы мүмкін екенін де көрсетеді.