Крипто әлеміндегі жаңалықтар

17.08.2026
09:58

Антропик Клодтың биологиялық қорғанысындағы ауқымды ақауды мойындады: 133 млн диалог сүзгілерсіз қалды

ii-startap-Anthropic-AI

Anthropic әзірлеушілері өздерінің Claude модельдерінің биологиялық қауіпсіздік жүйесіндегі маңызды оқиғаны ашты. Шамамен бір жылға созылған ақау шамамен 50 000 сыртқы мердігерден тұратын пулға және ИИ-мен шамамен 133 млн өзара әрекеттесуге әсер етті. Бұл ақпарат компания жариялаған жаңа Risk Report-та негізгі болды.

Жүйелік ақау: 11 ай блокаторлық классификаторларсыз

11 ай бойы — 2025 жылғы мамырдан 2026 жылғы сәуірге дейін — үшінші тарап мамандары модельдермен жұмыс істеген платформалардың барлық трафигі блокаторлық биологиялық классификаторларды іске қоспай өңделді. Бұл жүйелер химия және биология саласындағы әлеуетті қауіпті сұраныстарды ұстауға арналған. Анықталғандай, трафик ішкі жалаушамен өтті, ол бір уақытта блоктауды да, қорғаныс механизмдерінің іске қосылуын тіркеуді де өшірді.

Бұл әлеуетті зиянды өтініштер тек қабылданбай қана қоймай, кейінгі аудит жүйесіне де түспейтінін білдіреді. Сонымен қатар, компания мердігерлердегі қолжетімділікті бақылаудың әлсіздігін мойындады: талаптарды қатайтқанға дейін көптеген жеткізушілерде персоналды тексерудің сенімді рәсімдері болмады, бұл Red Team командаларына енуге мүмкіндік берді.

Тексеру ауқымы: 1197 күдікті диалог

Қатені анықтағаннан кейін Anthropic хат алмасу деректерінің барлығын дерлік қалпына келтірді, тек бір платформадағы трафиктің 1%-ы ғана сақталмады, онда жіберу түймесін баспайынша ақпарат сақталмады. Массивтерді талдау үшін компания Claude Sonnet 5 моделін қолданды, ол жоғары қауіп деңгейі бар 1197 транскриптті анықтады.

Бөлу көрсеткіштік болды: 757 диалог Anthropic-тің ішкі командаларына тиесілі болды, ал 378-і әдейі red teaming — мамандардың модельді қауіпті жауаптарға итермелеу әрекеттері болды. Нәтижесінде тек 62 сыртқы хат алмасу тестілеуге қатысты емес. Бұл жағдайларды қолмен тексеру және red-team-диалогтарынан кездейсоқ іріктеу зиянкестің биологиялық қару жасау қабілетін айтарлықтай арттыра алатын айқын қауіпті қолдануды анықтаған жоқ.

Тәуекелді бағалауды қайта қарау және өз ИИ-іне тәуелділік

Бұл оқиға Anthropic-ті CB-1 сценарийі (белгілі биоқауіптерді жасау үшін ИИ қолдану) бойынша тәуекелді бағалауды «өте төменнен» «төменге» дейін ретроспективті түрде қайта қарауға мәжбүрледі. Компания апатты залалдың ағымдағы тәуекел деңгейін «төмен, бірақ елеусіз емес» деп сипаттайды. Сондай-ақ, жоғары ставкалы жағдайларда мисалаймент тәуекелін бағалау көтерілді.

Айта кету керек, есеп сонымен қатар Anthropic-тің өз модельдеріне терең тәуелділігін ашады: Claude компанияның өндірістік репозиторийлеріне қабылданатын кодтың көп бөлігін жазады. Бұл әзірлемені жылдамдатады, бірақ әзірге екі еседен аз.

Менің пікірім: Бұл жағдай — тіпті ИИ қауіпсіздігі саласының көшбасшыларында да «соқыр аймақтар» бар екенінің жарқын мысалы. Ақаудың шамамен бір жылға созылып, тек ретроспективті түрде анықталуы мониторинг жүйелерінің сенімділігі туралы маңызды сұрақтар туғызады. Нарық үшін бұл сигнал: қорғаныс контурларының аудиті үздіксіз және көп деңгейлі болуы керек, бір реттік тексерулерге сүйенбеу керек. Инвесторлар мен пайдаланушылар компаниялардың өз платформаларының қауіпсіздігі туралы сендірулеріне мұқият қарауы тиіс.