Anthropic командасы өзінің флагмандық Claude моделінің биологиялық қауіпсіздік жүйесіндегі сыни олқылық туралы деректерді жариялады. Шамамен бір жылға созылған ақау шамамен 50 000 сыртқы мердігерге әсер етіп, жасанды интеллектпен шамамен 133 миллион өзара әрекеттесуді қамтыды. Бұл ақпарат менің индустриядағы қорғаныс механизмдерінің жай-күйі туралы жаңа аналитикалық есебімде келтірілген.
Жүйелік ақау: 11 ай блоктайтын классификаторларсыз
11 ай бойы — 2025 жылғы мамырдан 2026 жылғы сәуірге дейін — кері байланыс жинау платформалары арқылы өткен барлық трафик блоктайтын биологиялық классификаторларды іске қоспай өңделді. Бұл жүйелер модельді әлеуетті қауіпті химиялық немесе биологиялық мақсаттарда пайдалану әрекеттерін анықтауға және тоқтатуға арналған. Сыни қателік трафиктің ішкі жалаушамен белгіленуінде болды, ол бір уақытта сүзгілерді өшіріп, олардың іске қосылуын тіркеуді де тоқтатты.
Ең алаңдатарлық аспект — қатысушылардың көпшілігінің дайын жауаптарды бағалау ғана емес, модельдермен ашық диалогтар жүргізу мүмкіндігінің болуы. Бұл әлеуетті қауіпті сұраулардың тек блокталмай қана қоймай, кейінгі аудит жүйелерінің көзқарасынан толығымен тыс қалуын білдіреді. Сонымен қатар, есепте талаптар қатаңдатылғанға дейін көптеген мердігерлерде персоналды тексерудің сенімді процедуралары болмағаны мойындалады, бұл Red Team командаларына зиянкестердің енуіне мүмкіндік берді.
Тексеру ауқымы: 1197 транскрипт күдік астында
Қатені анықтағаннан кейін Anthropic деректер массивінің барлығын дерлік қалпына келтіре алды, жіберу түймесін баспағанда ақпарат сақталмайтын платформалардың біріндегі хат-хабарлардың 1%-ын қоспағанда. Барлық сұрауларды ретроспективті талдау үшін Claude Sonnet 5 моделі қолданылды, ол 1197 транскриптке жоғары тәуекел деңгейін берді.
Егжей-тегжейлі талдау олардың көпшілігінің (757) Anthropic-тің ішкі командаларына қатысты екенін көрсетті. Қалған 440 жағдайдың 378-і әдейі red teaming — қорғаныстың сенімділігін тексеру үшін оны бұзуға арналған мамандандырылған әрекеттер болды. Осылайша, тек 62 сыртқы диалог тестілеумен байланысты болмады. Бұл хат-хабарларды қолмен тексеру және 30 red-team-диалогының кездейсоқ іріктемесі зиянкестердің биологиялық қару жасау әлеуетін айтарлықтай арттыра алатын айқын қауіпті пайдалануды анықтаған жоқ.
Компания химиялық-биологиялық тәуекелдің айтарлықтай өсу ықтималдығын «өте екіталай» деп бағалағанына қарамастан, осындай ауқымды осалдықтың анықталу фактісі ресми бағаларды қайта қарауға мәжбүрледі. CB-1 сценарийі бойынша тәуекел деңгейі (ИИ көмегімен белгілі қауіптерді жасау) кейіннен «өте төменнен» «төменге» көтерілді. Жоғары ставкалы жағдайлардағы мисалаймент тәуекелін бағалауға да осындай түзету әсер етті.
Айта кету керек, есеп сонымен қатар Anthropic-тің өз ИИ жүйелеріне тәуелділік дәрежесін ашады: Claude қазірдің өзінде компанияның өндірістік кодының көп бөлігін жазады. Дегенмен, менің көзқарасым бойынша, бұл оқиға бүкіл индустрияның іргелі проблемасын көрсетеді: көп деңгейлі қорғанысы бар жетекші зертханалардың өзінде олар күдіктенбейтін инфрақұрылымдағы «соқыр аймақтар» болуы мүмкін. Бұл бүкіл нарық үшін елеулі қоңырау, ИИ қауіпсіздігі — бұл статикалық сүзгілер жиынтығы емес, өз болжамдарын үздіксіз аудиттеу және қайта қарау процесі екенін көрсетеді.