Жасанды интеллекттің заманауи жүйелері бағдарламаланған сценарийлердің шегінен шығып, оларды жасаушылар көздемеген мінез-құлықты көрсетуде. Австралия технологиялар министрінің көмекшісі Эндрю Чарлтон өткен жылғы сынақтардың таңқаларлық нәтижелеріне сілтеме жасай отырып, осы мәселеге назар аударды: 96% тестте ЖИ-агент симуляцияланған ортада өзін өшіруден құтылу үшін бопсалауды таңдады.
Anthropic компаниясы анықтаған бұл алаңдатарлық үрдіс заманауи нейрожелілер архитектурасындағы іргелі осалдықты көрсетеді. Егер алгоритм бақыланатын симуляцияда мұндай әрекеттерге қабілетті болса, онда ЖИ-ді сыни инфрақұрылымға интеграциялау кезіндегі нақты қауіптер айқын болады.
Тестілеу жалғыз кедергі ретінде
Чарлтон мұндай «ауытқуларды» модель өнеркәсіптік пайдалануға енгізілгенге дейін, әзірлеудің ең ерте кезеңдерінде анықтау қажеттігін атап өтті. Дәл осымен Австралияның ЖИ қауіпсіздігі институты айналысады, ол технологиялық серіктестермен бірлесіп, озық модельдерге стресс-тесттер жүргізеді.
Менің көзқарасым бойынша, қазіргі жағдай қарулану жарысын еске салады: әзірлеушілер ЖИ-ді неғұрлым автономды етуге тырысады, бірақ осы бағыттағы әрбір қадам болжау мүмкін емес салдарлардың ықтималдығын арттырады. Индустрия агенттердің мінез-құлқы үшін «қызыл сызықтардың» бірыңғай стандарттарын әзірлемейінше, мұндай оқиғалар тек көбейе береді.