Z.ai GLM-5.3-ті ұсынады: агенттік бағдарламалау мен киберқауіпсіздіктегі серпіліс

Қытайлық технологиялық стартап Z.ai өзінің жаңа GLM-5.3 тілдік моделінің шығуын ресми түрде жариялады. Бұл жаңарту бағдарламалау, агенттік сценарийлер және осалдықтарды іздеу саласындағы маңызды қадамды білдіреді, компанияның ИИ-шешімдер нарығындағы позициясын нығайтады.
Архитектураны өзгертпей эволюция
Релиздің басты ерекшелігі — базалық архитектураны өзгертпей, тек пост-тренинг арқылы қол жеткізілген өнімділіктің әсерлі өсімі. Алдыңғы GLM-5.2 нұсқасымен салыстырғанда, жаңа модель ішкі Code Bench бенчмаркінде жақсартылған нәтижелерді көрсетіп, 50%-ға өсті. Бұл оқыту алгоритмдерін оңтайландырудың жоғары әлеуетін көрсетеді.
Тесттердің әсерлі нәтижелері
Z.ai релиздік кестесінде бірқатар негізгі бенчмарктер бойынша сенімді сандар ұсынылған:
- Terminal Bench 3.0 — алдыңғы нұсқадағы 4,6-ға қарсы 28,3 балл;
- DeepSWE v1.1 — 46,2-ге қарсы 66,9;
- Agents' Last Exam — 23,8-ге қарсы 28,5;
- CyberGym — 77,2%-ға қарсы 84,5%;
- ExploitBench — 24,4%-ға қарсы 54,4%.
ExploitGym ерекше назар аударуға тұрарлық: модель екі сағаттық бюджет ішінде 105 тапсырманы орындады, ал GLM-5.2 тек 29-ға ғана шыдай алды. Бюджетті алты сағатқа дейін ұлғайтқанда көрсеткіш алдыңғы нұсқадағы 39-ға қарсы 130 тапсырмаға дейін өсті. Бұл автономды осалдықтарды іздеудегі елеулі прогресті көрсетеді.
Практикалық қолдану және қауіпсіздік
Z.ai Қытайдағы бірнеше қауіпсіздік командаларымен бірлесіп, нақты кодтық базаларда ауқымды тестілеу жүргізді. Тексеру мен дедупликациядан кейін жүйе 269 жобада 2436 осалдықты анықтады, оның ішінде 1097 орташа және жоғары критикалдық мәселелер бар. 53 табылған нәтиже жария етілді, қалған 2383 эмбарго астында қалады. Мұндай осалдықтардың орташа «өмір сүру ұзақтығы» 26,6 жыл деп бағаланады, ал ең көнесі 1981 жылға жатады.
Процестің ашықтығы үшін компания Z.ai Security Disclosure Ledger — табылған нәтижелердің мәртебесі мен критикалдығын бақылайтын жария тізілімді іске қосты. Сонымен қатар, GLM-5.3 GLM Coding Plan жазылушылары үшін орналастырылып, агенттік бағдарламалау мен «ұзақ» тапсырмалардың негізгі қозғалтқышына айналды. Ашық салмақтар қауіпсіздікті бағалаудан екі апта өткен соң жарияланады.
Менің аналитикалық көзқарасым: Z.ai әсерлі динамиканы көрсетуде, әсіресе GLM-5.3 нәтижелері революциялық болып көрінетін киберқауіпсіздік саласында. Дегенмен, компания бұрын технологияларды рұқсатсыз дистилляциялау туралы айыптауларға ұшырағанын ескеру қажет, бұл нарықтың сеніміне әсер етуі мүмкін. Соған қарамастан, егер модель тәуелсіз тесттерде мәлімделген сипаттамаларды растаса, бұл батыс бәсекелестері үшін елеулі сын-қатерге айналуы мүмкін.