Z.ai GLM-5.3 шығарады: кодтау мен киберқауіпсіздіктегі серпіліс

Қытайлық Z.ai стартапы GLM-5.3 тілдік моделін ресми түрде ұсынды, бағдарламалау, агенттік сценарийлер және осалдықтарды іздеуді айтарлықтай жақсартуға бағытталған. Бұл жаңарту бағдарламалық қамтамасыз етуді әзірлеу мен киберқауіпсіздіктегі ИИ жүйелеріне қойылатын өсіп келе жатқан талаптарға жауап ретінде ұсынылуда.
Негізгі жақсартулар мен бенчмарктар
Z.ai компаниясы өнімділік өсімі тек пост-тренировка есебінен, базалық архитектураны өзгертпей-ақ қол жеткізілгенін атап өтеді, бұл релизді алдыңғы итерациялардан ерекшелендіреді. Ішкі Code Bench тестінде жаңа модель GLM-5.2-мен салыстырғанда 50% жақсарту көрсетті, бұл алгоритмдердің елеулі оңтайландырылғанын білдіреді.
Релиздік кестеде Z.ai бірқатар арнайы тесттер бойынша әсерлі нәтижелерді келтіреді:
- Terminal Bench 3.0: GLM-5.2-дегі 4,6 баллға қарсы 28,3 балл — алты есеге жуық өсім.
- DeepSWE v1.1: 46,2-ге қарсы 66,9 — әзірлеу міндеттерін шешудегі айтарлықтай секіріс.
- Agents' Last Exam: 23,8-ге қарсы 28,5 — агенттік қабілеттердің жақсаруы.
- CyberGym: 77,2%-ға қарсы 84,5% — киберортадағы тиімділіктің артуы.
- ExploitBench: 24,4%-ға қарсы 54,4% — эксплойт іздеудегі нәтиженің екі еселенуі.
Әсіресе ExploitGym ерекшеленеді: модель екі сағаттық бюджетте алдыңғысындағы 29-ға қарсы 105 тапсырманы жапты, ал алты сағаттық бюджетте — 39-ға қарсы 130. Бұл жылдамдықты ғана емес, талдау тереңдігін де көрсетеді.
Практикалық қолдану және қауіпсіздік
Z.ai сонымен қатар Қытайдағы қауіпсіздік командаларымен бірге нақты кодтық базаларда тестілеу жүргізді. Тексеру мен дедупликациядан кейін жүйе 269 жобада 2436 осалдықты анықтады, оның ішінде 1097 орташа және жоғары критикалдық мәселелер. Тек 53 табылған нәтиже жария түрде ашылды, қалған 2383 эмбарго астында қалады. Бұл осалдықтардың орташа «өмір сүру мерзімі» 26,6 жыл деп бағаланады, ал ең көнесі 1981 жылға тиесілі — бұл legacy-код мәселесінің ауқымын көрсетеді.
Ашықтық үшін Z.ai Security Disclosure Ledger іске қосылды — мәртебені, зардап шеккен жобаларды және табылған нәтижелердің критикалдығын бақылайтын жария тізілім. Бұл ашықтық жиі жетіспейтін индустрия үшін маңызды қадам.
Өнімдік интеграция
GLM-5.3 GLM Coding Plan жазылушылары үшін орналастырылды, агенттік бағдарламалау мен ұзақ мерзімді тапсырмалардың негізгі қозғалтқышына айналды. Ескі модельдерге жіберілген сұраулар автоматты түрде жаңаға бағытталады, бұл пайдаланушылар үшін миграцияны жеңілдетеді. Ашық салмақтар қауіпсіздікті бағалау мен харденингтен кейін екі аптадан соң пайда болады.
Еске салайын, шілдеде Anthropic Z.ai компаниясын GLM-5.2-ні Claude және GPT жауаптарында рұқсатсыз дистилляция жасады деп айыптаған болатын, бұл осы амбициялық релизге контекст қосады.
Менің талдауым: GLM-5.3 — бұл жай инкрементальды жаңарту емес, нишалық, бірақ критикалық маңызды салалардағы мақсатты серпін. ExploitBench пен CyberGym-нің екі есе жақсаруы Z.ai-дің қауіпсіздікке байыпты инвестиция салып жатқанын көрсетеді, бұл кодты қорғауға арналған ИИ құралдарына жаһандық сұраныс аясында негізгі бәсекелестік артықшылыққа айналуы мүмкін. Дегенмен, этика мен технологиялардың шығу тегі мәселелері ашық күйінде қалады және бұл модельдің Батыста қабылдануын тежеуі мүмкін.