Дәл он күннен кейін, 12 қыркүйекте, xAI жұртшылыққа Grok 4.7-ні ұсынады. Илон Маск дүркіреп мәлімдейді: жаңа модель жай ғана алға қадам емес, нақты мағынада нарықтағы барлық ИИ шешімдерін «басып озады».

Бұл релиз екі ай ішіндегі үшінші ірі жаңарту болады. Салыстыру үшін: Grok 4.6 12 тамызда дебют жасады, ал Grok 4.5-ке қоғамдық қолжетімділік тек шілдеде ашылды. Мұндай қарқын xAI инженерлерінің агрессивті итеративті даму режиміне көшкенін көрсетеді, қарулану жарысында көшбасшылықты иеленуге тырысуда.

Құпия қару: 2,1 триллион параметр және SpaceX деректері

Grok 4.7-нің басты айырмашылығы — архитектурасы мен бірегей оқыту корпусы. Маск базалық оқыту аяқталғанын растады, қазір команда модельге SpaceX-тің ішкі деректерін интеграциялауда. Бұл жай маркетингтік қадам емес, нақты бәсекелестік артықшылық: инженерлік телеметрияға, ұшыру деректеріне және физикалық процестердің симуляцияларына қолжетімділік модельге бәсекелестерде жоқ бірегей эмпирикалық база береді.

Параметрлік сыйымдылық 2,1 триллионға дейін өсті, бұл алдыңғы нұсқадан (1,5 трлн) 40%-ға көп. Сонымен қатар Маск жаңа нұсқаның біршама баяу жұмыс істейтінін, бірақ токендерді айтарлықтай үнемдейтінін атап өтеді. Бұл саналы ымыра: ставка ойлау тереңдігі мен жауап сапасына қойылады, генерация жылдамдығына емес.

Маск өз мәлімдемесінде Anthropic-ті де атап, оларды «тамаша компания» деп атады және олардың жақында озық шешімдер көрсететініне сенім білдірді. Алайда ол нақты инженерлік тапсырмаларда кез келген басқа модель Grok 4.7-ден асып түссе, қатты таңғалатынын қосты.

Бенчмарктар: амбицияларға негіз бар ма?

Тесттермен жағдай екіұшты. Алдыңғы нұсқа, Grok 4.6, аралас нәтижелер көрсетті. AA Intelligence индексінде ол 61 балл жинап, GPT-5.6 Sol Max-пен теңесті, бірақ Claude Fable 5 Max-қа (62) бір балл жоғалтты. GDPVal-AA v2 тестінде нәтиже әсерлі — 1753 балл, алайда Terminal-Bench v3.0-да модель сәтсіздікке ұшырап, OpenAI бәсекелесінің 34,6%-ына қарсы небәрі 26% көрсетті.

Қызығы, Grok 4.5 бұрын ұқсас динамиканы көрсеткен: мамандандырылған тесттерде көшбасшылық (AutomationBench-AA — 51,4%, тапсырмаға $0,34 құнымен) қорғаныс шектеулерін сақтаудағы проблемалармен қатар жүрді (тапсырмаға 0,63 бұзушылық, Claude Opus 4.8-де 0,55-ке қарсы).

Енді Маск релиздің нақты күнін атады. Дүркіреген уәделер тәжірибеде растала ма, жоқ па, xAI-дің тәуелсіз тестілеу нәтижелерін жариялауына байланысты. Нарық сөзді емес, сандарды күтеді.

Менің талдауым: SpaceX-тің меншікті деректерін пайдалану — бұл шынымен ақылды қадам, ол модельге физика мен инженерияда бірегей құзыреттілік бере алады. Алайда стандартты жалпы мақсаттағы бенчмарктарда бұл артықшылық ойнамауы мүмкін. Нақты шайқас практикалық қолдануға арналған ниша тесттерінде өрбиді, мұнда модельдің «өмірлік тәжірибесі» шикі есептеу қуатынан маңыздырақ болады.