Дәл он күннен кейін, 12 қыркүйекте, xAI көптен күткен Grok 4.7 моделін ұсынады. Илон Маск оның барлық қолданыстағы ИИ жүйелерінен артықшылығы туралы батыл мәлімдемелер жасап, амбицияларды тек архитектуралық өзгерістермен ғана емес, сонымен қатар ғарыш саласының деректеріне эксклюзивті қолжетімділікпен нығайтады.
Бұл анонс релиздер циклінің қарқынды жеделдеуі аясында ерекше қызықты көрінеді. Тек тамыз айында біз Grok 4.6 (12-сі күні) көрдік, ал шілдеде — Grok 4.5-тің алғашқы жария дебюті болды. Енді, бір айдан кейін ғана, бізді келесі итерация күтіп тұр. Сонымен қатар, OpenAI өз Astra моделін анонстап, ұйықтап жатқан жоқ, бұл бәсекелестік жарысты одан әрі қыздырады.
SpaceX деректері — басты козырь ретінде
Grok 4.7-нің алдыңғылардан басты айырмашылығы — тек ауқымында емес. Маск базалық оқыту аяқталғанын растады, қазір SpaceX-тің ішкі деректерінде қосымша оқытудың финалдық кезеңі жүріп жатыр. Бұл стратегиялық қадам модельге инженерлік және ғылыми міндеттерді шешуде бәсекелестерге қолжетімсіз бірегей артықшылық бере алады.
Архитектура да елеулі өзгерістерге ұшырады. Grok 4.7 — 2,1 триллион параметрмен жұмыс істейді, бұл Grok 4.6-дан (1,5 трлн) 40%-ға көп. Сонымен қатар, Масктың айтуынша, жаңа нұсқа біршама баяу жұмыс істейді, бірақ есептеу токендерін айтарлықтай тиімді жұмсайды — бұл жауап жылдамдығына емес, талдау тереңдігіне бағытталғандығын көрсететін ымыра.
«Grok 4.7 барлық қазіргі модельдерден асып түседі. Сонымен қатар, Anthropic — тамаша компания, олар жақын арада озық шешімдерді көрсетуі әбден мүмкін. SpaceX-тің бірегей оқыту деректерінің арқасында, нақты әлемдегі инженерлік міндеттер үшін кез келген басқа модель Grok 4.7-ден жақсырақ болады деп таң қалар едім», — деді Маск.
Бағдарлар мен бенчмарктердің шындығы
Мақсаттың қаншалықты амбициялы екенін түсіну үшін алдыңғының нәтижелеріне назар аударған жөн. Grok 4.6 AA Intelligence индексінде 61 ұпай жинап, GPT-5.6 Sol Max-пен теңесті, бірақ көшбасшыға — Claude Fable 5 Max-қа (62 ұпай) бір ұпай жоғалтты. GDPVal-AA v2 тестінде модель 1753 ұпай көрсетті, алайда Terminal-Bench v3.0-да нәтижелер қарапайым болды — OpenAI-дің бәсекелесіндегі 34,6%-ға қарсы небәрі 26%.
Бір қызығы, Grok 4.5 бұрын ұқсас динамиканы көрсеткен: AutomationBench-AA-да тапсырма үшін $0,34 құнымен 51,4% көшбасшылық етіп, ол қорғаныс шектеулерін жиі бұзған (Claude Opus 4.8-дегі 0,55-ке қарсы 0,63 бұзу). Бұл үрдіс xAI-дің қауіпсіздікке кейде зиян келтіріп, «шикі» қуатқа сүйенетінін көрсетеді.
Енді финалдық релиз күні расталғанда, басты сұрақ — xAI тәуелсіз тестілермен айтулы уәделерді растай ала ма, әлде біз маркетинг пен нақты көрсеткіштер арасындағы алшақтықты тағы да көреміз бе.
Менің көзқарасым: SpaceX-тің бірегей деректеріне сүйену — бәсекелестерге көшіру қиын шынымен де күшті қадам. Алайда шешуші фактор параметрлер саны емес, модельдің осы білімді нақты сценарийлерде тиімді қолдана алу қабілеті болады. Нарық «қағаз» рекордтардан шаршады — жауынгерлік жағдайда дәлелдер қажет.