SpaceXAI ресми түрде Grok 4.5 — бағдарламалауға, агенттік тапсырмаларға және интеллектуалды жұмысқа бағытталған жаңа тілдік модельді ұсынды. Компания оны бүгінгі күндегі ең қуатты жүйесі ретінде позициялайды. Модель API, Grok Build және Cursor әзірлеу ортасында барлық тарифтік жоспарларда қолжетімді. Еуропалық Одақ пайдаланушылары әзірге оған қол жеткізе алмайды — онда іске қосу шілде айының ортасына жоспарланған.
Әзірлеушілердің мәлімдеуінше, Grok 4.5-тің басты артықшылығы — өнімділікті агрессивті баға саясатымен үйлестіру. Модельдің құны 1 млн кіріс токені үшін $2 және 1 млн шығыс токені үшін $6 құрайды. Салыстыру үшін: Anthropic компаниясының Claude Opus 4.8 моделі $5 және $25, Claude Fable 5 — $10 және $50, ал OpenAI флагманы GPT-5.6 Sol — $5 және $30 тұрады. Сол GPT-5.6 Luna желісінде одан да төмен баға ұсынылған — кіріс үшін $1 және шығыс үшін $6, бірақ ол шектеулі превью режимінде. Бұл Grok 4.5-ті өз класындағы ең қолжетімді шешімдердің біріне айналдырады.
Илон Маск жаңалықты «Opus класындағы, бірақ айтарлықтай жылдамырақ, арзанырақ және токендер бойынша тиімдірек» модель ретінде сипаттады. Оның айтуынша, SpaceXAI ішкі сынақтары Grok 4.5 «шамамен Opus 4.7-мен салыстыруға келеді, бірақ әлдеқайда жылдам» екенін көрсетеді.
Бенчмарк нәтижелері: біркелкі емес, бірақ бәсекеге қабілетті
SpaceXAI жариялаған бенчмарк деректері аралас көріністі береді. DeepSWE 1.0 бойынша модель 62% жинап, Fable (66,1%) және GPT-5.5 (64,31%) көрсеткіштерінен төмен болды, бірақ Claude Opus 4.8 (55,75%) және Opus 4.7 (40,12%) көрсеткіштерінен асып түсті. Күрделірек DeepSWE 1.1 бойынша нәтиже төмен болды — Opus 4.8-дегі 59% және Fable-дегі 70% қарсы 53%. SWE Bench Pro бойынша Grok 4.5 64,7% көрсетті, бұл GPT-5.5 (58,6%) көрсеткішінен жоғары және Opus 4.7 (64,3%) деңгейінде, бірақ Opus 4.8 (69,2%) және Fable (80,4%) көрсеткіштерінен төмен.
Дегенмен, кейбір сынақтарда модель өзін күштірек көрсетті. Terminal Bench 2.1 бойынша ол 83,3% жинап, GPT-5.5 (83,4%) көрсеткішімен теңесіп, Fable (84,3%) көрсеткішінен сәл ғана қалып қойды. SWE Marathon бойынша Grok 4.5 29% көрсеткішімен бірінші орынды иеленіп, Opus 4.8 (26%) және Fable (24%) көрсеткіштерінен озып шықты. Компания сонымен қатар Harvey's Legal Agent Benchmark, заңгерлік агенттік тапсырмаларына арналған тест бойынша көшбасшылықты мәлімдеді.
Экономика — басты козырь
Grok 4.5 пайдасына ең күшті дәлел шың өнімділігі саласында емес, экономикада жатыр. SpaceXAI SWE Bench Pro тапсырмаларында модель бір тапсырмаға орта есеппен 15 954 шығыс токенін пайдаланатынын, ал Claude Opus 4.8 — 67 020 токенді, яғни 4,2 есе көп екенін келтіреді. Токен бағасы айтарлықтай төмен болғандықтан, бұл Grok 4.5-ті көп итерациясы бар сценарийлер үшін өте тиімді етеді: қателерді түзету, түзетулерді генерациялау, кодты тексеру және агенттік циклдар.
Қосымша секундына шамамен 80 токен генерациялау жылдамдығы және 500 000 токенге контекстік терезе жарияланған. SpaceXAI модельді сапа, жылдамдық және құн арасындағы оңтайлы ымыра ретінде позициялайды.
Cursor-мен байланыс және стратегиялық контекст
Айта кету керек, Grok 4.5 SpaceX жақында $60 млрд-қа сатып алуға келіскен Cursor AI-қызметімен бірлесіп оқытылды. Мәміле А класындағы акциялармен жүргізіледі және 2026 жылдың III тоқсанында жабылуы күтілуде. Модельді оқыту үшін Cursor әзірлеушілерінің нақты сессияларының деректері, соның ішінде жөндеу трассировкалары мен код түзетулері пайдаланылды, бұл оған бағдарламалаудың практикалық міндеттерін түсінуде бірегей артықшылық береді. Жаттығу үшін ондаған мың Nvidia GB300 GPU пайдаланылды.
Бұл релиз — Илон Масктың AI-бағытын SpaceX-пен біріктіргеннен кейінгі алғашқы ірі бастамалардың бірі. Grok 4.5 барлық сынақтарда сөзсіз көшбасшы болуға тырыспайды, бірақ прагматикалық тәсілді ұсынады: enterprise-қосымшалар экономикасын түбегейлі өзгерте алатын бағамен жеткілікті жоғары сапа. Инференс шығындары AI-ді масштабтаудағы басты кедергіге айналған әлемде мұндай тәсіл ақылға қонымды ғана емес, сонымен қатар әлеуетті үстемдік етуші болып көрінеді.