SpaceXAI компаниясы Grok 4.5 — бағдарламалауға, агенттермен жұмыс істеуге және күрделі интеллектуалды міндеттерді шешуге бағытталған жаңа флагмандық моделін ресми түрде іске қосты. Баспасөз релизінде бұл модель компания портфеліндегі «ең күшті жүйе» деп аталды. Дегенмен, негізгі назар бенчмарктардағы абсолютті артықшылыққа емес, баға, жылдамдық және тиімділік тепе-теңдігіне аударылған.

Grok 4.5 API арқылы қолжетімді, сонымен қатар барлық тарифтік жоспарларда Grok Build және Cursor платформаларына енгізілген. Еуропалық Одақ қолданушылары әзірге шетте қалып отыр — аймақта іске қосу шілде айының ортасында күтілуде.

Баға белгілеу басты козырь ретінде

SpaceXAI Grok 4.5-ті 1 миллион кіріс токені үшін $2 және 1 миллион шығыс токені үшін $6 бағасымен ұсынады. Бұл тікелей бәсекелестерден айтарлықтай арзан. Салыстыру үшін: Anthropic компаниясының Claude Opus 4.8 моделі $5 және $25 тұрады, Claude Fable 5 — $10 және $50, ал OpenAI компаниясының GPT-5.6 Sol — $5 және $30. Тіпті OpenAI-дің өз желісінде Luna моделі кіріс токендері үшін $1, бірақ шығыс токендері үшін $6 ұсынылады, бұл Grok 4.5-пен салыстыруға келеді.

Илон Маск жаңалықты «Opus класындағы модель, бірақ жылдамырақ, арзанырақ және токендер бойынша тиімдірек» деп сипаттады. Оның айтуынша, SpaceXAI-дің ішкі сынақтары Grok 4.5 «шамамен Opus 4.7-мен салыстыруға келеді, бірақ әлдеқайда жылдам» екенін көрсетеді.

Бенчмарк нәтижелері: біркелкі емес, бірақ перспективалы

SpaceXAI жариялаған деректер аралас көріністі көрсетеді. DeepSWE 1.0 тестінде Grok 4.5 62% жинап, Fable (66,1%) және GPT-5.5-тен (64,31%) қалып қойды, бірақ Claude Opus 4.8-ден (55,75%) және Opus 4.7-ден (40,12%) озып шықты. Жаңа DeepSWE 1.1 бенчмаркі 53% нәтиже көрсетті — бұл Opus 4.8-ден (59%), GPT-5.5-тен (67%) және Fable-ден (70%) төмен.

SWE Bench Pro тестінде модель 64,7% көрсетті, бұл GPT-5.5-тен (58,6%) жоғары және Opus 4.7-мен (64,3%) шамамен бір деңгейде, бірақ Opus 4.8-ден (69,2%) және Fable-ден (80,4%) төмен. Terminal Bench 2.1 тестінде Grok 4.5 83,3% көрсетті — бұл GPT-5.5-пен (83,4%) дерлік бірдей және Fable-ден (84,3%) сәл төмен. Ал SWE Marathon тестінде модель 29% көрсеткішпен бірінші орынды иеленіп, Opus 4.8-ден (26%) және Fable-ден (24%) озып шықты. Сондай-ақ Harvey's Legal Agent Benchmark тестінде көшбасшылық мәлімделген.

Токендер экономикасы: SpaceXAI шынымен қайда ұтады

Grok 4.5 пайдасына ең күшті дәлел — шикі ұпайлар емес, токендерді пайдалану тиімділігі. SWE Bench Pro міндеттерінде модель бір тапсырмаға орта есеппен 15 954 шығыс токенін жұмсады. Claude Opus 4.8 үшін бұл көрсеткіш 67 020 токенді құрады — бұл 4,2 есе көп. Токен бағасы төмен болғандықтан, бұл көп итерациялы сценарийлер үшін түпкілікті құнның түбегейлі төмендеуін білдіреді: қателерді түзету, түзетулерді генерациялау, кодты тексеру және агенттік циклдар.

SpaceXAI сонымен қатар секундына шамамен 80 токен генерация жылдамдығын және 500 000 токенге контекстік терезені мәлімдейді. Модель сапа, жылдамдық және құн арасындағы ымыра ретінде ұсынылған — бұл ауқымды өнеркәсіптік енгізулер үшін қажет нәрсе.

Cursor-мен байланыс және стратегиялық контекст

Айта кетерлігі, Grok 4.5 SpaceX жақында $60 млрд-қа сатып алуға келіскен Cursor AI-сервисімен тығыз ынтымақтастықта оқытылды. Оқытуда Cursor әзірлеушілерінің сессия деректері, соның ішінде жөндеу трассировкалары және нақты код түзетулері пайдаланылды, тек статикалық репозиторийлер ғана емес. Бұл модельдің практикалық бағдарламалау міндеттеріне күшті бағытталғанын түсіндіреді.

Grok 4.5-ті оқыту үшін компания ондаған мың Nvidia GB300 GPU-ды пайдаланды. Модель Илон Масктың AI-бағыты SpaceX-пен біріккеннен кейінгі алғашқы ірі модельдердің бірі болды.

Менің сараптамалық көзқарасым: SpaceXAI барлық тесттерде ең жақсы болуға емес, нақты пайдалану сценарийлерінде ең экономикалық тиімді болуға бәс тігеді. Инференс шығындары AI-ді масштабтау үшін маңызды факторға айналған дәуірде, мұндай тәсіл бенчмарктардағы абстрактілі рекордтарды қуудан гөрі тиімдірек болуы мүмкін. Егер Grok 4.5 шынымен 4 есе аз токен шығынымен салыстырмалы сапаны қамтамасыз етсе, бұл enterprise-сектор үшін AI-модельдер нарығын түбегейлі өзгертуі мүмкін.