ЖИ-агенттер нарығы жаңа көшбасшыға ие болды. SpaceXAI компаниясының Grok 4.5 моделі тәуелсіз AutomationBench-AA бенчмаркінде Anthropic флагмандары — Claude Fable 5 және Claude Opus 4.8-ден озып қана қоймай, экономикалық тиімділік бойынша да орасан зор айырмашылықпен алға шықты. Бұл жай ғана сынақтағы жеңіс емес, бұл парадигманың өзгеруі.

1,5 триллион параметрі бар V9 архитектурасында құрылған Grok 4.5 Artificial Analysis компаниясының AutomationBench-AA бенчмаркінде 51,4% нәтиже көрсетті. Салыстыру үшін, Claude Fable 5 — 48,6%, ал Claude Opus 4.8 — 48,5%. Дегенмен, негізгі көрсеткіш — тек дәлдік емес, сонымен қатар құны.

Grok 4.5 тапсырманы $0,34-ке орындайды, ал Fable 5 $1,35, ал Opus 4.8 $1,46 тұрады. Баға бойынша ең жақын бәсекелес Gemini 3.5 Flash тапсырма үшін $0,49 тұрады. Мұндай төмен құн түбегейлі тиімділік есебінен қол жеткізіледі: Grok 4.5 тапсырмаға шамамен 8000 шығыс токенін пайдаланады — бұл Opus 4.8 тұтынатын ресурстардың небәрі 25%-ы. Токендердің жалпы тұтынуы — тапсырмаға 0,44 млн — нарықтағы ең төмен көрсеткіштердің бірі.

Қаржы секторы: Grok 4.5 шынымен жарқыраған жер

Модельдің сынақтағы ең күрделі санат — қаржы санатындағы нәтижесі ең көрнекті болып табылады. Grok 4.5 71% жинап, Fable 5 (64%) және Opus 4.8 (62%) артта қалдырды. Қаржы процестерін автоматтандыратын компаниялар үшін бұл айырмашылық өте маңызды. Қаржы агентіндегі қате тікелей шығынға әкелуі мүмкін, және мұнда Grok айқын артықшылығын көрсетеді.

Дегенмен, бір нюанс бар: Grok 4.5 тапсырмаға орта есеппен 0,63 рет ережені бұзады, бұл Opus 4.8 (0,55) және Gemini 3.5 Flash (0,46) көрсеткіштерінен жоғары. Бұл жылдамдық пен құнды агрессивті оңтайландыру үшін төлем. Өндірістік орталарда агенттерді іске қосатын бизнес үшін бұл фактор ерекше назар аударуды және қосымша валидация қабаттарын қажет етеді.

Сынақ Gmail, Slack, Salesforce және HubSpot қоса алғанда, 40 симуляцияланған қосымшадағы 657 тапсырманы қамтиды. Қорытынды балл агенттің белгіленген ережелерді бұзбай орындаған тапсырмалар үлесін көрсетеді. Artificial Analysis тапсырмалар тізімін құпияда ұстайды, бұл нәтижелердің объективтілігін қамтамасыз етеді және модельдерді «жаттықтыруды» болдырмайды.

Менің кәсіби көзқарасым: Grok 4.5 ЖИ-агенттер нарығына жаңа стандарт белгілейді. Жоғары дәлдік пен түбегейлі төмен құнның үйлесімі — бұл агенттерді бизнес-процестерге жаппай енгізу үшін дәл қажет нәрсе. Қаржы секторындағы жеңіс — бүкіл FinTech үшін сигнал. Егер Anthropic және Google бағаны тиісті түрде төмендетпесе, Grok-тің корпоративтік нарықтағы үлесі экспоненциалды түрде өседі.