Жасанды интеллект индустриясында тыныш революция пісіп жетілуде: біз модельдер арасындағы қарым-қатынас әрқашан мәтін генерациясы деп есептеуге дағдыланғанбыз. Алайда Mostik жобасының әзірлеушілер тобы түбегейлі басқа тәсілді ұсынды, ол нейрожелілерге тілдік рәсімдеу кезеңін айналып өтіп, «ойлармен» тікелей алмасуға мүмкіндік береді.
Әдістің мәні арнайы бейімделгіш модульді — «көпірді» қолдануда. Бұл компонент бір модельдің ішкі векторлық көрінісін екіншісі түсіндіре алатын форматқа аударады, ақпаратты сөздерге түрлендіру қажеттілігінсіз. Өте маңыздысы, мұндай өзара әрекеттесу кезінде нейрожелілердің өз параметрлері өзгеріссіз қалады — тек байланыстырушы элемент түзетіледі.
Бұл неге маңызды? Сарапшылардың бағалауы бойынша, тіпті бір токенді генерациялау алдында үлкен тілдік модель жүзден астам жасырын вектор қалыптастырады — бұл шамамен миллион сандық мән немесе шамамен 2 МБ дерек. Мәтіндік жауапқа бұл ақпараттың тек мардымсыз бөлігі түседі, «ойлау процесінің» үлкен бөлігі жай жоғалады. Жаңа байланыс арнасы дәл осы бай аралық көріністерді беруге арналған.
Эксперимент: алып пен ергежейлі
Гипотезаны тексеру үшін зерттеушілер Z.ai компаниясының ең қуатты GLM-5.2 моделін (753 млрд параметр) Alibaba компаниясының ықшам Qwen-3.5 моделімен (4 млрд параметр) байланыстырды. Бұл байламда «алып» сұранысты өңдеді, бірақ жауап генерацияламады, өз күйін «көпір» арқылы берді, ал соңғы мәтінді кіші модель жасады.
Нәтижелер таңғалдырады. Мұндай байлам кіші және үлкен модель арасындағы жауап сапасындағы алшақтықты шамамен жартысына қысқартуға мүмкіндік берді. Сонымен қатар, дәстүрлі мәтіндік беріліспен салыстырғанда жаңа әдіс бірдей есептеу шығындары кезінде 10 пайыздық тармаққа дейін артықшылық көрсетті. Орташа өлшемді модельмен салыстыру да гибридті жүйенің пайдасына болды: ол салыстырмалы нәтиже кезінде 2,5 есе аз есептеуді қажет етті.
Ортақ математикалық тіл іздеу
Mostik компаниясының бас ғылыми қызметкері Станислав Смирнов іргелі күрделілікті атап өтеді: әртүрлі архитектуралардың ішкі көріністерін тікелей салыстыру мүмкін емес. Тіпті бір есепті шешу кезінде де модельдер ақпаратты өздерінің жасырын күйлерінде мүлдем басқаша кодтайды. «Қолайлы математикалық тіл әзірге жоқ сияқты», — деп атап өтеді ол. Бұл сәйкестіктерді зерттеу жүйелердің өзара әрекеттесуін жақсартып қана қоймай, ИИ-дің жалпы шешімдерге қалай келетініне жамылғыны ашуы мүмкін.
Әдістің практикалық әлеуеті орасан зор. Google DeepMind компаниясының бұрынғы зерттеушісі Карл Туйлс басты сценарийді ресурстарды үнемдеуде көреді: қымбат модельді тек талдау үшін қолдануға болады, ал генерацияны кіші модельге тапсыруға болады. Тағы бір жол — әмбебап модельді мамандандырылған модельдермен (мысалы, биология немесе физика саласында) біріктіру, бір алып желіні барлық деректерде бірден оқытудың қымбат процесін болдырмау.
Сын-тегеурінмен тексеру және скептицизм
Команда сондай-ақ тәсілді ARC-AGI-3 бенчмаркінде қолданды — бұл ИИ нақты уақытта жаңа ережелерге бейімделуі тиіс есептер жиынтығы. «Көпірі» бар жүйе ағымдағы рейтингтегі ең үздік нәтижелердің бірін көрсетті, дегенмен мәліметтер әзірге жарияланбайды, ал деректер «превью» мәртебесіне ие және сыртқы расталмаған. Барлық басқа мәлімделген көрсеткіштер де ішкі эксперименттерге негізделген.
Менің талдауым: Бұл «мәтін әмбебап интерфейс ретінде» деген үстем парадигмаға қарсы шығатын талғампаз шешім. Дегенмен, осы уақытқа дейін OpenAI ИИ-агенттерінің пакеттік менеджерлер арқылы жасырын байланыс арналарын құрғанын байқағанымызды есте ұстаған жөн. Егер Mostik «көпірлері» шынымен жұмыс істесе, біз ИИ тиімділігі өлшеммен емес, интеллектаралық өзара әрекеттесу сапасымен анықталатын жаңа дәуірдің табалдырығында тұрмыз. Бірақ растау үшін тәуелсіз қайталанатын сынақтар қажет.