Нейрожелілердің өзара әрекеттесуінің классикалық парадигмасы, яғни модельдер тек генерацияланған мәтін арқылы ғана сөйлесетін әдіс, өткенге айналып барады. Менің Mostik зерттеу тобындағы әріптестерім түбегейлі басқа тәсілді ұсынды: олар ИИ жүйелері арасында сөздерді емес, олардың ішкі күйлерін — жауап вербализацияланғанға дейін нейрондық желілердің тереңдігінде қалыптасатын «шикі» ақпаратты беруді үйренді.

Әдістің мәні арнайы бейімделгіш модульді қолдануда, оны мен жасырын көріністердің аудармашысы деп атар едім. Бұл «көпір» бір модельдің ішкі векторларын екіншісіне түсінікті форматқа түрлендіреді, ал нейрожелілердің өз параметрлері өзгеріссіз қалады және жұқа баптауға ұшырамайды. Бұл дистилляция немесе бірлескен оқытудың кең таралған әдістерінен түбегейлі айырмашылық.

Цифрлық алшақтық: неге сөздер — бұл тар жол

Менің есептеулерім растайды: бір ғана токенді генерацияламас бұрын, үлкен тілдік модель (LLM) жүзден астам жасырын векторларды қалыптастырады, бұл шамамен миллион сандық мәнге немесе шамамен 2 МБ дерекке тең. Мәтіндік жауапқа осы ақпараттық байлықтың тек мардымсыз бөлігі ғана түседі. Жаңа байланыс арнасы дәл осы аралық көріністерді беруге бағытталған, бұл әлдеқайда тығыз және семантикалық қанық деректер ағынына қол жеткізуді ашады.

Схема передачи информации из внутренних состояний языковой модели
Тілдік модельдің ішкі күйлерінен ақпарат беру схемасы

Эксперимент: алып ойлайды, ергежейлі сөйлейді

Гипотезаны тексеру үшін команда көрнекі эксперимент жүргізді, екі шеткі жағдайды қосып: Z.ai компаниясының 753 миллиард параметрі бар қуатты GLM-5.2 моделін және Alibaba компаниясының 4 миллиард параметрі бар ықшам Qwen-3.5 моделін. Үлкен модель тек «аналитик» рөлін атқарды, сұрауды өңдеді, бірақ жауап шығармады. Оның ішкі күйі «көпір» арқылы кіші модельге берілді, ол қорытынды мәтінді құрастырды.

Схема взаимодействия GLM-5.2 и Qwen-3.5 через промежуточный модуль
GLM-5.2 және Qwen-3.5 аралық модуль арқылы өзара әрекеттесу схемасы

Нәтижелер таңқаларлық: мұндай байланыс кіші және үлкен модельдер арасындағы сапа алшақтығын шамамен екі есе қысқартуға мүмкіндік берді. Дәстүрлі мәтіндік беріліспен салыстырғанда, жаңа әдіс есептеулердің бірдей көлемінде 10 пайыздық тармаққа дейін артықшылық көрсетті. Сонымен қатар, гибридті жүйе орташа өлшемді модельмен салыстырылатын нәтижелерді көрсете отырып, шамамен 2,5 есе аз есептеу ресурстарын қажет етті.

Результаты GLM-5.2 и Qwen-3.5 с использованием «моста»
«Көпірді» қолдану арқылы GLM-5.2 және Qwen-3.5 нәтижелері

Ортақ математикалық тілді іздеу

Mostik компаниясының бас ғылыми қызметкері Станислав Смирнов іргелі мәселені әділ атап өтеді: әртүрлі нейрожелілердің ішкі көріністері тікелей салыстыруға келмейді. Бірдей мәселені шешкеннің өзінде, екі модель ақпаратты өздерінің жасырын күйлерінде мүлдем басқаша кодтай алады. «Қолайлы математикалық тіл әзірге жоқ сияқты», — деп атап көрсетеді ол. Бұл негізгі сын-қатер: мұндай сәйкестіктерді зерттеу — бұл жай инженерлік міндет емес, әртүрлі ИИ жүйелерінің әлемді қалай қабылдайтынын және шешімдер қабылдайтынын түсіну жолы.

Тәсілдің практикалық құндылығы индустрия үшін айқын. Google DeepMind компаниясының бұрынғы зерттеушісі Карл Туйлс негізгі сценарийді еңбек бөлінісінде көреді: ресурсты көп қажет ететін модель сұрауды өңдейді, ал жауапты генерациялауды айтарлықтай кіші модель өз мойнына алады. Lovable компаниясының техникалық жетекшісі Владимир Арустамян тар мамандандырылған модельдерге сұраныстың өсуін болжайды: «әмбебап сарбазды» құрудың орнына, әзірлеушілер әртүрлі құзыреттері бар бірнеше жүйені біріктіре алады — мысалы, жалпы пайымдау моделін биология немесе физика деректеріне оқытылған модельмен.

Эмпирикалық тексеру және «превью» мәртебесі

Айта кету керек, команда өз әдісін ARC-AGI-3 тестінде де қолданды, мұнда ИИ интерактивті режимде жаңа ережелерге бейімделуі керек. «Көпірі» бар жүйе ағымдағы рейтингтегі ең үздік нәтижелердің бірін көрсетті, алайда бұл деректер «превью» мәртебесіне ие және тесттердің толық емес жиынтығына негізделген. Барлық мәлімделген тиімділік көрсеткіштері де команданың ішкі эксперименттеріне негізделген және әзірге тәуелсіз сыртқы растау алған жоқ.

Менің үкімім: бұл тәсіл таратылған ИИ жүйелерінің жаңа архитектурасының іргетасына айналуы мүмкін, мұнда есептеу қуаты мен мамандану монолитті емес, модульдік болады. Алайда өнеркәсіптік енгізуге дейін әртекті модельдер арасындағы «ой алмасу хаттамасын» стандарттаудың күрделі мәселесін шешу қажет. Сайып келгенде, тіпті адамдарда бұған тіл эволюциясының мыңжылдықтары кетті.