Современные нейросети тратят огромные вычислительные ресурсы, чтобы сформулировать мысль словами, а другая нейросеть затем снова превращает написанный текст во внутреннее математическое представление. Российские математики из стартапа Mostik решили убрать промежуточный разговор и заставили модели передавать друг другу внутренние состояния напрямую.
Обычная языковая модель во время обработки запроса создает множество скрытых векторов с информацией о задаче, но наружу выпускает лишь последовательность токенов. Mostik разработал небольшой обучаемый мост, который переводит внутреннее состояние одной модели в пространство, понятное другой модели. Первая нейросеть читает запрос и передает скрытое представление, после чего вторая продолжает вычисления и формирует окончательный ответ. Веса обеих нейросетей при работе остаются неизменными, обучение проходит только сам связующий модуль.
Для демонстрации разработчики соединили большую GLM-5.2 с 753 млрд параметров и компактную Qwen3.5-4B с четырьмя млрд параметров. GLM-5.2 обрабатывала исходный запрос, но не генерировала ответ. Полученные внутренние состояния поступали через мост в Qwen3.5-4B, которая уже создавала текст.
По результатам внутренних испытаний Mostik, связка закрыла около половины разницы в качестве между маленькой и большой моделями. Точность Qwen3.5-4B выросла примерно на 25%, а на более сложных наборах задач прирост доходил до двух раз. При сопоставимом качестве гибридная архитектура потребовала примерно в 2,5 раза меньше вычислений, чем одиночная модель промежуточного размера. Разработчики связывают экономию с разницей между обработкой готового запроса и последовательной генерацией токенов: мощная модель выполняет только относительно дешевую стадию чтения, а основную генерацию берет на себя компактная.
Подход относится к активно развивающемуся направлению латентной коммуникации, где нейросети передают embeddings, скрытые состояния или другие непрерывные представления вместо текста. Главная сложность возникает при соединении разных архитектур: внутренние пространства двух моделей не обязаны совпадать. Независимые исследования уже предлагают собственные способы согласования скрытых состояний между моделями, включая StateBridge и XBridge. Mostik делает ставку на отдельно обучаемый переводчик между двумя замороженными моделями.
Разработчики также сообщили о системе, которая поднялась на верхние позиции ARC-AGI 3, однако устройство конкурсной версии и результаты испытаний команда пока не раскрывает. Сам ARC-AGI-3 проверяет способность ИИ осваиваться в незнакомой интерактивной среде без готовых инструкций, самостоятельно выявлять цели, строить модель происходящего и менять стратегию по мере получения новой информации.
Практическая ценность метода выходит за рамки экономии вычислений. Вместо одной гигантской универсальной модели разработчики смогут связывать несколько специализированных нейросетей, например отдельные системы для программирования, физики или биологии. Сильная модель сможет подключаться только на сложных этапах, а более дешевая будет выполнять основную работу. Mostik также рассматривает применение технологии в многоагентных системах, где несколько ИИ сегодня вынуждены общаться друг с другом через обычный текст.
Пока результаты следует считать предварительными. Mostik вышел из закрытого режима лишь недавно, а подробной научной публикации с воспроизводимыми тестами компания пока не представила. Главный эксперимент выглядит перспективно именно из-за огромной разницы в размерах двух моделей: 753 млрд против четырех млрд параметров. Если независимые проверки подтвердят заявленные показатели, прямой обмен внутренними состояниями способен превратить набор разных нейросетей в единую систему без необходимости постоянно увеличивать размер одной модели.