Наш веб-сайт использует файлы cookie, чтобы предоставить вам возможность просматривать релевантную информацию. Прежде чем продолжить использование нашего веб-сайта, вы соглашаетесь и принимаете нашу политику использования файлов cookie и конфиденциальность.

Xiaomi представила HySparse2: архитектуру для длинных диалогов

expert.com.ua

Xiaomi представила HySparse2: архитектуру для длинных диалогов

Компания Xiaomi представила новую ключевую архитектуру HySparse2 для своей модели MiMo-V3. Эта инновация направлена ​​на оптимизацию обработки данных и улучшение эффективности работы с длительными диалогами и сложными задачами, требующими обработки больших объемов информации.

HySparse2 разработана для работы с многоэтапными агентами (Agent), требующими обработки длинных контекстов. Новая архитектура призвана уменьшить вычислительные затраты при предварительной обработке данных (Prefill), сократить объем памяти, необходимой для кэширования ключевых значений (KV Cache), и обеспечить более точный поиск критически важной информации в растущей истории задач.

С момента выпуска Xiaomi MiMo-V2 компания постоянно работает над улучшением как функциональности моделей, так и их вычислительной эффективности. Архитектура Hybrid SWA, использовавшаяся в MiMo-V2, сочетала полноценное внимание (Full Attention) со сдвижным оконным механизмом (Sliding Window Attention), обеспечивая высокое качество модели при одновременном повышении эффективности обучения и вывода.

За последнее полугодие Xiaomi активно экспериментировала с методами обучения с подкреплением (RL), применяя приобретенный опыт к серии MiMo-V2.6, что значительно улучшило возможности модели. Параллельно с развитием V2 активно велась разработка архитектуры нового поколения для MiMo-V3. Первым шагом на этом пути стала архитектура HySparse.

Сегодня Xiaomi представляет HySparse2 – ключевую архитектуру для MiMo-V3. Она базируется на HySparse, но усовершенствует механизмы совместного использования KV (KV sharing) и выбора по разреженности (sparse selection), что делает обработку долгосрочного контекста еще более эффективной и точной.

Современные Agent часто сталкиваются с необходимостью обработки больших объемов данных, полученных, например, с веб-страниц, документов или логов выполнения инструментов. Каждый новый шаг в выполнении задачи требует анализа новых входных данных и извлечения релевантной информации из истории.

Модели сохраняют представление прочитанной информации в KV Cache для дальнейшего использования. Процесс загрузки новых данных и построения этих кэшей называется Prefill. В многоэтапных задачах Agent'ов при каждом получении новой информации необходимо повторно обрабатывать эти данные. Поэтому новая архитектура должна отвечать трем ключевым требованиям:

Первая версия HySparse уже сделала шаг в этом направлении, используя небольшое количество слоев Full Attention для предоставления KV Cache и результатов выбора ключевых позиций, которые затем повторно использовались разреженными слоями (Sparse Attention). Это уменьшило вычислительные расходы и погрузку на кэш. Однако у HySparse Prefill все еще требовал выполнения всех слоев, а блочный выбор мог быть менее точным при поиске информации на больших расстояниях.

HySparse2 решает эти проблемы путем внедрения двухступенчатого совместного использования KV, разреженного выбора на уровне токенов и унифицированного доступа к локальной информации.

HySparse2 разделяет модель на две части: Self-Decoder (передняя часть) и Cross-Decoder (задняя часть). В Self-Decoder используется гибридная структура Full Attention и SWA, а в Cross-Decoder – гибридная структура Full Attention и Sparse Attention.

Совместное использование KV происходит на двух уровнях:

В отличие от HySparse, использовавшей блочный выбор, HySparse2 переходит к выбору на уровне отдельных токенов. Это позволяет более точно распределять вычислительные ресурсы внимания, особенно при работе с длинными контекстами, где важные токены могут быть разбросаны. Тестирование на задачах RULER-v2, MRCR-v2 и GraphWalks показало значительное улучшение благодаря более детальному выбору.

Кроме глобального поиска модель сохраняет доступ к ближайшему контексту. HySparse2 принудительно выделяет последние 128 токенов и дополнительно выбирает 1,024 глобальных токена вне этого окна. Эти два набора данных совместно используют KV Cache, предоставленный слоями Full Attention.

Важным изменением является объединение доступа к локальной и глобальной информации в одном вычислении разреженного внимания. Ранее локальная информация требовала отдельной ветви SWA, что усложняло процесс и требовало дополнительных вычислений. Теперь оба типа информации доступны из KV Cache, подготовленного еще на этапе Self-Decoder. Это устраняет зависимость от вычислений Cross-Decoder для формирования локального кэша.

Эксперименты показали, что принудительное выделение локального окна поддерживает конкурентоспособность модели в задачах с длинным контекстом, одновременно уменьшая затраты на параметры и KV Cache благодаря отсутствию отдельной ветви SWA.

Благодаря двухступенчатому совместному использованию KV и объединению локального окна весь KV Cache, необходимый для задней части модели, может быть построен из скрытых состояний передней части. Это позволяет завершить строительство KV Cache сразу после вычисления Self-Decoder и KV Bridging.

В модели с 49 слоями Prefill теперь требует выполнения только первых 25 слоев Self-Decoder и KV Bridging, с одним слоем Full Attention. Это означает, что для развертывания Prefill-узла достаточно этой части сети Self-Decoder, что почти вдвое сокращает необходимый объем памяти для модели.

Таким образом, оптимизация расширяется от сокращения вычислений внимания к уменьшению пути вычислений для длинных входов. Этап поколения остается полным, продолжая использовать возможности модели для глобального поиска и моделирования.

Сравнение архитектур Hybrid SWA, HySparse и HySparse2 на 80B-A3B MoE модели (с одинаковыми данными и процессом обучения, но разным дизайном внимания и более компактной конфигурацией MQA в HySparse2) показало значительные преимущества HySparse2.

Эти результаты подтверждают, что меньший KV Cache и более короткий Prefill могут сосуществовать с улучшенным поиском в длинном контексте. HySparse2 создает более эффективную архитектурную основу для многоэтапных Agent'ов с длинным контекстом.

Завершение задачи Agent'ом требует постоянного чтения информации, генерации действий и дальнейшего продвижения на основе полученных результатов. Эффективность каждого такого цикла оказывает непосредственное влияние на общее время ожидания пользователя.

Ранее MiMo-UltraSpeed ​​благодаря синергии модели и системы (низкобитная квантизация, спекулятивное декодирование, MegaKernel), фокусировалась на ускорении декодирования. Сегодня HySparse2 дополнительно снижает затраты на Prefill и кэширование для продолжительного контекста. Эти два направления работы – обработка ввода и генерация вывода – направлены на повышение общей эффективности модели.

Xiaomi стремится интегрировать эти разработки для MiMo-V3, чтобы, кроме повышения интеллекта модели, предложить пользователям более быстрый Prefill и Decode при одинаковом размере модели, помогая им быстрее выполнять более сложные задачи.

Источник: https://www.ithome.com/1/006/839.htm

  • Последние
Больше новостей

Новости по дням

Сегодня,
25 сентября 2026

Новости по теме

Больше новостей