Xiaomi представила HySparse2: архитектуру для длинных диалогов
Компания Xiaomi представила новую ключевую архитектуру HySparse2 для своей модели MiMo-V3. Эта инновация направлена на оптимизацию обработки данных и улучшение эффективности работы с длительными диалогами и сложными задачами, требующими обработки больших объемов информации.
HySparse2 разработана для работы с многоэтапными агентами (Agent), требующими обработки длинных контекстов. Новая архитектура призвана уменьшить вычислительные затраты при предварительной обработке данных (Prefill), сократить объем памяти, необходимой для кэширования ключевых значений (KV Cache), и обеспечить более точный поиск критически важной информации в растущей истории задач.
С момента выпуска Xiaomi MiMo-V2 компания постоянно работает над улучшением как функциональности моделей, так и их вычислительной эффективности. Архитектура Hybrid SWA, использовавшаяся в MiMo-V2, сочетала полноценное внимание (Full Attention) со сдвижным оконным механизмом (Sliding Window Attention), обеспечивая высокое качество модели при одновременном повышении эффективности обучения и вывода.
За последнее полугодие Xiaomi активно экспериментировала с методами обучения с подкреплением (RL), применяя приобретенный опыт к серии MiMo-V2.6, что значительно улучшило возможности модели. Параллельно с развитием V2 активно велась разработка архитектуры нового поколения для MiMo-V3. Первым шагом на этом пути стала архитектура HySparse.
Сегодня Xiaomi представляет HySparse2 – ключевую архитектуру для MiMo-V3. Она базируется на HySparse, но усовершенствует механизмы совместного использования KV (KV sharing) и выбора по разреженности (sparse selection), что делает обработку долгосрочного контекста еще более эффективной и точной.
Современные Agent часто сталкиваются с необходимостью обработки больших объемов данных, полученных, например, с веб-страниц, документов или логов выполнения инструментов. Каждый новый шаг в выполнении задачи требует анализа новых входных данных и извлечения релевантной информации из истории.
Модели сохраняют представление прочитанной информации в KV Cache для дальнейшего использования. Процесс загрузки новых данных и построения этих кэшей называется Prefill. В многоэтапных задачах Agent'ов при каждом получении новой информации необходимо повторно обрабатывать эти данные. Поэтому новая архитектура должна отвечать трем ключевым требованиям:
Первая версия HySparse уже сделала шаг в этом направлении, используя небольшое количество слоев Full Attention для предоставления KV Cache и результатов выбора ключевых позиций, которые затем повторно использовались разреженными слоями (Sparse Attention). Это уменьшило вычислительные расходы и погрузку на кэш. Однако у HySparse Prefill все еще требовал выполнения всех слоев, а блочный выбор мог быть менее точным при поиске информации на больших расстояниях.
HySparse2 решает эти проблемы путем внедрения двухступенчатого совместного использования KV, разреженного выбора на уровне токенов и унифицированного доступа к локальной информации.
HySparse2 разделяет модель на две части: Self-Decoder (передняя часть) и Cross-Decoder (задняя часть). В Self-Decoder используется гибридная структура Full Attention и SWA, а в Cross-Decoder – гибридная структура Full Attention и Sparse Attention.
Совместное использование KV происходит на двух уровнях:
В отличие от HySparse, использовавшей блочный выбор, HySparse2 переходит к выбору на уровне отдельных токенов. Это позволяет более точно распределять вычислительные ресурсы внимания, особенно при работе с длинными контекстами, где важные токены могут быть разбросаны. Тестирование на задачах RULER-v2, MRCR-v2 и GraphWalks показало значительное улучшение благодаря более детальному выбору.
Кроме глобального поиска модель сохраняет доступ к ближайшему контексту. HySparse2 принудительно выделяет последние 128 токенов и дополнительно выбирает 1,024 глобальных токена вне этого окна. Эти два набора данных совместно используют KV Cache, предоставленный слоями Full Attention.
Важным изменением является объединение доступа к локальной и глобальной информации в одном вычислении разреженного внимания. Ранее локальная информация требовала отдельной ветви SWA, что усложняло процесс и требовало дополнительных вычислений. Теперь оба типа информации доступны из KV Cache, подготовленного еще на этапе Self-Decoder. Это устраняет зависимость от вычислений Cross-Decoder для формирования локального кэша.
Эксперименты показали, что принудительное выделение локального окна поддерживает конкурентоспособность модели в задачах с длинным контекстом, одновременно уменьшая затраты на параметры и KV Cache благодаря отсутствию отдельной ветви SWA.
Благодаря двухступенчатому совместному использованию KV и объединению локального окна весь KV Cache, необходимый для задней части модели, может быть построен из скрытых состояний передней части. Это позволяет завершить строительство KV Cache сразу после вычисления Self-Decoder и KV Bridging.
В модели с 49 слоями Prefill теперь требует выполнения только первых 25 слоев Self-Decoder и KV Bridging, с одним слоем Full Attention. Это означает, что для развертывания Prefill-узла достаточно этой части сети Self-Decoder, что почти вдвое сокращает необходимый объем памяти для модели.
Таким образом, оптимизация расширяется от сокращения вычислений внимания к уменьшению пути вычислений для длинных входов. Этап поколения остается полным, продолжая использовать возможности модели для глобального поиска и моделирования.
Сравнение архитектур Hybrid SWA, HySparse и HySparse2 на 80B-A3B MoE модели (с одинаковыми данными и процессом обучения, но разным дизайном внимания и более компактной конфигурацией MQA в HySparse2) показало значительные преимущества HySparse2.
Эти результаты подтверждают, что меньший KV Cache и более короткий Prefill могут сосуществовать с улучшенным поиском в длинном контексте. HySparse2 создает более эффективную архитектурную основу для многоэтапных Agent'ов с длинным контекстом.
Завершение задачи Agent'ом требует постоянного чтения информации, генерации действий и дальнейшего продвижения на основе полученных результатов. Эффективность каждого такого цикла оказывает непосредственное влияние на общее время ожидания пользователя.
Ранее MiMo-UltraSpeed благодаря синергии модели и системы (низкобитная квантизация, спекулятивное декодирование, MegaKernel), фокусировалась на ускорении декодирования. Сегодня HySparse2 дополнительно снижает затраты на Prefill и кэширование для продолжительного контекста. Эти два направления работы – обработка ввода и генерация вывода – направлены на повышение общей эффективности модели.
Xiaomi стремится интегрировать эти разработки для MiMo-V3, чтобы, кроме повышения интеллекта модели, предложить пользователям более быстрый Prefill и Decode при одинаковом размере модели, помогая им быстрее выполнять более сложные задачи.
Источник: https://www.ithome.com/1/006/839.htm
- Последние
- Популярные
-
-
-
-
-
- Сентябрь, 24
-
-
-
-
-
-
-
-
-
-
-
-
-
-
Новости по дням
25 сентября 2026