Наш веб-сайт использует файлы cookie, чтобы предоставить вам возможность просматривать релевантную информацию. Прежде чем продолжить использование нашего веб-сайта, вы соглашаетесь и принимаете нашу политику использования файлов cookie и конфиденциальность.

Alibaba представляет Qwen3.8-Omni-Flash: мультимодальный AI с большим контекстом

expert.com.ua

Alibaba представляет Qwen3.8-Omni-Flash: мультимодальный AI с большим контекстом

Алибаба представила новую генеративную модель Qwen3.8-Omni-Flash, поражающую своими мультимодальными возможностями и огромным контекстным окном. Эта модель способна одновременно обрабатывать текст, изображения, аудио и видео, предлагая впечатляющее окно контекста до 1 миллиона токенов.

Qwen3.8-Omni-Flash – это следующее поколение полностью интегрированных мультимодальных моделей от Alibaba. В отличие от предыдущих версий, эта модель обеспечивает значительное улучшение в области обработки аудио и видео, сохраняя при этом высокую производительность в работе с текстом.

По данным компании, в 30 различных тестах Qwen3.8-Omni-Flash продемонстрировала среднее улучшение результатов более чем на 26% по сравнению с предыдущей моделью Qwen3.5-Omni-Plus. Особенно заметный прогресс наблюдается в сфере работы с аудио- и видеоагентами, кодированием и обработкой длинных задач. К примеру, в бенчмарке WildClawBench-MM показатели выросли на 36.5 балла, а в AgenticVBench — на 22.3 балла.

Базовые мультимодальные возможности также существенно улучшились. Модель показала рост на 8.3 баллов в LongAudioSpan, на 9.6 баллов в OmniVideoBench, а также улучшение показателей CSR и ISR соответственно на 8.5 и 14.1 баллов в OmniCap-IF. Важной новостью является значительное снижение показателей DER и cpWER в системе AliMeeting с 88.11/89.61 до 3.35/17.18, что свидетельствует о значительном повышении точности распознавания и транскрибирования аудио.

Alibaba заявляет, что аудио возможности Qwen3.8-Omni-Flash в целом превышают возможности Gemini 3.8 Flash, а по совокупным аудио- и видеовозможностям модель приближается к своему конкуренту. При этом компания сделала ставку на доступность, снизив стоимость API для обработки аудио входных данных более чем на 98%, а для аудио- и видеовходных данных более 93%.

Для поддержки обработки длинных аудио- и видеоматериалов Alibaba расширила Qwen-MM-Plugins и представила открытый Qwen-Live Harness. Qwen-MM-Plugins ориентированы на эффективную работу с длительными рабочими процессами, обеспечение контекстуального вызова инструментов и их исполнение. Qwen-Live Harness, в свою очередь, предназначен для обеспечения реального, непрерывного мультимодального взаимодействия.

Модель открывает новые горизонты в понимании долгосрочного аудио и видеоконтента. Теперь она может:

Функция управляемого создания субтитров для аудио и видео позволяет пользователям указывать объект описания, временной диапазон, уровень детализации информации и формат вывода.

В сфере агентского понимания долгосрочного видеоконтента Qwen3.8-Omni-Flash также демонстрирует впечатляющий прогресс. Например, у OmniVideoBench точность выросла с 63.4% до 67.8%, при этом потребление токенов уменьшилось примерно на 45.7%.

В контексте рабочих встреч модель может обрабатывать до часа аудио- и видеозаписей. Она способна определять участников разговора, транскрибировать и сопоставлять реплики с соответствующими спикерами. Кроме того, Qwen3.8-Omni-Flash может генерировать протоколы встреч, списки задач, а также анализировать риски проекта. Интеграция с инструментами позволяет автоматически посылать электронные письма, упорядочивать задачи или генерировать код.

Возможности модели не ограничиваются пониманием. Qwen3.8-Omni-Flash также эффективна в создании контента:

Интересным примером самостоятельного обучения модели является эксперимент по улучшению распознавания сычуанского диалекта. За 12 часов Qwen3.8-Omni-Flash самостоятельно выбрала соответствующий набор данных, провела 4 экспериментальные итерации, создав 3413 единиц обучающих данных. В результате показатель ошибок на уровне символов уменьшился с 25.79% до 15.30%, что составляет снижение примерно на 40.7%.

В области сжатия информации был представлен инструмент Video2Note, генерирующий PDF-заметки с текстовым и графическим содержимым из часовых видео. Omni Skill Creator позволяет извлекать стандартизированные рабочие процессы из демонстрационных операций и превращать их в повторно используемые навыки для Agent.

Qwen3.8-Omni-Flash-Realtime — версия модели, способная воспринимать и реагировать на аудио- и видеопотоки в режиме реального времени, одновременно вызывая инструменты с учетом текущего контекста. Она поддерживает функцию реального времени для языковых тренировок, сочетая моделирование произношения и семантики, понимая нестандартные выражения, которые могут быть искажены акцентом.

Компания утверждает, что эта реальная версия является первой мультимодальной моделью, поддерживающей функцию «слышать направление звука». Она интегрирует пространственную аудиоинформацию с визуальными данными для определения направления и расстояния до источника звука. Кроме того, через навыки (Skills) модель может получать информацию о личности, стиле общения, деловых знаниях и правилах взаимодействия.

В бенчмарке Agentic Omni Understanding, включающий OmniVideoBench, Video-MME-v2 и LVOmniBench, Qwen3.8-Omni-Flash показала себя в статическом режиме и в режиме агента по сравнению с Gemini 3.8 Flash. Подробные результаты производительности и пропускной способности API для Qwen3.8-Omni-Flash-Realtime в различных сценариях входных данных также были опубликованы.

В целом Qwen3.8-Omni-Flash представляет собой значительный шаг вперед в развитии мультимодальных AI-моделей, предлагая мощные инструменты для понимания, генерации и взаимодействия с различными типами данных, что открывает новые возможности для бизнеса и пользователей.

Источник: https://www.ithome.com/1/004/049.htm

  • Последние
Больше новостей

Новости по дням

Сегодня,
21 сентября 2026

Новости по теме

Больше новостей