Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов

Alibaba пополнила арсенал моделей искусственного интеллекта мультимодальной системой Qwen3.8-Omni-Flash. В рамках единой архитектуры она обрабатывает текст, изображения, аудио и видео, а также поддерживает контекстное окно размером 1 млн токенов. Новинка, отмечает разработчик, показывает высокие результаты в различных сценариях, включая редактирование видео, подготовку музыкальных клипов, кинопроизводство, обобщение аудиовизуальной информации и ведение диалогов в реальном времени. Одним из главных достижений стало снижение стоимости сервиса. По сравнению с предыдущей версией Qwen3.5-Omni-Plus при доступе по API цена за час обработки аудиоданных снизилась более чем на 98 %, аудио и видео — более чем на 93 %. Средний результат в 29 бенчмарках вырос более чем на 25 % по сравнению с предыдущим поколением. В тестах, охватывающих работу аудио- и видеоагентов, написание кода и выполнение задач с долгосрочным планированием, модель набрала 71,0 балла в WildClawBench-MM — на 36,5 балла больше предшественницы. В UniClawBench результат составил 69,6 балла. В тесте LongAudioSpan на понимание длинных аудиозаписей модель получила 82,7 балла, в OmniVideoBench на анализ аудио и видео — 63,4 балла, в OmniCap-IF на следование инструкциям при описании видео — 28,2 балла, а в AliMeeting на расшифровку совещаний на китайском языке с участием нескольких человек — 89,7 балла. По качеству совместной обработки звука и видео Qwen3.8-Omni-Flash приблизилась к Google Gemini 3.8 Flash, а при работе только со звуком даже превзошла американского конкурента. Система распознавания речи поддерживает 74 языка и диалекта, включая кантонский, уйгурский и маори, а система генерации — 29 языков. Обе системы поддерживают китайский, английский, корейский, французский, немецкий, испанский и японский языки.


Источник: 3DNews — https://3dnews.ru/1148742

Комментарии