Alibaba Cloud a publié son annonce de Qwen3.8-Omni-Flash le 20 septembre, dévoilant un modèle multimodal qui accepte du texte, des images, de l’audio et de la vidéo avec une fenêtre de contexte de 1 M de tokens. L’entreprise le destine aux enregistrements longs et aux workflows de type agent, et pas seulement au chat.
Pour les builders, la principale évolution est la consolidation des API : Alibaba indique que le modèle est disponible sur la plateforme IA Qianwen, prend en charge les API Chat Completions et Responses compatibles avec OpenAI, et peut être piloté avec des outils ainsi qu’un effort de raisonnement réglable. Alibaba présente également son approche de la vidéo longue comme une extraction des preuves depuis les segments pertinents, plutôt qu’un traitement uniforme de tous les médias.
Les réserves sont importantes. Les réductions de coûts mises en avant par Alibaba comparent le modèle à son propre Qwen3.5-Omni-Plus antérieur, et non à des modèles concurrents, tandis que le dossier précise que la tarification des médias selon les régions doit encore être validée. L’endpoint de base renvoie également du texte : les équipes qui ont besoin de réponses vocales devront donc peut-être ajouter une couche TTS ou temps réel, comme le relève une analyse indépendante.
