Selon Wallstreetcn, le modèle natif full-modal de prochaine génération Qwen3.8-Omni-Flash d’Alibaba Cloud a été lancé. Son objectif central est d’améliorer les capacités des agents dans des scénarios de productivité en situation réelle et de faire évoluer les modèles full-modal : de la compréhension de contenus multimodaux à la planification de tâches, l’appel d’outils et la réalisation de créations. Construit sur des capacités agentiques générales en programmation, en travail cognitif basé sur du texte et en opérations d’interface graphique (GUI), Qwen3.8-Omni-Flash étend davantage les applications agentiques centrées sur l’audio et la vidéo. Il a également montré des résultats notables dans des flux de travail nécessitant un traitement intégré du texte, des images, de l’audio et de la vidéo, notamment l’édition vidéo, la création de clips musicaux, la production de films et de séries ainsi que la narration, des résumés texte-image à partir d’audio et de vidéo, et des dialogues audio et vidéo.
