Alibaba lance Qwen3.8-Omni-Flash, un modèle d'IA omnimodal capable de produire des vidéos, des clips musicaux, des films, des résumés audiovisuels et des conversations en temps réel
L'équipe Qwen d'Alibaba a lancé Qwen3.8-Omni-Flash. Elle le présente comme son premier modèle omnimodal articulé autour de capacités « agentiques ». Il accepte du texte, des images, de l'audio et de la vidéo, et renvoie du texte. La compréhension audio-vidéo, le raisonnement et l'utilisation d'outils sont intégrés au sein d'un seul modèle. Il est disponible sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio. Aucun poids de modèle n'ayant été rendu public lors du lancement, l'auto-hébergement n'est pas envisageable.
Alibaba Group Holding Limited, connue sous le nom d'Alibaba, est une multinationale chinoise spécialisée dans le commerce électronique, la vente au détail, Internet et les technologies. Fondée le 28 juin 1999 à Hangzhou, dans la province du Zhejiang, la société propose des services de vente de particulier à particulier (C2C), d'entreprise à particulier (B2C) et d'entreprise à entreprise (B2B) via des places de marché chinoises et internationales, ainsi que des services locaux destinés aux consommateurs, dans les domaines des médias numériques et du divertissement, de la logistique et du cloud computing. Elle détient et exploite un portefeuille diversifié d’entreprises à travers le monde dans de nombreux secteurs d’activité.
Qwen (également connu sous le nom de Tongyi Qianwen) est une famille de modèles de langage (LLM et SLM), de grande et de petite taille, à poids principalement ouverts, développée par Alibaba Cloud. Sa dernière version, Qwen 3.8, un modèle de 2 400 milliards de paramètres, était le deuxième plus grand et le deuxième plus puissant modèle de langage à poids ouverts et modèle de langage chinois publié au 12 août 2026, après Kimi K3. Les modèles de plus grande taille nécessitent un accord de partage des revenus de la part des fournisseurs générant plus de 50 millions de dollars US par an. La version distillée Qwen3.8 27B a été publiée sous une licence Apache plus permissive.
En août 2026, Alibaba Cloud avait lancé Qwen3.8-Flash-Next, un modèle d'intelligence artificielle (IA) multimodal de type « mixture-of-experts », qui offrait un premier aperçu de l'architecture de la future famille Qwen4. Cette refonte architecturale portait à la fois sur le mécanisme d'attention, les connexions résiduelles, l’intégration et l’optimisation. Qwen3.8-Flash-Next disposait d'un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires, dont seuls 6 milliards étaient activés par token. Alibaba revendiquait de meilleurs résultats en matière de codage et dans les tâches bureautiques par rapport à Qwen3.7-Plus, pour un coût d'entraînement environ neuf fois moindre, avec un contexte s'étendant jusqu'à 1 million de tokens via YaRN.
Récemment, l'équipe Qwen d'Alibaba a lancé Qwen3.8-Omni-Flash. Elle le présente comme son premier modèle omnimodal articulé autour de capacités « agentiques ». Il accepte du texte, des images, de l'audio et de la vidéo, et renvoie du texte. La compréhension audio-vidéo, le raisonnement et l'utilisation d'outils sont intégrés au sein d'un seul modèle. Le flux de travail décrit est simple : comprendre le contenu, planifier la tâche, l'exécuter à l'aide d'outils, fournir le résultat. Est-il déployable ? Oui, sous forme d’API hébergée. Il est disponible sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio. Aucun poids de modèle n’ayant été rendu public lors du lancement, l’auto-hébergement n’est pas envisageable.
Qu’est-ce que Qwen3.8-Omni-Flash ?
Le Qwen3.8-Omni-Flash repose sur l’architecture Qwen3.8-Flash-Next. Ce modèle de base a été commercialisé avec des poids ouverts en août 2026. La fenêtre de contexte est de 1 million de tokens. QwenCloud indique une entrée maximale de 991 000 tokens et une sortie maximale de 131 000 tokens. La longueur maximale de raisonnement est de 262 000 tokens. La sortie est exclusivement textuelle.
La documentation de Model Studio oriente les développeurs vers le modèle Qwen3.5-Omni lorsqu’ils ont besoin de synthèse vocale. La fonction « Thinking » est activée par défaut, avec le paramètre reasoning_effort défini sur xhigh. Le régler sur none désactive la fonction « Thinking ». L’API suit à la fois les protocoles DashScope et OpenAI. Elle fonctionne avec les compléments de conversation (Chat Completions) et l’API Responses. L’appel de fonctions, la recherche sur le Web, les sorties structurées, la mise en cache du contexte et les appels par lots sont pris en charge.
Perception agentique pour les vidéos longues
La plupart des modèles vidéo analysent un fichier long du début à la fin. Cela vaut même lorsque la réponse se trouve dans trois minutes d’enregistrement. L’équipe de recherche de Qwen propose une approche différente. L’agent part de la question. Il décide ce qu’il doit regarder et écouter. Il rassemble ensuite des indices au cours de plusieurs itérations, passant d’une analyse globale à une analyse plus fine. Les ressources de calcul et les tokens sont alloués aux segments pertinents. L’équipe de recherche présente ses résultats sur OmniVideoBench. La précision passe de 63,4 à 67,8. Le nombre de tokens utilisés chute de 145 736 à 79 117, soit une réduction d’environ 45,7 %.
Récemment, Mozilla a révélé que les modèles d'IA à poids ouverts chinois avaient presque entièrement rattrapé leur retard sur les modèles propriétaires américains. Bien que les systèmes fermés conservaient un léger avantage pour les tâches complexes de longue durée, ils coûtaient environ cinq fois plus cher que leurs concurrents ouverts. Cette dynamique poussait de nombreuses entreprises à adopter des solutions ouvertes pour leurs activités de routine, réservant les modèles de pointe à des besoins spécifiques et experts. L'étude alertait sur la concentration du pouvoir en Chine et appelait à une coalition internationale pour financer une IA plus transparente et diversifiée.
Voici l'annonce de la sortie du modèle Qwen3.8 Omni Flash :
Qwen3.8-Omni-Flash : Capteurs Omni. Diffusion agentique.
Nous lançons Qwen3.8-Omni-Flash, notre modèle omnimodal natif de nouvelle génération. Son objectif principal est de renforcer les capacités des agents dans des scénarios de productivité concrets, en faisant évoluer les modèles omnimodaux de la « compréhension de contenus omnimodaux » à la « planification de tâches, l’utilisation d’outils et la réalisation de travaux créatifs ». S'appuyant sur des capacités générales d'agent dans le codage, le travail intellectuel basé sur le texte et l'utilisation d'interfaces graphiques, Qwen3.8-Omni-Flash étend encore davantage les applications d'agent centrées sur l'audio et la vidéo, offrant d'excellents résultats dans des flux de travail tels que le montage vidéo, la création de clips musicaux, la production et le commentaire de films, la synthèse audiovisuelle et les conversations en temps réel.
Qwen3.8-Omni-Flash prend en charge une fenêtre de contexte de 1 million de tokens tout en conservant des performances textuelles comparables à celles d’un modèle exclusivement textuel de même taille et en offrant des améliorations significatives en matière de capacités omnimodales. Sur 29 évaluations, son score moyen s'améliore de plus de 25 % par rapport à Qwen3.5-Omni-Plus ; le coût de l'API par heure d'entrée audio diminue de plus de 98 %, et celui par heure d'entrée audiovisuelle diminue de plus de 93 %.
Pour les agents audiovisuels, le codage et les tâches à long terme, le modèle gagne 36,5 points sur WildClawBench-MM et 22,3 points sur AgenticVBench, tout en obtenant un excellent score de 69,6 sur UniClawBench. Ses capacités fondamentales s’améliorent également de manière significative dans la compréhension audio et audiovisuelle de longs formats, le raisonnement audiovisuel, le sous-titrage audiovisuel et la reconnaissance de plusieurs locuteurs.
Par exemple, il gagne 8,3 points sur LongAudioSpan et 9,6 points sur OmniVideoBench ; ses scores CSR et ISR sur OmniCap-IF s’améliorent respectivement de 8,5 et 14,1 points ; et ses taux DER et cpWER sur AliMeeting passent de 88,11 / 89,61 à 3,35 / 17,18. En adaptant les données, le contexte et les environnements des agents, Qwen3.8-Omni-Flash atteint des performances audiovisuelles proches de celles de Gemini 3.8 Flash et des performances audio globales qui dépassent celles de Gemini 3.8 Flash. Ces avancées signifient également que l’audio et la vidéo évoluent, passant du statut d’entrées perceptuelles à celui de médias essentiels grâce auxquels les agents comprennent leur environnement, raisonnent et exécutent des tâches.
L'audio et la vidéo constituent des supports importants pour intégrer les agents dans des scénarios de productivité du monde réel, mais ils posent également une nouvelle série de défis au niveau du système. Le stockage, la transmission et le traitement des fichiers audio et vidéo de longue durée sont coûteux, notamment lors de multiples itérations d’inférence ; les frameworks existants de harnais d’agents ne prennent pas en charge nativement ces modalités ; et les workflows reliant la compréhension omnimodale à l’exécution de tâches de bout en bout en sont encore à leurs balbutiements. Pour relever ces défis, les modèles, les outils de harnais et les environnements d’exécution doivent évoluer de concert.
Pour relever ces défis, nous utilisons Qwen3.8-Omni-Flash afin d’explorer comment relier la compréhension de la source, la planification des tâches, l’exécution des outils et la livraison des résultats au sein d’un pipeline complet. Il prend en charge des flux de travail de bout en bout à long terme, tels que le montage vidéo, la traduction, le commentaire de films et la création de contenu, faisant ainsi évoluer Omni de la compréhension audiovisuelle vers l’action autonome et l’accomplissement de tâches.
À cette fin, nous avons encore étendu Qwen-MM-Plugins en y intégrant la perception à la demande, l’utilisation d’outils et l’exécution de flux de travail pour les contenus audio et vidéo de longue durée. Nous avons également open-sourcé Qwen-Live Harness en tant qu’environnement d’exécution natif pour une interaction omnimodale continue et en temps réel. Ensemble, ces éléments prennent en charge les flux de travail à long terme et l’interaction en temps réel, tout en continuant à étendre les capacités des agents omnimodaux parallèlement au modèle.
Compréhension audiovisuelle de contenus longs
Qwen3.8-Omni-Flash apporte une amélioration majeure à la compréhension audiovisuelle de contenus longs : des descriptions contrôlables et de la collecte d’éléments probants liés aux acteurs, à la compréhension des réunions et à la mise en œuvre de tâches de suivi, jusqu’à la production de rapports de recherche approfondis centrés sur la vidéo. Il ne se contente pas de traiter des contenus plus longs, mais identifie les éléments probants pertinents avec plus de précision, raisonne de manière plus approfondie et agit plus efficacement.
- Sous-titrage audiovisuel contrôlable
Il n’existe pas de réponse unique à la question de savoir comment une vidéo doit être décrite. La création de contenu privilégie le récit, la recherche d’images se concentre sur des segments spécifiques et la gestion des ressources dépend de la structure. Des applications différentes nécessitent des descriptions vidéo différentes. Dans Qwen3.8-Omni-Flash, nous avons fait évoluer le sous-titrage vidéo : il ne s’agit plus de répondre à la question « qu’est-ce que le modèle a vu ? », mais de comprendre « ce que l’utilisateur souhaite savoir ».
Les utilisateurs peuvent librement spécifier le sujet, la plage temporelle, le niveau de détail et le format de sortie. Pour une même vidéo, le modèle peut fournir un aperçu général, localiser des segments clés ou analyser en profondeur les actions des personnages, les plans de caméra, l’éclairage et le son, en produisant des résultats structurés selon les besoins. C’est vous qui définissez ce qu’il faut examiner, avec quel niveau de précision et comment le présenter.
- Compréhension audiovisuelle de longue durée par un agent
Pour les vidéos d’une durée de plusieurs heures, les approches classiques exigent que le modèle traite l’intégralité de l’enregistrement du début à la fin, même lorsque la réponse n’apparaît que dans les premières minutes de la séquence. L’agent natif Qwen3.8-Omni-Flash part de la question, décide de manière autonome ce qu’il doit regarder et écouter, puis localise les informations clés grâce à plusieurs cycles de collecte de preuves, allant du plus général au plus précis.
Sans traiter chaque image, il peut concentrer ses ressources de calcul et son budget de tokens limités sur les segments pertinents, ce qui permet une compréhension plus efficace des vidéos de longue durée. Sur OmniVideoBench, la compréhension agentique améliore la précision de 63,4 à 67,8 tout en réduisant la consommation de tokens de 145 736 à 79 117, soit une réduction d’environ 45,7 %. Le tableau ci-dessous compare la précision et la consommation de tokens de la compréhension statique et de la compréhension agentique sur OmniVideoBench :
- Réunions longues : des comptes rendus à l'action
Les réunions à plusieurs participants comptent parmi les scénarios de compréhension audiovisuelle les plus complexes : les intervenants s'expriment à tour de rôle et se coupent parfois la parole, tandis que les identités, les références et les sujets de discussion changent en permanence. Qwen3.8-Omni-Flash reconnaît simultanément les intervenants à partir des flux audio et vidéo et prend en charge nativement jusqu'à une heure d'entrée audiovisuelle. Il est capable d'effectuer de bout en bout la segmentation des intervenants, la transcription du contenu et l'alignement des identités.
À partir d’une vidéo complète de la réunion et d’une demande, le modèle peut cartographier les relations entre les participants, générer un compte-rendu de réunion, identifier les actions à mener et analyser les risques liés au projet, en utilisant les informations visuelles pour résoudre les références et les ambiguïtés d’entités présentes dans l’audio. Associé à des agents et à l’utilisation d’outils, il peut également envoyer des e-mails, organiser des tâches et même commencer à coder en réponse aux exigences de la réunion, passant ainsi de la compréhension d’une réunion à la mise en œuvre des actions qui en découlent.
- Mener des recherches approfondies à l’aide de contenus audio et vidéo
Lorsque les utilisateurs regardent une vidéo en ayant une question précise à l’esprit, la réponse va souvent au-delà de la vidéo elle-même. Qwen3.8-Omni-Flash associe les besoins de l’utilisateur au contenu vidéo afin d’identifier les questions méritant une analyse plus approfondie, d’organiser les informations clés et d’effectuer des recherches dans des sources multimodales sur le Web, notamment des images, des vidéos et des documents.
Il produit ensuite un rapport de recherche centré sur la vidéo et richement illustré, qui aide les utilisateurs à comprendre le contenu et à résoudre des problèmes concrets. Par exemple, lorsqu’un utilisateur constate l’apparition de franges de couleur autour d’un détourage de cheveux réalisé dans Photoshop, le modèle peut décomposer les étapes du tutoriel, étudier les principes qui sous-tendent les modes de fusion « Multiplier » et « Écran », comparer différentes techniques de correction des contours et expliquer quelle approche convient le mieux à la situation de l’utilisateur.
Production et montage audiovisuels
Qwen3.8-Omni-Flash fait entrer les agents audiovisuels dans une nouvelle ère : de la compréhension des sons et des images à la planification autonome, en passant par l’utilisation d’outils et la livraison de vidéos finies, il intègre l’intelligence omnimodale dans les flux de travail de production de contenus audiovisuels professionnels.
- Music2MV
Pour la création de clips musicaux (MV), Qwen3.8-Omni-Flash est capable de comprendre dans les moindres détails la structure, le rythme, l’ambiance, les voix et les changements instrumentaux d’un morceau fourni par l’utilisateur, ce qui guide la conception des personnages, des scènes et des plans. Il peut également générer des paroles ligne par ligne avec des horodatages afin de synchroniser le chant, les sous-titres et les images. Associé à des outils créatifs tels que les Qwen-MM-Plugins, le modèle prend en charge l’ensemble du flux de travail, de la compréhension musicale et de la planification créative jusqu’à la révision finale de la qualité, démontrant ainsi de solides capacités de compréhension, de raisonnement et de création audiovisuelles.
- Traduction de courts métrages
La traduction vidéo traditionnelle nécessite souvent de passer sans cesse d’une plateforme à l’autre : transcription, traduction, doublage et montage. Cela complique les appels d’API et la coordination des flux de travail, et rend difficile le maintien d’une cohérence entre les voix des personnages, la durée des dialogues et le rythme visuel. Grâce à un agent basé sur Qwen3.8-Omni-Flash, les utilisateurs peuvent décrire leurs besoins en une seule phrase pour effectuer la reconnaissance des dialogues en fonction de l’interlocuteur, la traduction conversationnelle, le clonage et le doublage des voix des personnages, le remixage audio et le contrôle qualité final. Ces étapes de localisation, qui seraient autrement fragmentées, deviennent un flux de travail complet, permettant la diffusion automatisée de courts métrages dramatiques destinés à un public international.
- Commentaire de films longs métrages
La production de vidéos de commentaire pour des longs métrages de deux ou trois heures nécessite souvent de visionner le film à plusieurs reprises et d’en reconstituer l’intrigue, avant de procéder à la sélection des plans, à la rédaction du script, à l’enregistrement de la voix off, au choix de la musique et au montage. Il s’agit d’un processus complexe et chronophage. Grâce à un agent basé sur Qwen3.8-Omni-Flash, il suffit aux utilisateurs de fournir un film et de décrire leurs exigences créatives en une seule phrase pour que l’agent se charge de la compréhension de la vidéo longue durée, de l’extraction des éléments clés de l’intrigue, de la planification du commentaire, de la production de la voix off et de la musique, du montage, du rendu et du contrôle qualité final.
L’agent est également capable d’entremêler intelligemment les dialogues originaux et les commentaires, en ajustant automatiquement le débit et le volume de la voix afin que la narration, l’audio d’origine, la musique de fond et les images s’enchaînent naturellement, créant ainsi une vidéo commentée plus authentique, immersive et cinématographique.
De l’utilisation des modèles à leur optimisation
Les applications multimodales concrètes sont souvent complexes et sensibles aux coûts, ce qui exige que les modèles trouvent un équilibre entre qualité, latence, puissance de calcul et coûts de déploiement. La personnalisation de modèles plus petits pour des scénarios spécifiques constitue donc une voie importante pour déployer des applications à grande échelle. Or, les workflows traditionnels impliquent la construction de données, le diagnostic des problèmes, plusieurs cycles d’entraînement et d’évaluation, ce qui les rend chronophages et fortement dépendants de l’expertise humaine. Cette fois-ci, nous étendons Qwen3.8-Omni-Flash au développement de modèles lui-même, en explorant une nouvelle approche dans laquelle les grands modèles pilotent la recherche et le développement tandis que les modèles plus petits répondent aux besoins métier.
Nous avons confié une tâche à Qwen3.8-Omni-Flash : améliorer la reconnaissance vocale du dialecte du Sichuan de Qwen2.5-Omni-3B en moins de 12 heures et fournir un modèle utilisable. Il a sélectionné de manière autonome l’ensemble d’évaluation WenetSpeech-Chuan, défini les critères d’évaluation et établi une référence. Il a ensuite écouté directement des échantillons audio, diagnostiqué les problèmes à l’aide des résultats de reconnaissance et construit des données d’entraînement ciblées.
Au cours de quatre séries d’expériences consécutives, l’agent a créé 3 413 exemples d’entraînement, a ajusté son approche en fonction des retours d’évaluation, a conservé les améliorations efficaces et a annulé les tentatives infructueuses. Le taux d’erreur de caractères de Qwen2.5-Omni-3B sur le même ensemble d’évaluation est finalement passé de 25,79 % à 15,30 %, soit une réduction relative d’environ 40,7 %. Cette expérience met en évidence une autre possibilité d'évolution des modèles : les modèles multimodaux polyvalents comprennent les données, planifient des expériences et pilotent les itérations, tandis que des modèles plus petits acquièrent des capacités spécialisées pour des applications spécifiques. Les agents peuvent aller au-delà de la simple utilisation de modèles pour aider à résoudre des problèmes concrets dans le monde des affaires.
Compression des informations audiovisuelles
Les contenus audio et vidéo recèlent une mine d’informations, mais leur forme linéaire et non structurée rend leur extraction et leur réutilisation difficiles. Qwen3.8-Omni-Flash analyse le contenu à travers le son, l’image et la chronologie, en utilisant un flux de travail automatisé pour extraire les informations, réorganiser leur structure et vérifier les résultats. Il transforme les connaissances fondamentales et l’expérience pratique contenues dans de longues vidéos en ressources informationnelles plus denses, plus faciles à exploiter et à réutiliser.
- Video2Note
Afin de transformer les connaissances issues des vidéos en ressources structurées, nous avons mis Video2Note en open source dans Qwen-MM-Plugins. S'appuyant sur la compréhension conjointe de la parole, des éléments visuels et des procédures offerte par Qwen3.8-Omni-Flash, cet outil organise automatiquement les connaissances, décompose les étapes clés, sélectionne des images représentatives et génère des notes au format PDF accompagnées du texte et des images correspondants. Une révision automatisée et une correction itérative permettent de condenser encore davantage des heures de vidéo en documents clairs et lisibles, faciles à consulter à nouveau.
- Omni Skill Creator
Les vidéos ne se contentent pas d’enregistrer « comment faire quelque chose », elles capturent également l’expertise pratique accumulée par les spécialistes. C’est dans cette optique que nous présentons Omni Skill Creator, une nouvelle fonctionnalité open source intégrée à Qwen-MM-Plugins. Elle permet d’extraire des procédures opérationnelles standard (SOP) à partir de démonstrations afin d’effectuer des tâches automatisées réutilisables, ou d’apprendre l’utilisation d’outils, les critères de décision et les connaissances clés à partir des instructions d’experts. Une simple démonstration devient ainsi une compétence d’agent vérifiée et évaluée, permettant de créer des compétences réutilisables et partageables à partir de contenus omnimodaux.
Interaction audiovisuelle en temps réel
Qwen3.8-Omni-Flash est conçu pour permettre une compréhension approfondie et la création à partir de contenus audiovisuels complets. Pour une interaction continue à faible latence, nous présentons également Qwen3.8-Omni-Flash-Realtime. Il perçoit et réagit tout en recevant des flux audiovisuels en direct, et utilise le contexte en temps réel pour activer des outils et exécuter des tâches, faisant ainsi passer les capacités omnimodales de la « compréhension d’un contenu » à la « participation à une interaction ».
- Pratique de l’expression orale en temps réel
La langue parlée ne dispose pas d’une entrée standard. Les accents, les substitutions de voyelles et de consonnes, ainsi que les variations tonales peuvent entraîner un écart entre la transcription mot à mot et le sens voulu. Qwen3.8-Omni-Flash-Realtime modélise conjointement la prononciation et la sémantique, comprend les expressions non standard influencées par les accents, les aligne avec les mots corrects et génère en temps réel des démonstrations de prononciation standard. Au fil de plusieurs tours d’entraînement, le modèle actualise son jugement à l’aide de nouveaux enregistrements audio, corrigeant les erreurs qui nuisent à la compréhension tout en préservant le rythme, le ton et l’émotion naturels.
- Perception audio-spatiale omnimodale
Dans les espaces réels, le son offre un axe de coordonnées supplémentaire, au-delà de la vision. Qwen3.8-Omni-Flash-Realtime combine le son spatial et les informations visuelles pour déterminer en continu la direction et la distance des sources sonores, tout en percevant les obstacles, les zones navigables et les changements dans la scène, ce qui en fait le premier modèle omnimodal capable de localiser des cibles grâce au son. Pour des instructions telles que « viens par ici » ou « va voir d’où vient ce bruit », le modèle peut isoler les voix et les sons cibles du bruit ambiant, ancrer leur signification dans l’espace environnant et faire appel à des outils pour effectuer la localisation, la recherche, la planification d’itinéraire et la navigation — depuis la détection d’une cible jusqu’à son atteinte.
- Connaissances externes pour l’interaction audiovisuelle
L’interaction en temps réel exige non seulement une faible latence, mais aussi la capacité à charger dynamiquement des connaissances et des comportements pour chaque application. Qwen3.8-Omni-Flash-Realtime prend en charge l’injection de paramètres d’identité, de styles d’expression, de connaissances métier et de règles d’interaction via les « Skills », tandis que l’utilisation d’outils étend ces capacités à l’exécution de tâches. Dans des scénarios tels que le service client, le modèle peut charger en temps réel le langage propre à la marque et les procédures de service, comprendre la parole, les éléments visuels et le contexte de l’utilisateur, générer des réponses conformes aux exigences métier et exécuter des actions. Ce même modèle en temps réel peut ainsi endosser différentes connaissances, différents rôles et différentes façons d’agir.
Résultats des tests de performance
- Omni
- Compréhension « Agentic Omni »
Les informations clés contenues dans les longs enregistrements audio et vidéo sont souvent dispersées dans différents segments, tandis que les questions complexes nécessitent plusieurs étapes de raisonnement à la fois sur le son et les images. La compréhension « Agentic Omni » permet au modèle de partir de la question, de planifier son approche, de faire appel à des outils, puis de localiser et de vérifier progressivement les éléments probants.
En concentrant le calcul sur le contenu pertinent, elle améliore la précision et l’efficacité de la compréhension audiovisuelle de longs formats. Pour évaluer cette capacité, nous comparons Qwen3.8-Omni-Flash et Gemini 3.8 Flash sur OmniVideoBench, Video-MME-v2 et LVOmniBench selon deux configurations : « Static », où le modèle interprète directement l’entrée, et un mode « agent » utilisant Qwen Code. Cette comparaison montre comment l’introduction de workflows d’agent affecte les performances de chaque modèle.
- Débit et latence
Les résultats suivants présentent le débit et la latence observés pour l'API Qwen3.8-Omni-Flash-Realtime dans différentes conditions d'entrée, reflétant ainsi les performances perçues par les utilisateurs dans les environnements de production.
Premiers pas avec Qwen3.8-Omni-Flash
- Utilisation de l'API
Qwen3.8-Omni-Flash prend officiellement en charge le paramètre reasoning_effort pour ajuster la profondeur du raisonnement et contrôler les coûts :
- xhigh (par défaut) : pour les tâches complexes...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.