# L'IA multimodale
L'IA multimodale est capable de comprendre et de traiter plusieurs formes d'entrées et de sorties de données, telles que le texte, les images et la vidéo.
17/11/2025 AI Express | Nouveautés en matière d'IA : MiroThinker Open Source, mise à jour des fonctionnalités de Gemini et Grok
L'équipe de MiroMind publie le modèle bAgent open source MiroThinker v1.0, proposant le concept de "Deep Interaction Scaling" (mise à l'échelle des interactions profondes). Google pour ...

Analyse approfondie de Baidu MuseSteamer : une nouvelle étape dans la production de vidéos d'IA domestiques
L'équipe de R&D commerciale de Baidu a lancé MuseSteamer, un macromodèle génératif multimodal, qui a obtenu la première place mondiale dans la revue vidéo générée par le graphe VBench, et a synchronisé l'audio et la vidéo en chinois...

Qwen-VLo : une version majeure de l'IA multimodale d'AliCloud
AliCloud a récemment publié son dernier modèle d'IA multimodale, Qwen-VLo, dont les capacités de génération et d'édition d'images ont été très appréciées par les utilisateurs et ont même surpassé celles de GPT-4o....

OmniGen2 : une percée dans l'IA multimodale de nouvelle génération
OmniGen2 est un modèle génératif multimodal basé sur l'architecture Qwen-VL-2.5 avec 7 milliards de paramètres, dont 3 milliards sont utilisés pour le traitement du texte et 4 milliards pour...

Google Gemini 2.5 Pro : une évolution multimodale de la vidéo aux applications interactives
Google publie la version 2.5 Pro de Gemini, une réalisation majeure dans le domaine de la compréhension multimodale et de la génération de codes. Le modèle surpasse ses concurrents Cl ...
