# IA multimodal
La IA multimodal es capaz de comprender y procesar múltiples formas de entrada y salida de datos, como texto, imágenes y vídeo.
17/11/2025 AI Express | Novedades en IA: MiroThinker Open Source, Gemini y Grok Actualizaciones de funciones
El equipo MiroMind lanza el modelo bAgent de código abierto MiroThinker v1.0, proponiendo el concepto de "Escalado de Interacción Profunda". Google para ...

Análisis en profundidad de Baidu MuseSteamer: un nuevo hito en la generación doméstica de vídeos con IA
El equipo de I+D comercial de Baidu lanzó MuseSteamer, un macromodelo generativo multimodal, que logró el primer puesto mundial en la revisión de vídeo generado por gráficos VBench, y sincronizó audio y vídeo en chino....

Qwen-VLo: un gran avance en IA multimodal de AliCloud
AliCloud acaba de lanzar su último modelo de IA multimodal, Qwen-VLo, cuyas capacidades de generación y edición de imágenes han sido muy bien valoradas por los usuarios, superando incluso a GPT-4o. El modelo tiene detalles...

OmniGen2: un gran avance en la IA multimodal de nueva generación
OmniGen2 es un modelo generativo multimodal basado en la arquitectura Qwen-VL-2.5 con 7.000 millones de parámetros, de los cuales 3.000 millones se utilizan para el procesamiento de texto y 4.000 millones para...

Google Gemini 2.5 Pro: una evolución multimodal del vídeo a las aplicaciones interactivas
Google lanza la versión 2.5 Pro de Gemini, un gran logro en el campo de la comprensión multimodal y la generación de código. El modelo supera al competidor Cl...
