# IA multimodal
A IA multimodal é capaz de compreender e processar múltiplas formas de entradas e saídas de dados, como texto, imagens e vídeo.
17/11/2025 AI Express | Novidades em IA: código aberto do MiroThinker, atualizações de recursos do Gemini e do Grok
A equipa MiroMind lança o modelo bAgent de código aberto MiroThinker v1.0, propondo o conceito de "Deep Interaction Scaling". Google para ...

Análise aprofundada do Baidu MuseSteamer: um novo marco na produção nacional de vídeos com IA
A equipa comercial de I&D da Baidu lançou o MuseSteamer, um macromodelo generativo multimodal, que alcançou o primeiro lugar mundial na análise de vídeos gerados por gráficos VBench e sincronizou áudio e vídeo em chinês...

Qwen-VLo: Um grande lançamento em IA multimodal da AliCloud
A AliCloud lançou recentemente o seu mais recente modelo de IA multimodal, o Qwen-VLo, cujas capacidades de geração e edição de imagens foram muito bem avaliadas pelos utilizadores, tendo mesmo ultrapassado o GPT-4o. O modelo tem...

OmniGen2: um avanço na IA multimodal da próxima geração
O OmniGen2 é um modelo generativo multimodal baseado na arquitetura Qwen-VL-2.5 com 7 mil milhões de parâmetros, dos quais 3 mil milhões são utilizados para o processamento de texto e 4 mil milhões para...

Google Gemini 2.5 Pro: uma evolução multimodal do vídeo para aplicações interactivas
A Google lança a versão 2.5 Pro do Gemini, uma grande conquista no domínio da compreensão multimodal e da geração de código. O modelo ultrapassa o concorrente Cl ...
