# Multimodale KI
Multimodale KI ist in der Lage, mehrere Formen der Dateneingabe und -ausgabe zu verstehen und zu verarbeiten, z. B. Text, Bilder und Video.
17.11.2025 AI Express | Neues aus der KI: MiroThinker Open Source, Gemini und Grok Funktionserweiterungen
Das MiroMind-Team veröffentlicht das quelloffene bAgent-Modell MiroThinker v1.0 und schlägt das Konzept der "Deep Interaction Scaling" vor. Google für ...

Eingehende Analyse von Baidu MuseSteamer: ein neuer Meilenstein in der heimischen KI-Videoerzeugung
Das kommerzielle Forschungs- und Entwicklungsteam von Baidu hat MuseSteamer, ein multimodales generatives Makromodell, auf den Markt gebracht, das den weltweit ersten Platz in der graphengenerierten Videoprüfung VBench erreicht hat und Audio und Video auf Chinesisch synchronisiert...

Qwen-VLo: Eine wichtige Neuerung in der multimodalen KI von AliCloud
AliCloud hat vor kurzem sein neuestes multimodales KI-Modell, Qwen-VLo, veröffentlicht, dessen Bilderzeugungs- und -bearbeitungsfähigkeiten von den Nutzern hoch bewertet wurden und sogar GPT-4o übertrafen...

OmniGen2: ein Durchbruch für die nächste Generation multimodaler KI
OmniGen2 ist ein multimodales generatives Modell auf Basis der Qwen-VL-2.5 Architektur mit 7 Milliarden Parametern, von denen 3 Milliarden für die Textverarbeitung und 4 Milliarden für die...

Google Gemini 2.5 Pro: eine multimodale Entwicklung von Video zu interaktiven Anwendungen
Google veröffentlicht Gemini Version 2.5 Pro, eine große Errungenschaft im Bereich des multimodalen Verstehens und der Codegenerierung. Das Modell übertrifft Wettbewerber Cl ...
