# マルチモーダルAI
マルチモーダルAIは、テキスト、画像、ビデオなど、複数の形式のデータの入出力を理解し、処理することができる。
今日更新0
栏目文章数:5
2025/11/17 AI Express|AIの新情報:MiroThinkerオープンソース、GeminiとGrokの機能がアップグレード
MiroMindチームがオープンソースのbAgentモデルMiroThinker v1.0をリリース、「Deep Interaction Scaling」のコンセプトを提案。グーグル ...

百度MuseSteamer徹底分析:国内AI動画生成の新たなマイルストーン
バイドゥの商用研究開発チームは、マルチモーダル生成マクロモデルであるMuseSteamerを発表し、VBenchのグラフ生成ビデオレビューで世界1位を獲得し、中国語で音声とビデオを同期させた。

Qwen-VLo:AliCloudのマルチモーダルAIのメジャーリリース
AliCloudは最近、最新のマルチモーダルAIモデル「Qwen-VLo」をリリースした。このモデルの画像生成・編集能力はユーザーから高く評価され、GPT-4oを凌ぐほどだ。 このモデルには詳細な...

オムニジェン2:次世代マルチモーダルAIのブレークスルー
OmniGen2は、Qwen-VL-2.5アーキテクチャに基づくマルチモーダル生成モデルで、70億のパラメータを持ち、そのうち30億がテキスト処理に、40億が...

Google Gemini 2.5 Pro:動画からインタラクティブアプリへのマルチモーダルな進化
Google、マルチモーダル理解とコード生成の分野で大きな成果を上げたGeminiバージョン2.5 Proをリリース。このモデルは、競合のCl ...
