L'équipe de MiroMind a publié le modèle bAgent open source MiroThinker v1.0 et a proposé le concept de "Deep Interaction Scaling" (mise à l'échelle de l'interaction profonde). Google développe un dialogue vocal multimodal et une fonction d'importation d'agents pour Gemini Enterprise.Grok fait une percée dans la technologie de génération d'images et de vidéos et publie la version 4.1 Beta.GMI annonce un investissement de 500 millions de dollars dans la construction d'un centre de données d'IA à Taïwan.
- 此摘要由AI分析文章内容生成,仅供参考。
01. l'équipe de MiroMind lance le modèle bAgent open source MiroThinker
v1.0 : La mise à l'échelle des interactions profondes mène l'évolution de l'IA
L'équipe de MiroMind lance le modèle bAgent open source MiroThinker
v1.0 : La mise à l'échelle des interactions profondes mène l'évolution de l'IA

L'équipe de MiroMind a récemment lancé un nouveau modèle de bAgent open source : le MiroThinker.
La plus grande innovation de ce modèle est l'introduction d'un nouveau concept : "l'interaction profonde".
Mise à l'échelle (mise à l'échelle interactive)".
Les modèles d'IA traditionnels suivent généralement la loi de croissance linéaire "plus la taille du modèle est grande → meilleures sont les performances", mais MiroThinker s'affranchit de ce goulot d'étranglement et souligne que "la profondeur et la fréquence des interactions du modèle avec l'environnement" constituent le facteur clé d'une croissance intelligente.
MiroThinker prend en charge de multiples interactions et raisonnements avec des outils externes (moteurs de recherche, bacs à sable Linux, reconnaissance vocale, etc.) et est capable d'utiliser ces outils de manière flexible pour obtenir des informations et accomplir des tâches. En outre, il dispose d'une longueur de contexte de 256 Ko, peut traiter et mémoriser de grandes quantités d'informations (des centaines de milliers de mots) et peut effectuer 600 appels d'outils en une seule session, ce qui permet à l'IA d'utiliser continuellement des outils externes tels que la recherche, l'exécution de code, le calcul, la traduction, etc. et d'effectuer des raisonnements complexes et des tâches de longue haleine.
Qu'est-ce que le "Deep Interaction Scaling" ?
En résumé, la performance ∝ profondeur de l'interaction modèle-environnement × fréquence de réflexion. Cela signifie que
- Plutôt que d'absorber passivement des connaissances, les modèles interagissent activement avec leur environnement ;
- Chaque essai, erreur et réflexion permet au modèle d'"évoluer" dans l'espace stratégique ;
- Plus l'IA est "pratique", plus elle peut corriger les erreurs et améliorer la qualité du raisonnement.
Tout comme les humains apprennent des choses complexes par essais et erreurs et par la pratique, lorsqu'ils apprennent à cuisiner, par exemple, il ne suffit pas de consulter une recette - il faut essayer, échouer, réparer et réessayer. Pour l'IA, de multiples cycles d'interaction avec l'environnement et de retour d'information constituent le véritable carburant de l'évolution de l'intelligence. Chaque interaction est une expérience "d'apprentissage", et l'intelligence devient de plus en plus forte.
Par conséquent, MiroThinker repousse les limites de la "longueur du contexte" et du "nombre de tours d'interaction" pour former une véritable "boucle de réflexion". "Cette boucle de réflexion permet d'améliorer l'efficacité et l'intelligence du traitement des tâches.
---

Aux dernières nouvelles, Google travaille sur une fonctionnalité en temps réel appelée Agentspace pour Gemini Enterprise. Cette fonctionnalité offrira une expérience vocale multimodale qui permettra aux utilisateurs d'engager des conversations vocales avec des agents.
Il a été révélé qu'Agentspace ne prendra pas seulement en charge le dialogue vocal, mais pourra également intégrer d'autres méthodes d'interaction, telles que la saisie de texte et la reconnaissance d'images, afin d'offrir une expérience utilisateur plus complète. En outre, Gemini Enterprise introduira également des pages d'accueil personnalisées "recommandées pour vous" afin d'améliorer encore l'expérience de l'utilisateur.
Le lancement de ces nouvelles fonctionnalités témoigne de la poursuite de l'innovation et des avancées technologiques de Google dans le domaine des applications d'entreprise. En intégrant des technologies multimodales et des systèmes de recommandation personnalisés, Google vise à fournir des services plus intelligents, plus efficaces et plus pratiques aux utilisateurs professionnels.
---

Google en développe un nouveau pour Gemini EnterpriseFonction d'importation d'agentspermettant aux utilisateurs d'intégrer des agents externes dans leurs propres flux de travail multi-agents. L'introduction de cette fonctionnalité améliorera considérablement la flexibilité et l'évolutivité de Gemini Enterprise, permettant aux utilisateurs de mieux gérer et coordonner de multiples tâches d'automatisation.
En outre, Google a lancéOutil d'évaluation des agentsqui aide les utilisateurs à tester et à optimiser les performances de leurs agents. La nouvelle version prendra également en chargeexécution programméeles utilisateurs peuvent définir un moment précis pour déclencher la tâche afin d'améliorer l'efficacité du travail.
La mise à jour comprend également une série de nouveaux connecteurs qui enrichissent encore les capacités d'intégration de Gemini Enterprise. Ces nouveaux connecteurs aideront les organisations à interagir plus facilement avec une variété de services et de systèmes tiers, permettant des flux de travail plus efficaces.
Avec ces nouvelles fonctionnalités, Google vise à fournir aux utilisateurs une solution d'automatisation plus complète et plus puissante qui améliore l'efficacité opérationnelle et la compétitivité des entreprises.
---

Kosmos est un outil révolutionnaire pour les scientifiques de l'IA, capable d'effectuer en une seule fois la quantité de recherche qu'un scientifique humain ferait en 6 mois environ :
- Lire et intégrer des milliers d'articles scientifiques ;
- Exécuter automatiquement le code d'analyse des données ;
- Établir des hypothèses, valider des expériences et rédiger des rapports de recherche ;
- Même la reproduction ou la découverte de nouvelles recherches scientifiques.
Les contextes ultra-longs sont la clé de son fonctionnement continu, et Kosmos peut maintenir une cohérence logique sur une étendue de plus de 10 millions de mots, en extrayant des connaissances de milliers d'articles et de dizaines de milliers de lignes de code d'analyse.
Le cœur de l'innovation est constitué par les modèles mondiaux structurés (SWM). Les outils scientifiques traditionnels de l'IA utilisent un mode de pensée linéaire, entrée-analyse-sortie. Kosmos, en revanche, introduit un cadre plus proche de la pensée scientifique humaine, à savoir les modèles structurés du monde. Cela signifie que Kosmos peut construire un graphe de connaissances en "mémoire", intégrant des informations provenant de centaines de trajectoires de raisonnement autonomes pour former un modèle du monde dynamique et itératif d'un objectif scientifique spécifique.
Par exemple, si l'objectif de l'étude est de "comprendre les mécanismes de la dégénérescence neuronale dans la maladie d'Alzheimer", le Kosmos sera utilisé :
- Recherche d'articles pertinents (environ 1500)
- Extraction de données protéomiques, génétiques et unicellulaires à partir de bases de données accessibles au public
- Exécuter automatiquement plus de 42 000 lignes de code d'analyse
- Raisonner sur les voies moléculaires critiques et produire des rapports avec des citations
Kosmos peut analyser des dizaines de millions de jetons, bien au-delà de la "limite de mémoire" des LLM existants. Cette technologie permet non seulement d'améliorer l'efficacité de la recherche, mais aussi d'offrir aux scientifiques de nouvelles perspectives de recherche.
---

Aux dernières nouvelles, Google travaille sur un système d'intelligence artificielle conçu pour aider les utilisateurs à affiner leurs idées de recherche par le biais d'un mécanisme d'évaluation de type tournoi. Chaque course dure environ 40 minutes et peut générer 100 idées détaillées pour un sujet de recherche donné.
Sur la plateforme Gemini Enterprise, Google développe deux nouvelles capacités de multi-intelligence :">Génération d'idées - Créer un corps multi-intelligent Session d'innovation".Partenaires en science - Faire progresser les nouvelles découvertes scientifiques avec les partenaires scientifiques".
- Expliquez votre programme de recherche, indiquez les données pertinentes et définissez des critères d'évaluation pour vos partenaires scientifiques.
- Un ensemble d'intelligences générera pour vous des idées de recherche sur la base des données disponibles.
- L'Intelligence Society évaluera et classera ces idées en fonction de vos critères, dans le cadre d'un tournoi.
Non seulement cette technologie automatise le processus de recherche scientifique, mais elle fournit également aux entreprises et aux particuliers des outils puissants qui leur permettent d'innover plus efficacement.
Ce développement marque une nouvelle étape dans la recherche scientifique qui améliorera considérablement l'efficacité de la recherche et l'innovation.
---

MISE À JOUR : La plateforme AI Studio a ajouté un nouvel outil d'incitation Gemini 3. Les préparatifs sont en cours.
Pour les Gémeaux 3.Meilleurs résultats avec le réglage par défaut de 1,0. La diminution de cette valeur peut affecter les performances de l'inférence.
Cette mise à jour est conçue pour aider les développeurs et les chercheurs à mieux utiliser la puissance de Gemini 3 afin d'améliorer les performances de leurs modèles dans une variété de tâches. Par exemple, dans des domaines tels que le traitement du langage naturel, la reconnaissance d'images et la synthèse vocale, Gemini 3 peut fournir des résultats plus précis.
- **Traitement du langage naturel** : améliorer la génération et la compréhension de textes.
- **Reconnaissance d'images** : amélioration de la classification des images et de la précision de la détection des cibles.
- **Synthèse vocale** : améliore la qualité et le naturel de la parole.
En optimisant ces paramètres, l'utilisateur peut mieux contrôler le comportement du modèle, ce qui permet d'obtenir de meilleurs résultats dans les applications pratiques.
Pour des informations plus détaillées, veuillez vous référer à la documentation officielle.
---

Récemment, une vidéo d'anime générée par Grok a attiré beaucoup d'attention sur l'internet. Dans cette vidéo, les détails de l'interaction entre les mains du personnage et les ustensiles et la nourriture sont à peine perceptibles, seuls les mouvements sont légèrement rigides.
Grok Imagine est capable de générer des scènes de cuisine qui ressemblent au style classique des animés des années 1990, présentées dans un style ASMR qui est relaxant et agréable.Certaines actions apparemment simples (comme couper des carottes, pétrir de la pâte, battre des œufs, remuer ou frire) qui auraient été difficiles à réaliser il n'y a pas si longtemps sont aujourd'hui parfaitement exécutées.
Cependant, la vidéo a également suscité une certaine controverse. Certains spectateurs ont fait part de leurs réactions négatives et ont même lancé des jurons, estimant que l'IA copiait le travail de Miyazaki et que les personnages manquaient d'âme. Cela a déclenché un débat sur le rôle et les limites de l'IA dans la création artistique.
- **Avancées technologiques** : l'IA est de plus en plus utilisée dans la production d'animations et les détails techniques ne cessent de s'améliorer.
- **Controverse artistique** : certains spectateurs ont estimé que l'œuvre générée par l'IA manquait d'âme et ont remis en question sa valeur artistique.
- **Perspectives d'avenir** : malgré la controverse, le potentiel de l'IA dans la production d'animations est énorme, et d'autres applications innovantes sont probables à l'avenir.
---

GMI a récemment annoncé qu'elle investirait 500 millions de dollars dans un centre de données d'IA à haute densité à Taïwan. Ce centre de données sera équipé de 7 000 GPU NVIDIA Blackwell GB300 répartis sur 96 racks et devrait pouvoir traiter près de 2 millions de jetons par seconde. Cette installation devrait être opérationnelle d'ici mars 2026.

Le centre de données devrait consommer environ 16 mégawatts d'électricité. GMI a également révélé qu'elle prévoyait de construire une nouvelle installation de 50 mégawatts aux États-Unis pour répondre à la demande croissante.
Les principales caractéristiques sont les suivantes :
- 96 casiers
- Traite près de 2 millions de jetons par seconde
- Demande d'électricité d'environ 16 MW
- Mise en service prévue en mars 2026
La construction de ces installations ne démontre pas seulement l'investissement important de GMI dans l'infrastructure de l'IA, mais reflète également la demande mondiale croissante de ressources informatiques à haute performance. Avec le développement rapide de la technologie de l'IA, ces types de centres de données deviendront une infrastructure importante pour stimuler l'innovation et l'adoption technologiques.
---

Grok a réalisé des progrès impressionnants dans le domaine de la génération d'images et de vidéos. Ses dernières réalisations technologiques ont permis d'obtenir des résultats étonnants, non seulement en termes de qualité des images et des vidéos générées, mais aussi en termes de vitesse de génération.
Grok utilise des modèles de réseaux neuronaux avancés tels que Transformer et GAN (Generative Adversarial Networks) pour réaliser un compositing d'images et de vidéos de haute qualité.
Large éventail de scénarios d'applicationL'application de ces technologies peut grandement améliorer l'efficacité de la création de contenu et offrir aux créateurs davantage de possibilités. L'application de ces technologies peut grandement améliorer l'efficacité de la création de contenu et offrir davantage de possibilités aux créateurs.
Vidéo de @Diesol montrant les dernières nouveautés de Grok :
---

Mise à jour : Grok 4.1 Beta est maintenant officiellement disponible sur le site web de Grok. Dans cette mise à jour, Grok 4.1 Beta est disponible en tant qu'option autonome parallèlement au mode Grok 4 existant.
Grok est un puissant outil de développement conçu pour aider les développeurs à écrire et à déboguer le code plus efficacement. La nouvelle version apporte de nouvelles améliorations aux fonctionnalités et aux performances de Grok. Les utilisateurs ont désormais la possibilité de tester Grok 4.1 Beta pour découvrir les dernières améliorations et optimisations.
Les principales caractéristiques sont les suivantes :
- L'éditeur de code a été amélioré pour prendre en charge davantage de langages de programmation
- Outils de débogage améliorés avec des messages d'erreur plus détaillés
- Interface utilisateur optimisée pour améliorer l'expérience de l'utilisateur
Les développeurs peuvent se rendre ici pour plus de détails et pour commencer à tester Grok 4.1 Beta.


评论功能已关闭。