Le 25 mai 2025, Google a publié trois variantes du modèle Gemma couvrant les domaines de la médecine, de la langue des signes et de la langue des dauphins. Le projet open-source AgenticSeek lancé sur GitHub fournit un système d'agent intelligent localisé. La bibliothèque UQLM détecte les grandes illusions de modèle pour améliorer la fiabilité de l'IA. En outre, Langflow prend en charge le développement de l'IA sans code, SeleniumBase simplifie les tests Web, la fonctionnalité ChatGPT s'étend à Box et Dropbox, Notepad et des outils de dessin pour ajouter de nouvelles fonctions d'IA.
- 此摘要由AI分析文章内容生成,仅供参考。

Langflow est un puissant outil de visualisation permettant de construire et de déployer des agents et des flux de travail basés sur l'IA sans écrire de code.
L'outil prend en charge tous les principaux modèles de langage à grande échelle (LLM) et les bases de données vectorielles, offrant ainsi une grande flexibilité aux développeurs. Grâce à une interface intuitive de type "glisser-déposer", les utilisateurs peuvent facilement créer des scénarios d'application d'IA complexes couvrant un large éventail de domaines, du service à la clientèle à la prise de décision automatisée.
Les principaux atouts de Langflow sont les suivants
- Entièrement open source avec plus de 62 000 étoiles de support.
- Il prend en charge plusieurs piles technologiques courantes afin d'assurer une intégration transparente avec les systèmes existants.
- Fournit de riches composants prédéfinis pour accélérer le processus de développement.
Langflow est certainement une option à considérer pour les entreprises et les particuliers qui cherchent à mettre en œuvre rapidement des solutions d'IA.
Lien vers le projet : https://t.co/v3Gv4smWbv
---

L'utilisation infinie des outils est une idée qui donne à réfléchir.
Avec seulement "l'utilisation complète des outils" et seulement 8 outils internes, openai o3 rend déjà le travail quotidien plus efficace. Si cette vision se concrétise à l'avenir, son potentiel est illimité.
Proposition de baseC'est le modèle idéal de grand langage (LLM) qui ne produit que des appels d'outils et leurs paramètres pendant le raisonnement ou la rédaction ; tous les états concrets (par exemple, les mémoires, les brouillons, les produits intermédiaires, les objectifs, etc. De cette manière, le modèle est responsable du raisonnement immédiat et l'outil est responsable des états de tâches persistants et structurés, ce qui permet une division du travail et une complémentarité entre les deux.
**Pourquoi une "instrumentalisation infinie" ? **
- Intelligence externalisée : le fait de confier des opérations complexes à des processus efficaces et spécifiques à un domaine réduit considérablement la pression exercée par la fenêtre contextuelle et améliore la qualité des résultats.
- Oubli explicite et retour en arrière : grâce aux outils d'édition, les modèles peuvent être supprimés et affinés par couches à tout moment sans avoir à générer positivement de longs textes en une seule fois, ce qui réduit l'accumulation d'erreurs.
Les **exemples de scénarios** comprennent :
- Rédaction/édition de texte : l'écriture humaine est souvent de type "saut-retour" ; avec un éditeur de texte complet, les LLM peuvent alterner entre plusieurs niveaux de granularité comme le font les humains, en évitant les limites de l'écriture "en avant une fois".
- Génération 3D : grâce aux bibliothèques CAO, aux outils de visualisation/rotation et aux fichiers de notes, les modèles peuvent être façonnés de manière itérative en objets 3D à n'importe quelle échelle, plutôt que d'être contraints par un contexte de voxels fixes.
- Compréhension des vidéos de longue durée : le modèle peut "regarder" des clips de manière répétée, enregistrer/éditer des notes et analyser des heures, voire des jours de vidéo dans une fenêtre limitée.
En outre, l'instrumentation infinie présente des avantages en termes de sécurité et d'interprétabilité. Le contrôle complet des versions et les trajectoires d'édition sont visibles à la fois par les humains et par les modèles, ce qui rend l'usurpation potentielle plus coûteuse en termes de "budget d'inférence" et accroît la crédibilité et la vérifiabilité des résultats.
**Idées de formation** s'appuie fortement sur l'apprentissage par renforcement pour entraîner le modèle à apprendre à planifier et à corriger dans l'espace de l'outil. Le contexte du modèle étant limité, il est possible de le généraliser à des contextes "infinis" pour autant qu'il puisse être récupéré et modifié à partir de différents points de départ.
**Le concept architectural** favorise les structures à budget d'inférence constant ou plafonné, par exemple l'attention à fenêtre glissante, le SSM, le RWKV, Mamba, etc., et encourage l'"oubli" pour promouvoir la séparation des rôles et des outils. Les auteurs proposent un concept "hybride inversé" : une couche locale d'attention à fenêtre glissante de haute précision, suivie d'une couche de SSM à longue portée, afin d'obtenir une double perspective macro + micro.
L'utilisation d'outils est actuellement disponible dans o3, Agentic RAG, etc., mais reste limitée à des contextes courts et à des processus partiels. Les auteurs appellent à ce que toutes les interactions avec le monde extérieur se fassent par le biais d'outils, et à évoluer vers un véritable "outillage infini" en utilisant un modèle de stockage bon marché + coûts de raisonnement limités.
---

Récemment, Google a lancé trois variantes basées sur le modèle Gemma :MedGemmaetSignGemmarépondre en chantantDolphinGemma. Ces modèles sont optimisés pour différents scénarios d'application.
MedGemma est un modèle conçu pour le domaine médical et est proposé en deux versions :
- Modèle multimodal 4B : ce modèle est capable de traiter des tâches combinant images et texte et convient particulièrement aux données médicales. Il a été pré-entraîné pour les radiographies du thorax, les images dermatologiques, les images ophtalmologiques et les diapositives pathologiques.
- Modèle de raisonnement textuel 27B : cette version possède des capacités de traitement de texte brut plus puissantes et convient aux tâches de raisonnement approfondi. Elle est également pré-entraînée pour les textes médicaux et les données d'image, couvrant un large éventail de données médicales telles que les images radiologiques, les diapositives pathologiques, les images ophtalmologiques, les images dermatologiques, etc.
SignGemma, quant à lui, est un modèle d'interprète en langue des signes qui prend en charge plusieurs langues et permet la conversion de la langue des signes en texte ou en parole, ce qui améliore considérablement l'efficacité de la communication de la communauté sourde.
DolphinGemma est un modèle de synthèse sonore unique qui se concentre sur la génération de sons de dauphins. Ce modèle a des applications potentielles dans la recherche et la conservation de la vie marine.
Le lancement de ces trois modèles démontre non seulement la force technique de Google dans le domaine de l'intelligence artificielle, mais favorise également l'innovation et le développement dans des domaines connexes.
---

Sur GitHub, une organisation appeléeAgenticSeekLe projet open source a attiré beaucoup d'attention. Il propose un système d'agents intelligents localisés 100% destiné à remplacer Manus AI.
Basé sur des modèles d'inférence locale et sur la technologie des agents intelligents, AgenticSeek est capable de naviguer de manière autonome sur le web, d'écrire du code, de planifier des tâches et de prendre en charge des fonctions d'interaction vocale, offrant ainsi aux utilisateurs une expérience similaire à celle de Jarvis dans les films Iron Man.
- Fonctionnement entièrement localisé :Toutes les données sont conservées sur l'appareil, sans aucune dépendance à l'égard du cloud.
- Navigation web intelligente :Rechercher automatiquement des informations et remplir des formulaires.
- Assistant de programmation autonome :Prise en charge de Python, C, Go, Java et de nombreux autres langages.
- Système de sélection d'agents intelligents :Correspond automatiquement au traitement de la tâche la plus appropriée.
- Caractéristiques de l'interaction vocale :Prise en charge de la saisie vocale et de la synthèse vocale.
- Exécution d'une planification de mission complexe :Capacité à décomposer des tâches importantes en étapes à franchir.
AgenticSeek fournit un tutoriel d'installation et de configuration détaillé, et il est recommandé d'utiliser au moins des modèles avec des paramètres DeepSeek de 14B ou plus, ce qui nécessite une certaine performance de l'ordinateur. Pour les développeurs et les chercheurs, AgenticSeek est un outil précieux qui peut grandement améliorer l'efficacité du travail et protéger la confidentialité des données.
---

Lors de l'écriture de scripts d'automatisation à l'aide de Selenium, les développeurs rencontrent souvent des problèmes de synchronisation du chargement des éléments qui entraînent l'échec des tests. En outre, la gestion manuelle des différents pilotes de navigateur peut s'avérer une tâche fastidieuse et sujette aux erreurs.
Pour relever ces défis.SeleniumBaseest né. Il s'agit d'un puissant framework basé sur Python, conçu pour simplifier le processus d'automatisation des tests web. Il rend les opérations complexes du navigateur simples et fiables en encapsulant profondément Selenium avec plusieurs utilitaires intégrés.
Les principales caractéristiques de SeleniumBase sont les suivantes :
- Mécanisme d'attente intelligent pour résoudre automatiquement le problème de l'instabilité du chargement des pages ;
- Support d'une variété de méthodes d'écriture, telles que l'héritage de la classe BaseCase et le gestionnaire de contexte SB, pour répondre aux différents besoins de développement ;
- Le mode furtif UC Mode permet de contourner les détections anti-crawl telles que Cloudflare et d'améliorer la réussite des tests ;
- Générer automatiquement des rapports de test détaillés et des tableaux de bord en temps réel, en visualisant les résultats des tests pour la collaboration de l'équipe et le suivi des problèmes ;
- Gestion automatique des pilotes de navigateur sans intervention manuelle, ce qui réduit les coûts de maintenance.
Pour les professionnels impliqués dans le développement ou le test d'applications web, SeleniumBase permet d'augmenter significativement la productivité et de réduire les erreurs causées par des environnements mal configurés.
Adresse du projet GitHub : https://github.com/seleniumbase/SeleniumBase
---

L'open source de Microsoft sur GitHubProjet QlibQlib, probablement la plateforme d'investissement quantitatif en IA la plus complète du secteur à l'heure actuelle, a gagné plus de 20 000 étoiles à l'heure actuelle. Basé sur un puissant moteur de traitement des données et une riche bibliothèque de modèles, Qlib couvre une variété de paradigmes tels que l'apprentissage supervisé, l'apprentissage par renforcement, etc., aidant les développeurs à construire rapidement un processus de recherche quantitative complet, de l'idée à la production.
Les principales caractéristiques de Qlib sont les suivantes
- Des serveurs de données efficaces qui traitent des dizaines de fois plus rapidement que les bases de données traditionnelles ;
- Intégration de plus de 30 modèles de quantification de pointe, notamment Transformer, LSTM, LightGBM, etc ;
- Les stratégies de négociation fondées sur l'apprentissage par renforcement sont prises en charge et permettent de modéliser des processus continus de prise de décision en matière d'investissement ;
- Couvrant l'ensemble de la chaîne d'investissement : analyse factorielle, modélisation du risque, optimisation du portefeuille, exécution des ordres ;
- Fournir l'outil de recherche automatisé qrun, qui permet de compléter en un seul clic l'ensemble du processus, de la modélisation au backtesting ;
- Permet l'adaptation dynamique du marché et le traitement de la dérive des concepts afin d'améliorer la stabilité du modèle.
Qlib fournit non seulement des tutoriels détaillés pour le déploiement et l'installation, mais il est également particulièrement adapté aux développeurs qui souhaitent travailler dans le domaine de l'IA financière pour la recherche et l'apprentissage.
Qlib est un outil précieux pour les sociétés fintech et les investisseurs individuels afin de mieux comprendre et d'appliquer la technologie de l'IA à des scénarios réels sur les marchés financiers.
---

UQLM est une bibliothèque permettant de détecter les illusions dans les grands modèles de langage (LLM), en quantifiant l'incertitude grâce à de multiples méthodes de notation. Cette technique est essentielle pour améliorer la fiabilité et la précision des applications d'intelligence artificielle.
L'UQLM s'intègre de manière transparente à la plateforme LangChain, ce qui permet aux développeurs de créer et de déployer plus facilement des applications d'IA plus fiables. La bibliothèque prend en charge diverses méthodes de notation, notamment les méthodes basées sur les probabilités, les méthodes basées sur le calibrage et les méthodes basées sur la confiance.
scénario d'application: :
- Détection d'erreurs dans les tâches de traitement du langage naturel (NLP)
- Fiabilité accrue des chatbots et des assistants virtuels
- Contrôle de la qualité de la génération automatique de textes
L'émergence de l'UQLM fournit un outil puissant pour résoudre le problème de l'incertitude et de l'illusion dans les modèles d'IA dans les applications pratiques, et contribue à promouvoir le développement de la technologie de l'IA.
Pour plus d'informations, veuillez consulter : Site officiel de l'UQLM
---

Cela fait seulement quatre jours que Google a dévoilé le Veo 3, et le nouveau produit fait déjà beaucoup parler de lui dans le monde entier.
Les utilisateurs créent déjà des contenus incroyables avec Veo 3. Voici 13 de ces exemples étonnants :
- Personnages d'IA conscients d'eux-mêmes : ces personnages sont capables de s'auto-apprendre et d'évoluer, ce qui leur confère des capacités d'interaction sans précédent.
La technologie révolutionnaire de Veo 3 ne révolutionne pas seulement les effets visuels, mais révèle également de nouvelles possibilités dans le domaine de l'intelligence artificielle et de l'apprentissage automatique. La disponibilité de cet outil permet aux créateurs d'exprimer leur créativité de manière inédite, qu'il s'agisse de développement de jeux, de réalité virtuelle ou de production cinématographique.
scénario d'applicationY compris, mais sans s'y limiter :
- Des PNJ (personnages non joueurs) très intelligents dans le développement de jeux vidéo
- Interaction immersive dans les expériences de réalité virtuelle
- Génération de personnages réalistes pour les effets cinématographiques
Comme de plus en plus d'utilisateurs commencent à explorer les caractéristiques du Veo 3, il y a des raisons de croire que ce produit continuera à être à la pointe de l'innovation pour les années à venir.
---

Les applications classiques Notepad et Paint de Microsoft ont récemment été dotées de nouvelles fonctionnalités alimentées par l'intelligence artificielle (IA) qui offrent aux utilisateurs davantage de créativité et de gains d'efficacité.
Le Bloc-notes intègre désormais un assistant IA appelé "Write" pour générer et optimiser le contenu des textes. Cette fonctionnalité permet non seulement aux utilisateurs de rédiger des documents rapidement, mais aussi d'améliorer la qualité et l'efficacité de l'écriture grâce au traitement du langage naturel.
PeintureLa nouvelle fonction "AI Stickers" permet aux utilisateurs de générer automatiquement des autocollants personnalisés à partir d'une simple saisie ou d'un croquis. Cette fonction utilise la reconnaissance d'images et la génération de modèles pour permettre aux utilisateurs de réaliser rapidement leurs idées et de les personnaliser en fonction de leurs besoins.
L'outil de découpe a également été amélioré avec une fonction "Capture d'écran parfaite" qui optimise automatiquement la qualité des captures d'écran et un sélecteur de couleurs intégré pratique qui facilite la sélection et l'utilisation des couleurs dans les captures d'écran.
Ces nouvelles fonctionnalités améliorent non seulement l'expérience de l'utilisateur, mais démontrent également le potentiel de la technologie de l'IA à être largement utilisée dans les applications quotidiennes.
---

Une nouvelle très intéressante pour les utilisateurs professionnels et personnels : il est désormais possible de connecter les comptes Box et Dropbox à la fonction de recherche approfondie de ChatGPT. Cette nouvelle fonctionnalité permet aux utilisateurs d'accéder aux fichiers et aux données stockés dans Box et Dropbox directement lors de l'utilisation de ChatGPT.
Grâce à cette intégration, les utilisateurs peuvent plus facilement exploiter les puissantes capacités de traitement du langage naturel de ChatGPT pour analyser, résumer et extraire des données stockées dans le nuage. Ceci est particulièrement utile pour les professionnels qui ont besoin d'effectuer des analyses de texte et des recherches approfondies.
Les scénarios d'application sont les suivants :
- Étude de marché
- Analyse de la littérature académique
- Gestion des documents internes
Cette intégration transparente permet non seulement d'améliorer la productivité, mais aussi d'offrir aux utilisateurs une nouvelle perspective sur l'analyse des données.
Grâce à cette fonctionnalité, les entreprises et les particuliers peuvent mieux gérer et utiliser leurs ressources en données. Pour plus de détails, veuillez consulter le site :https://t.co/owNtgrPSV8


评论功能已关闭。