A equipa MiroMind lançou o modelo bAgent de código aberto MiroThinker v1.0 e propôs o conceito de "Deep Interaction Scaling". A Google desenvolve o diálogo de voz multimodal e a função de importação de agentes para a Gemini Enterprise. A Grok faz um avanço na tecnologia de geração de imagens e vídeos e lança a versão 4.1 Beta. A GMI anuncia um investimento de 500 milhões de dólares na construção de um centro de dados de IA em Taiwan.
- 此摘要由AI分析文章内容生成,仅供参考。
01. A equipa MiroMind lança o modelo bAgent de código aberto MiroThinker
v1.0: A escala de interação profunda lidera a evolução da IA
A equipa MiroMind lança o modelo bAgent de código aberto MiroThinker
v1.0: A escala de interação profunda lidera a evolução da IA

A equipa MiroMind lançou recentemente um novo modelo bAgent de código aberto: o MiroThinker
A maior inovação deste modelo é a introdução de um novo conceito: "interação profunda".
Escalonamento (Escalonamento interativo)".
Os modelos tradicionais de IA seguem normalmente a lei de crescimento linear de "quanto maior for o tamanho do modelo → melhor será o desempenho", mas o MiroThinker rompe este obstáculo e sublinha que "a profundidade e a frequência das interações do modelo com o ambiente" são o fator-chave para um crescimento inteligente.
O MiroThinker suporta múltiplas interações e raciocínios com ferramentas externas (por exemplo, motores de pesquisa, sandboxes Linux, reconhecimento de voz, etc.) e é capaz de utilizar estas ferramentas de forma flexível para obter informações e concluir tarefas. Além disso, tem um comprimento de contexto de 256K, pode processar e recordar grandes quantidades de informação (centenas de milhares de palavras) e pode efetuar 600 chamadas de ferramentas numa única sessão, permitindo à IA utilizar continuamente ferramentas externas, como a pesquisa, a execução de código, a computação, a tradução, etc., e efetuar raciocínios complexos e tarefas de longa duração.
O que é o "Deep Interaction Scaling"?
Em suma, o desempenho ∝ profundidade da interação modelo-ambiente × frequência da reflexão. Isto significa que:
- Em vez de absorverem passivamente o conhecimento, os modelos interagem ativamente com o seu ambiente;
- Cada tentativa, erro e reflexão permite que o modelo "evolua" no espaço estratégico;
- Quanto mais "prática" for a IA, mais ela pode corrigir erros e melhorar a qualidade do raciocínio.
Tal como os seres humanos aprendem coisas complexas através de tentativa e erro e da prática, quando aprendem a cozinhar, por exemplo, não basta olhar para uma receita - é preciso tentar, falhar, corrigir e tentar novamente. Para a IA, várias rondas de interação ambiental + feedback = o verdadeiro combustível para a evolução da inteligência. Cada interação é uma experiência de "aprendizagem" e a inteligência torna-se cada vez mais forte.
Como resultado, o MiroThinker ultrapassa os limites do "comprimento do contexto" e do "número de rondas de interação" para formar um verdadeiro "circuito de pensamento". "para um processamento de tarefas mais eficiente e inteligente.
---

Nas últimas notícias, a Google está a trabalhar numa funcionalidade em tempo real chamada Agentspace para o Gemini Enterprise. Esta funcionalidade irá proporcionar uma experiência de voz multimodal que permitirá aos utilizadores participar em conversas de voz com agentes.
Foi revelado que o Agentspace não só suportará o diálogo por voz, como também poderá integrar outros métodos de interação, como a introdução de texto e o reconhecimento de imagens, para proporcionar uma experiência de utilizador mais abrangente. Além disso, a Gemini Enterprise irá também introduzir páginas de entrada personalizadas "Recomendadas para si" para melhorar ainda mais a experiência do utilizador.
O lançamento destas novas funcionalidades significa a inovação contínua e os avanços tecnológicos da Google no espaço das aplicações empresariais. Ao integrar tecnologias multimodais e sistemas de recomendação personalizados, a Google pretende fornecer serviços mais inteligentes, eficientes e convenientes aos utilizadores empresariais.
---

A Google está a desenvolver um novo sistema para a Gemini EnterpriseFunção de importação de agentespermitindo aos utilizadores integrar agentes externos nos seus próprios fluxos de trabalho multi-agente. A introdução desta funcionalidade irá aumentar consideravelmente a flexibilidade e a escalabilidade do Gemini Enterprise, permitindo aos utilizadores gerir e coordenar melhor várias tarefas de automatização.
Para além disso, a Google lançouFerramenta de avaliação de agentesque ajuda os utilizadores a testar e a otimizar o desempenho dos seus agentes. Além disso, a nova versão suportaráexecução programadaos utilizadores podem definir uma hora específica para ativar a tarefa, a fim de melhorar a eficiência do trabalho.
A atualização também inclui uma série de novos conectores que enriquecem ainda mais as capacidades de integração do Gemini Enterprise. Estes novos conectores ajudarão as organizações a interagir mais facilmente com uma variedade de serviços e sistemas de terceiros, permitindo fluxos de trabalho mais eficientes.
Com estas novas funcionalidades, a Google pretende fornecer aos utilizadores uma solução de automatização de nível empresarial mais abrangente e poderosa que melhora a eficiência operacional e a competitividade das empresas.
---

O Kosmos é uma ferramenta revolucionária para cientistas de IA, capaz de fazer a quantidade de investigação que um cientista humano faria em cerca de 6 meses numa única execução:
- Ler e integrar milhares de artigos científicos;
- Executar automaticamente o código de análise de dados;
- Estabelecimento de hipóteses, validação de experiências e elaboração de relatórios de investigação;
- Mesmo reproduzindo ou descobrindo novas investigações científicas.
Os contextos ultra-longos são fundamentais para o seu funcionamento contínuo, e o Kosmos consegue manter a coerência lógica ao longo de mais de 10 milhões de tokens, extraindo conhecimentos de milhares de documentos e dezenas de milhares de linhas de código de análise.
A inovação central são os Modelos Mundiais Estruturados (SWM). As ferramentas científicas tradicionais de IA utilizam uma forma linear de pensar, input-analysis-output. O Kosmos, por outro lado, introduz um quadro que está mais próximo do pensamento científico humano, ou seja, os Modelos Mundiais Estruturados. Isto significa que o Kosmos pode construir um gráfico de conhecimentos em constante expansão na "memória", integrando informações de centenas de trajectórias de raciocínio autónomo para formar um modelo dinâmico e iterativo do mundo de um objetivo científico específico.
Por exemplo, se o objetivo do estudo fosse "compreender os mecanismos da degeneração neuronal na doença de Alzheimer", o Kosmos faria isso:
- Pesquisa de documentos relevantes (cerca de 1500)
- Extração de dados proteómicos, genéticos e unicelulares de bases de dados publicamente disponíveis
- Executar automaticamente mais de 42.000 linhas de código de análise
- Inferência de vias moleculares críticas e elaboração de relatórios com citações
O Kosmos pode analisar dezenas de milhões de tokens, muito para além do "limite de memória" das LLM existentes. Esta tecnologia não só melhora a eficiência da investigação, como também oferece aos cientistas novas perspectivas de investigação.
---

Nas últimas notícias, a Google está a trabalhar num sistema de inteligência múltipla concebido para ajudar os utilizadores a aperfeiçoar ideias de investigação através de um mecanismo de avaliação semelhante a um torneio. Cada corrida demora cerca de 40 minutos e pode gerar 100 ideias pormenorizadas para um determinado tópico de investigação.
Na plataforma Gemini Enterprise, a Google está a desenvolver duas novas capacidades de multi-inteligência:">Geração de ideias - "Criar uma sessão de inovação do corpo multi-inteligente".Parceiros na ciência - "Promoção de novas descobertas científicas com parceiros científicos".
- Explique o seu programa de investigação, aponte os dados relevantes e estabeleça critérios de avaliação para os seus parceiros científicos.
- Um conjunto de inteligências irá gerar ideias de investigação para si com base nos dados disponíveis.
- A Intelligence Society avaliará e classificará estas ideias com base nos seus critérios, utilizando uma abordagem do tipo torneio.
Esta tecnologia não só automatiza o processo de investigação científica, como também fornece ferramentas poderosas para que as empresas e os indivíduos inovem de forma mais eficiente.
Este desenvolvimento marca uma nova etapa na investigação científica que irá aumentar consideravelmente a eficiência e a inovação da investigação.
---

ACTUALIZAÇÃO: A plataforma AI Studio adicionou uma nova ferramenta de solicitação Gemini 3. Os preparativos estão atualmente em curso.
Para Gémeos 3.Melhores resultados com a definição predefinida de 1,0. Diminuir este valor pode afetar o desempenho da inferência.
Esta atualização foi concebida para ajudar os programadores e investigadores a utilizar melhor o poder do Gemini 3 para melhorar o desempenho dos seus modelos numa variedade de tarefas. Por exemplo, em áreas como o processamento de linguagem natural, reconhecimento de imagem e síntese de fala, o Gemini 3 pode fornecer resultados mais precisos.
- **Processamento de linguagem natural**: melhorar a geração e a compreensão de texto.
- **Reconhecimento de imagens**: Melhor classificação de imagens e precisão na deteção de alvos.
- **Síntese de fala**: melhora a qualidade e a naturalidade da fala.
Ao otimizar estes parâmetros, o utilizador pode controlar melhor o comportamento do modelo, conduzindo a melhores resultados em aplicações práticas.
Para obter informações mais pormenorizadas, consulte a documentação oficial.
---

Recentemente, um vídeo de anime gerado pela Grok atraiu muita atenção na Internet. No vídeo, os detalhes da interação entre as mãos da personagem e os utensílios e a comida são pouco perceptíveis, apenas os movimentos são ligeiramente rígidos.
O Grok Imagine é capaz de gerar cenas de cozinha que se assemelham ao estilo clássico de anime dos anos 90, apresentadas num estilo ASMR que é relaxante e agradável.Algumas acções aparentemente simples (como cortar cenouras, amassar massa, bater ovos, mexer ou fritar), que seriam difíceis de realizar há não muito tempo, são agora feitas na perfeição.
No entanto, o vídeo também suscitou alguma controvérsia. Alguns espectadores deram um feedback negativo e até praguejaram, argumentando que era a IA a copiar o trabalho de Miyazaki e que as personagens não tinham alma. Isto provocou um debate sobre o papel e as limitações da IA na criação artística.
- **Avanços tecnológicos**: A IA está a ser cada vez mais utilizada na produção de animação e os pormenores técnicos continuam a melhorar.
- **Controvérsia artística**: alguns espectadores consideraram que o trabalho gerado pela IA carecia de alma e questionaram o seu valor artístico.
- **Perspectivas futuras**: apesar da controvérsia, o potencial da IA na produção de animação é enorme e é provável que surjam mais aplicações inovadoras no futuro.
---

A GMI anunciou recentemente que irá investir 500 milhões de dólares num centro de dados de IA de alta densidade em Taiwan. O centro de dados será equipado com 7.000 GPUs NVIDIA Blackwell GB300 espalhadas por 96 racks e espera-se que seja capaz de processar quase 2 milhões de tokens por segundo. Esta instalação está programada para estar operacional em março de 2026.

O centro de dados deverá consumir cerca de 16 megawatts de energia. A GMI revelou também que tem planos para construir uma nova instalação de 50 megawatts nos EUA para satisfazer a procura crescente.
As principais caraterísticas incluem:
- 96 prateleiras
- Processa quase 2 milhões de tokens por segundo
- Procura de eletricidade de cerca de 16 MW
- Previsto para entrar em funcionamento em março de 2026
A construção destas instalações não só demonstra o forte investimento do GMI em infra-estruturas de IA, como também reflecte a crescente procura mundial de recursos de computação de alto desempenho. Com o rápido desenvolvimento da tecnologia de IA, estes tipos de centros de dados tornar-se-ão uma infraestrutura importante para impulsionar a inovação e a adoção tecnológicas.
---

A Grok tem feito progressos impressionantes no domínio da geração de imagens e vídeos. As suas últimas conquistas tecnológicas alcançaram resultados impressionantes, não só em termos da qualidade das imagens e vídeos gerados, mas também em termos da velocidade a que são gerados.
A Grok utiliza modelos avançados de redes neurais, como o Transformer e o GAN (Generative Adversarial Networks), para obter uma composição de imagem e vídeo de alta qualidade.
Vasta gama de cenários de aplicaçãoincluindo, mas não se limitando a, produção cinematográfica e televisiva, criatividade publicitária, realidade virtual, etc. A aplicação destas tecnologias pode melhorar consideravelmente a eficiência da criação de conteúdos e oferecer mais possibilidades aos criadores.
Vídeo da @Diesol com as últimas novidades da Grok:
---

Atualização: O Grok 4.1 Beta está agora oficialmente disponível no site da Grok. Nesta atualização, o Grok 4.1 Beta está disponível como uma opção autónoma juntamente com o modo Grok 4 existente.
O Grok é uma poderosa ferramenta de desenvolvimento projetada para ajudar os desenvolvedores a escrever e depurar códigos com mais eficiência. A nova versão marca novas melhorias na funcionalidade e no desempenho do Grok. Os utilizadores têm agora a opção de testar o Grok 4.1 Beta para experimentarem as mais recentes melhorias e optimizações das funcionalidades.
As principais caraterísticas incluem:
- Editor de código melhorado para suportar mais linguagens de programação
- Ferramentas de depuração melhoradas com mensagens de erro mais detalhadas
- Interface de utilizador optimizada para melhorar a experiência do utilizador
Os programadores podem visitar aqui para obterem mais detalhes e começarem a testar o Grok 4.1 Beta.


评论功能已关闭。