Para dizer que as vantagens da arquitetura do Transformador de difusão, é realmente um destaque recente no domínio da geração de imagens de IA. Embora o modelo de difusão tradicional seja eficaz, é sempre um pouco incompetente quando se depara com cenas complexas. A arquitetura DiT é como um modelo de difusão equipado com um "cérebro transformador", que tem um desempenho surpreendentemente bom quando se trata de tarefas de controlo de múltiplos sujeitos. Tomemos como exemplo o modelo XVerse do ByteDance, que pode controlar de forma independente os gestos e estilos de diferentes personagens e objectos no mesmo ecrã, o que era quase inimaginável no passado.

Atualizar a compreensão semântica
O melhor de DiT é a sua capacidade de compreender a semântica do texto com maior exatidão. Ao converter imagens de referência em "deslocamentos de incorporação de texto", é equivalente a atribuir uma chave semântica única a cada objeto. Isto explica porque é que o XVerse consegue manter a consistência de pormenores como expressões de personagens e estilos de vestuário, mesmo quando existem várias personagens no enquadramento. Este controlo de precisão é mais do que um pouco mais forte do que o modelo de difusão tradicional com estrutura UNet.
A partir dos dados de teste do XVerseBench disponíveis publicamente, a arquitetura DiT apresentou um excelente relatório. 79,48 pontos de semelhança de identidade significam que o rosto da estrela gerado é realmente parecido comigo, em vez de "semelhança na forma". 70,08 pontos de pontuação de controlo multi-sujeito são ainda mais esmagadores do que muitos concorrentes que ainda utilizam a arquitetura antiga. O Embora estes números pareçam um pouco abstractos, a comparação mostra a vantagem única da DiT em lidar com cenários complexos.
Vale a pena mencionar que os sinais de controlo paralelo do DiT são concebidos de forma inteligente. Este mecanismo de regulação dupla "macro + micro" permite que o modelo não se desvie do seu curso, mas também controla com precisão o local. Para ser honesto, esta ideia de design é muito mais inteligente do que simplesmente empilhar camadas de rede.
Até onde pode ir no futuro?
Ao ver o bom desempenho do XVerse, não podemos deixar de esperar por mais possibilidades com a arquitetura DiT. Agora que o controlo de imagens estáticas foi tão bem feito, o que aconteceria se fosse aplicado à geração de vídeo? Seria possível obter uma consistência de carácter cinematográfico? Embora o desafio técnico seja certamente maior, com a escalabilidade que a DiT demonstrou, poderemos ver em breve um avanço. Afinal de contas, a capacidade de controlar com precisão vários elementos do ecrã ao mesmo tempo é demasiado imaginativa para ser utilizada na produção de jogos, no design de publicidade e noutros campos.
É claro que DiT não é perfeito. Ainda há espaço para melhorias na eficiência computacional e a edição em tempo real ainda precisa de ser optimizada. Mas como uma arquitetura emergente, já mostrou pontos de inflamação suficientes. Por falar nisso, ocorre-me de repente que se pudermos combinar a DiT com a recentemente popular geração 3D, haverá mais faíscas? Esta pode ser uma das direcções para a próxima geração do AIGC.
评论列表 (3条):
加载更多评论 Carregando...