Novas waifus de IA, novo Deepseek, mundos em tempo real, Happy Shrimp, TTS minúsculo: NOTÍCIAS DE IA
Novas waifus de IA, mundos virtuais em tempo real e a revolução do Deepseek prometem transformar a interação com a tecnologia, enquanto Happy Shrimp e o TTS minúsculo desafiam nossas expectativas sobre o futuro da inteligência artificial.
Conteudo
TLDR;
Esse recurso transforma qualquer pessoa em um personagem 4D animado a partir de um único vídeo, criando uma reconstrução 4D (gaussian splat) visualizável de vários ângulos. Evoke é um modelo open-source que gera mundos interativos quase em tempo real a partir de uma imagem mais controles (joystick e prompts de texto), mas requer GPU potente e disponibiliza modelos grandes (final ~57 GB e 14B parâmetros). Existe um gerador de TTS super pequeno pensado para rodar até em hardware de baixo desempenho, permitindo síntese de voz em máquinas de entrada.
Resumo
Semana intensa no mundo da IA: foram lançadas várias ferramentas open-source e houve avanços notáveis em robótica, geração multimodal e edição de mídia. Evoke é um modelo de vídeo open-source (14B) que, a partir de uma imagem e entradas de joystick, gera mundos interativos quase em tempo real, permite controlar veículos, adicionar eventos por texto e produzir sessões longas; o modelo tem cerca de 57 GB e pode ser usado para criar dados sintéticos para treinamento de robôs. 4D Anyone transforma um único vídeo de uma pessoa em uma reconstrução 4D detalhada (Gaussian splat) usando um esqueleto 3D para gerar múltiplas vistas; o modelo tem cerca de 12 GB e representa o estado da arte para personagens em movimento. Sense Nova 1.58B é um gerador e editor de imagens que trabalha diretamente em espaço de pixels, produz 4K nativo e edita via linguagem natural, mas exige GPUs potentes (~50 GB). A ByteDance liberou Bernini v2, um editor de vídeo onnimodal open-source que permite editar vídeos com comandos em linguagem natural (inserir/remover objetos, mudar câmera ou fundo), embora o modelo seja grande (~180 GB). Também foram mencionados modelos de visão, text-to-speech compactos, reconstrução 3D de cenas e robôs com desempenho atlético.