Este novo modelo de IA local consegue superar o Qwen?
Modelo de IA local surpreende ao superar o Qwen em desempenho!
Conteudo
TLDR;
Os benchmarks indicam que este novo Ornith pode competir com Qwen (especialmente em configurações grandes como o 397B quantizado), mas o vídeo não afirma uma superioridade absoluta. Há quatro variantes — 9 bilhões, 31 bilhões, 35 bilhões (MoE) e 397 bilhões (MoE) — com 9B recomendado para chats leves, 31B para tarefas agentivas, 35B para codificação e 397B para codificação pesada. Modelos menores (9B e 35B quantizada) podem rodar localmente no Mac; o 397B quantizado ocupa cerca de 223 GB e não é viável em um M5 Max com 128 GB, exigindo infraestrutura maior ou roteamento externo.
Resumo
O conteúdo descreve a descoberta e testes do Ornith, uma família open-source de modelos autoaperfeiçoáveis para coding agentic, anunciada como competitiva frente a modelos abertos em benchmarks como Terminal e Swebench. Há versões de 9B, 31B, 35B (Mixture of Experts) e 397B (MoE, quantizado a 4-bit, ~223 GB), construídas sobre Gemma 4 e Qwen 3.5; o autor explica que escolher o modelo depende da tarefa (9B para chat simples, 31B/35B para tarefas mais agentic e coding, 397B para codificação pesada) e alerta sobre parâmetros ativos carregados por requisição. Ele baixa modelos via MLX/Hugging Face, nota limitações do seu Mac M5 Max com 128 GB para os gigantes e prefere Ollama X por caching em SSD; compara desempenho (tokens/s) e faz testes reais, pedindo ao modelo escrever e editar conteúdos, observando respostas rápidas e funcionalidade adequada do 9B e do 35B. Em seguida integra o modelo ao OpenCode/OMLX, configura providers, carrega o modelo e o usa para analisar um codebase (requisição inicial demorou ~10 minutos), gerar páginas Webflow e editar templates de equipe. Conclui defendendo que prompts simples já são suficientes hoje para coding agentic e convida a comunidade a comentar usos e sugestões.