Don't Use Claude, Use This 320B Local Coding AI Instead
Esta IA local de 320 bilhões de parâmetros já está mudando o jogo da codificação, deixando a Claude para trás.
Conteudo
TLDR;
IQuest Q1 merece ser avaliado para tarefas agenticas de codificação em infraestrutura própria, mas não é um substituto comprovado para Claude sem testes comparativos no seu ambiente. É possível hospedar localmente, porém é preciso armazenar os 320B de pesos (≈650 GB de download), ter múltiplas GPUs ou usar quantização/offloading e software como SGLang/vLLM, então não roda confortavelmente numa workstation comum. O modelo mostrou utilidade prática (corrigiu formatação que quebrava treinamento e reparou ambientes de teste) e marcou 83,2 no Terminal Bench contra 89,1 do Claude Opus 5, mas esses resultados são do próprio laboratório e dependem do conjunto completo de ferramentas e limites de tempo, não provando superioridade geral.
Resumo
A IQuestLab liberou os pesos abertos do IQuest Q1, um modelo de 320 bilhões de parâmetros que ativa cerca de 15 bilhões por token usando arquitetura mixture-of-experts (256 experts, roteando cada token para oito deles), voltado para coding agentic — capaz de ler arquivos do projeto, executar comandos de terminal e verificar suas próprias edições. O laboratório documentou dois casos práticos: o modelo detectou e corrigiu um problema de formatação (espaços injetados) que impedia aprendizado entre turnos, e ajustou ambientes de teste quebrados para distinguir falhas de infraestrutura de erros genuínos do modelo; são estudos de caso úteis, mas não provam melhoria autônoma nem taxa de sucesso geral. Ativar menos parâmetros não implica memória ou velocidade reduzidas de forma simples: todos os 320 bilhões de pesos precisam ser armazenados (repositório ocupa ~650 GB), e quantização e offloading reduzem o footprint mas adicionam custos de transferência e overhead de comunicação; exemplos de implantação sugerem tensor parallel = 8 (oito GPUs), mas não é garantia universal. Em benchmarks, o Q1 mostrou bom desempenho em tarefas agentic (Terminal Bench 83.2), porém scores dependem do ecossistema de ferramentas, limites de tempo (até 8 horas por problema) e não medem latência local. Para auto-hospedar é preciso servidor de inferência (SGLang/vLLM), parser, gateway e cliente interativo; o checkpoint é apenas texto e não processa capturas de tela.