8GB de VRAM: Configuração de IA local para programação
8GB de VRAM abre caminho para programação de IA local, transformando a forma de criar algoritmos inteligentes
Conteudo
TLDR;
Para rodar localmente com 8 GB de VRAM recomenda-se uma GPU da classe 8GB (ex.: GTX 1080/2080/3050) e cerca de 12–16 GB de RAM no sistema. O autor recomenda o Qwen 3.6 35B-A3B (IQ3_XXS quant) com Q4 KV cache a 128K e o mmproj em memória, por ter obtido a melhor performance nos benchmarks nessa configuração. O desempenho é utilizável para programação, embora mais lento em GPUs baratas (ex.: ~25–400 tokens/s dependendo do card), e é possível rodar modelos maiores offloadando pesos para RAM via --n-cpu-moe com perda de velocidade.
Resumo
Este vídeo recomenda a configuração ideal para rodar modelos localmente com GPUs de 8 GB de VRAM e cerca de 12 GB de RAM: o Qwen 3.6 35B‑A3B com quantização IQ3_XXS, cache Q4 KV em contexto 128K, parâmetros de amostragem do model card e, opcionalmente, o mmproj vision tower em memória principal. Como muitos pesos são especialistas carregados raramente (~3%), o desempenho degrada‑se gradualmente ao descarregar pesos para a RAM; em llama.cpp o flag --n‑cpu‑moe permite executar modelos MoE grandes em cards de 8 GB. A configuração completa está na descrição do vídeo e no GitHub. Este modelo mostrou‑se um excelente assistente de programação dentro das limitações de hardware barato (1080/2080/3050 ou cards antigos comprados no eBay por US$75–200). Testes ao vivo com uma 1070 Ti demonstraram taxas entre ~400 e ~25 tokens/s dependendo da tarefa, e uso real mostrou tarefas agentivas complexas (Bob‑bench) onde o 35B‑A3B concluiu uma missão em ~750 s com ~70 chamadas de ferramenta e 64 turnos, reparando erros dinamicamente. O autor explica hardware, metodologia de teste (incluindo evidência que contradiz) e discute resultados agregados no Bob‑bench Wide, que penaliza modelos muito lentos; com quantizações maiores e MTP o Qwen pode completar benchmark (<5 h) com ~90%.