Local AI Coding Config: 16GB VRAM / 0 RAM
Configuração local de IA com 16GB de VRAM e zero RAM que promete revolucionar o desenvolvimento de código inteligente
Conteudo
TLDR;
O Qwen 35B-A3B na quantização IQ3_XXS é uma das opções recomendadas que cabe inteiramente em 16GB de VRAM sem usar RAM do sistema. São alcançados cerca de 2000 tokens por segundo no processamento de prompt e entre 50 e 60 tokens por segundo na geração de saída. O modelo realiza tarefas como conversão de código Python para C, desenvolvimento web, C++ e simulações de partículas, processando entre 20 e 30 mil linhas de código.
Resumo
No vídeo, Unbiased Bob apresenta configurações recomendadas para rodar assistentes de código de IA localmente em placas com 16 GB de VRAM, sem uso de RAM do sistema. Ele destaca o modelo Qwen 27B na quantização IQ3, que entrega velocidades de até 2000 tokens por segundo no processamento de prompts e 50-60 tokens por segundo na geração, com contexto de 128K. Outra opção forte é o Qwen 35B-A3B na quantização IQ3_XXS, que cabe em 16 GB com contexto de 256K e apresenta bom desempenho em tarefas complexas. Bob testou os modelos em 86 desafios de engenharia de software, incluindo conversão de código Python para C, desenvolvimento web, simulações e jogos, avaliando segurança de memória com ferramentas como Valgrind. Modelos obliterados (Huihui e Hauhau) foram analisados para red teaming, mas mostraram desempenho degradado em quantizações extremas. Ele também corrige um vídeo anterior sobre placas de 12 GB, agradecendo comentários que indicaram o 35B-A3B como viável. O criador enfatiza testes qualitativos, como a criação interativa de uma calculadora gráfica, e planeja explorar configurações com offload para RAM do sistema em análises futuras.