13:36
youtube.com ha 4 dias SRT AI Coder TODAY

I Tested Every Local AI Model So You Don't Have To

Tudo que você precisa saber sobre testagem de modelos de IA locais para economizar seu tempo e escolher o ideal sem perder horas de pesquisa.

Tecnologia LLM GPU Local AI

Conteudo

TLDR;

Em 12–48 GB a escolha costuma ser o mesmo modelo (o 27B) ajustado por nível de compressão e contexto; em 8 GB é melhor um modelo Mixture‑of‑Experts que use RAM, e com ≤4 GB o caminho mais prático é a nuvem. KV cache é a memória “alugada” que cresce conforme o modelo lê arquivos e mantém contexto, e pode consumir tanto ou mais VRAM que o próprio modelo dependendo de como as camadas gerenciam esse estado, limitando o tamanho útil do contexto. Empurrar um 27B para 8 GB usando swap tecnicamente roda mas é extremamente lento, então a alternativa prática é um modelo MoE que cabe melhor em RAM ou usar builds comprimidos confiáveis testados por terceiros.

Resumo

Depois de experimentar diversos vídeos e instalar modelos locais, percebi que o problema não é qual modelo você roda, mas quanto do seu código ele consegue "ter na cabeça" e com que velocidade lê esse código; as listas de tiers ignoram o KV cache — a memória crescente que as notas temporárias do modelo ocupam enquanto ele lê arquivos, logs e ferramentas — que é rent, não depósito. Isso explica por que entre 12 GB e 48 GB você usa essencialmente o mesmo modelo: cartões maiores apenas acomodam mais contexto e velocidades maiores. Em 4 GB o conselho honesto é usar nuvem; em 8 GB compensa usar modelos mixture-of-experts ou deixar o modelo derramar para RAM, mas isso é lento; em 12–16 GB o 27B aparece só com compressões agressivas (2–3 bits) cuja qualidade varia conforme quem comprimirá; em 24 GB o build 4-bit típico já cabe; em 32 GB você tem contexto completo sem compromissos; em 48 GB o KV cache fica sem compressão (8-bit) e o modelo "respira". Li benchmarks reais, relatos e erros comuns: verifique quem comprimiu o modelo, cuide do consumo de tokens por instruções e ferramentas e confirme a versão do hardware antes de comprar.