14:13
youtube.com 01/07/2026 SRT AI Coder TODAY

AMD Local AI Has a Windows vs Linux Problem

AMD enfrenta problema na integração de inteligência artificial local em Windows e Linux.

AMD Tecnologia Local AI

Conteudo

TLDR;

O Linux instalado em bare-metal mostra a melhor utilização da iGPU (chegando a ~99%) e, na prática, tende a superar Windows e WSL para inferência local em LLMs. No Windows o Ollama tende a executar tudo na CPU e ignora a GPU AMD mesmo com Vulkan ativado, então é preciso usar llama.cpp com Vulkan ou receitas como Lemonade para aproveitar iGPU/NPU. O WSL pode ser configurado para usar a iGPU instalando os drivers Mesa Vulkan (dznICD.json), mas ainda sofre perda de throughput de cerca de um sexto em relação ao caminho nativo e não atinge o desempenho esperado do chip.

Resumo

O GEEKOM A9 Max traz o AMD Ryzen AI 9 HX 470 (Strix Point) com 12 núcleos Zen 5, iGPU Radeon 890M, NPU de 50 TOPS, 32 GB DDR5-5600, SSD de 2 TB e muitas portas; testei performance de LLMs em três ambientes: Windows nativo, WSL e Linux bare metal, usando os mesmos modelos e prompts. No Windows o Ollama por padrão usa só CPU e ignora a iGPU; usando llama.cpp com Vulkan obtive maior utilização da GPU e ganho de cerca de 10–14% em throughput sobre Ollama, enquanto a solução híbrida da AMD ("lemonade") empata com llama.cpp no decode e beneficia-se do NPU em prompts longos. Em WSL era necessário instalar drivers Mesa/Vulkan (dzn_icd.json) para ativar a iGPU; com isso a GPU passou a ser usada, mas o throughput caiu aproximadamente um sexto em relação ao Windows nativo. Em Linux bare metal o Ollama e os backends (llama.cpp com Vulkan/radv e ROCm) usaram a GPU intensamente (99%) e os resultados de decodificação ficaram próximos entre si. Conclusão: para aproveitar o iGPU no Windows, evite Ollama padrão e prefira llama.cpp Vulkan ou receitas híbridas; o desempenho geral ainda ficou abaixo do esperado para o chip. Em prompts de contexto longo.