Testei o NOVO Qwen-3.8-Max (+ Atualização importante no ranking de LLMs!)
Novo Qwen-3.8-Max: o que mudou no ranking de LLMs?
Conteudo
TLDR;
O Qwen-3.8-Max apresentou desempenho similar ao 3.7 Max nos projetos PHP, com pontuações baixas como 2.2 e sem alcançar nota máxima em nenhuma tentativa.. O modelo ficou em 16º ou 17º lugar no ranking geral após os testes com três projetos, fora do top 15.. A inclusão do projeto em Flutter e Dart mudou o leaderboard, empurrando o Luna Max da primeira posição.
Resumo
O vídeo analisa o desempenho do modelo Qwen 3.8 Max, da Alibaba, em um leaderboard de codificação com três projetos. Nos dois primeiros, ambos em PHP, o modelo obteve pontuações baixas, como 2,2 e cerca de 2,7 pontos, sem atingir nota máxima em nenhuma das cinco tentativas por projeto. Ele cometeu erros em casos de borda, foi lento (média de 12 minutos por prompt) e caro (cerca de 94 centavos por chamada via API). Com a adição do terceiro projeto em Flutter e Dart, que testa tratamento de dados imperfeitos e funcionalidades de interface, o Qwen 3.8 Max melhorou ligeiramente, mas ainda ficou em 16º lugar entre 27 modelos, com nota média de 4,9 de 10. O resultado foi considerado apenas um pouco superior ao da versão 3.7 Max, sem grandes avanços. O criador destaca a importância de diversificar linguagens nos testes e menciona o potencial do modelo de 32B para execução local como possível diferencial futuro.