Gastei US$ 1.000 Testando os Melhores Modelos de IA para Programação
Descubra como US$ 1.000 revelaram os melhores modelos de IA para programação!
Conteudo
TLDR;
Os modelos avaliados foram Fable 5, GPT 5.6, Gemini 3.6 Flash, Kimmy K3, Grock 4.5, GLM 5.2 e Opus 5, todos desafiados a construir um editor de vídeo similar ao CapCut.. O teste utilizou dois harnesses diferentes, Cursor e Open Code, para comparar o desempenho dos modelos em etapas sequenciais de desenvolvimento.. O autor utilizou prompts detalhados e uma ferramenta de testes automatizados para avaliar se os modelos seguiam instruções, mantinham consistência e produziam aplicações funcionais.
Resumo
O vídeo apresenta um teste extensivo de sete modelos de IA (Fable 5, GPT 5.6, Gemini 3.6 Flash, Kimmy K3, Grock 4.5, GLM 5.2 e Opus 5) na construção de um editor de vídeo baseado em navegador semelhante ao CapCut. Cada modelo foi avaliado em três etapas separadas — fundação, backend e frontend —, simulando um time de engenharia real, com prompts detalhados que definem requisitos e restrições. Foram usados os harnesses Cursor e OpenCode para execução, além da ferramenta TestSprite CLI para validar automaticamente o funcionamento da aplicação por meio de testes reais no navegador. Os critérios de avaliação incluíram seguir instruções, funcionalidade final, consistência entre etapas, capacidade de identificar e corrigir erros de forma autônoma, uso confiável de ferramentas, velocidade e custo. O criador destaca que o harness influencia o comportamento dos modelos e revela que GPT 5.6 foi o primeiro modelo da OpenAI que passou a usar diariamente, superando sua antiga resistência a versões anteriores.