youtube.com ha 6h SRT AI Coder TODAY

Os Novos Modelos de IA Mais Superestimados e Subestimados

Navegando pelas expectativas, os novos modelos de IA revelam um panorama de superestimados e subestimados.

Benchmark Tecnologia IA Anthropic

Conteudo

TLDR;

Os lançamentos recentes têm sido muito hypados; Fable 5.1 mostra ganhos reais em benchmarks técnicos mas com seleção de métricas, enquanto muitos anúncios parecem superestimados para o usuário comum. Para o usuário médio de ChatGPT ou Claude quase nada muda, porque as tarefas cotidianas já eram bem atendidas e as maiores melhorias estão em matemática, ciência e programação, beneficiando sobretudo desenvolvedores. Embora Anthropic afirme que Fable 5.1 será ~25% mais barato em cargas típicas e recuse menos solicitações, o preço por token manteve‑se e benchmarks mostram custo por tarefa até maior, então a economia real é duvidosa.

Resumo

Semana cheia de anúncios: Anthropic lançou o Claude Fable 5.1, Google DeepMind trouxe novos modelos e a OpenAI anunciou que em breve falará do Astra. O narrador reclama do ritmo e do hype das releases — a experiência do usuário comum pouco muda; as maiores melhorias têm sido em matemática, ciência e programação, afetando especialmente desenvolvedores. Fable 5.1 mostra ganhos expressivos em benchmarks selecionados (pesquisas científicas agentivas, coding e knowledge work), rejeita menos prompts graças a salvaguardas de segurança mais precisas (mas ainda redireciona tarefas de uso duplo para modelos Opus) e inclui mecanismos anti-distillation para dificultar extrair “o raciocínio” do modelo. Há contradição em impedir distillation quando modelos de ponta foram treinados com dados públicos. Anthropic afirma redução de custo médio de 25% por workload típico por otimização de cache, mas manteve preços por token iguais aos da geração anterior e 5.1 não traz pesos totalmente novos, apenas pós-treinamento/RL. No agregado, Fable 5.1 lidera no artificial-analysis (66 vs 63) porém aparece mais caro por tarefa ($3,69 vs $3,14), levantando dúvidas sobre custo-benefício. O autor prometeu mostrar testes e exemplos práticos mais adiante, comparando resultados e discutindo implicações para consumidores, empresas e pesquisadores de IA em diferentes setores também.