De Ollama para OpenLLM: Executando LLMs na Nuvem
Conteudo
TLDR;
OpenLLM é uma ferramenta otimizada para implantar LLMs na nuvem com alto throughput e baixa latência usando otimizações de vLLM e BentoML.. Ollama não escala bem além de 0.5 req/s em cenários de alta carga na nuvem devido a limitações de decodificação e enfileiramento de requisições.. OpenLLM oferece APIs compatíveis com OpenAI, interface de chat integrada e deploy simplificado para BentoCloud com suporte a múltiplos usuários e escalabilidade.
Resumo
O artigo discute a transição de ferramentas locais para a nuvem no uso de modelos de linguagem grandes (LLMs). Enquanto o Ollama é eficiente para uso pessoal em ambientes locais, oferecendo simplicidade e privacidade, ele apresenta limitações significativas quando implantado na nuvem. Testes com o modelo Llama 3 8B em GPU A100 mostraram que seu throughput estabiliza em cerca de 0,5 requisições por segundo, com aumento de latência (TTFT) e desempenho insatisfatório sob cargas altas, falhando em atender requisitos como alta vazão, baixa latência, escalabilidade e suporte a múltiplos usuários simultâneos. Em contraste, o OpenLLM é apresentado como solução otimizada, integrando vLLM e BentoML para alcançar até 8 vezes mais throughput (4,1 req/s), menor tempo para primeiro token, processamento mais rápido por token e maior taxa de geração de tokens. Ele oferece APIs compatíveis com OpenAI, interface de chat integrada e implantação simplificada no BentoCloud, com autoscaling e observabilidade. O texto conclui que, para aplicações em nuvem com múltiplos usuários, o OpenLLM é superior, mantendo a facilidade de uso do Ollama enquanto supera suas restrições de desempenho.