Usamos cookies para medir audiência e melhorar sua experiência. Você pode aceitar ou recusar a qualquer momento. Veja sobre o iMasters.
Netflix compartilhou sua experiência na implementação de uma plataforma interna para inferência de modelos de linguagem grandes, usando Triton e vLLM. O que chama atenção é a diversidade de tamanhos de modelos e a necessidade de hardware cada vez mais potente.
Carregando comentários...