¿Realmente necesitamos vLLM para proyectos locales o Ollama sigue siendo el rey de la simplicidad?
Hola a todos. Como devops, he estado probando a fondo Ollama y vLLM y me he dado cuenta de que, aunque vLLM promete una eficiencia brutal, la curva de configuración me hizo preguntarme si para el 90% de nosotros Ollama ya no es 'suficiente'. He analizado tiempos de respuesta y consumo de recursos en este video. Para mí, vLLM es para el serving de modelos en entornos más escalables que requieren más concurrencia de usuarios haciendo consultas; por otro lado, Ollama es más para prototipar y hacer pruebas en local, pero me gustaría saber su opinión y su experiencia…
Aquí les comparto un resumen de las características principales de cada herramienta
https://youtu.be/sAwOjtJkfr4?si=Wxj4NSQ5eGN4izXM
Visto en r/InteligenciArtificial