Evaluación de Quantizaciones Q4_K_M, Q5_K_M y Q8 en Gemma 3B 12B
La quantización a Q4_K_M ofrece una reducción significativa de tamaño con una degradación moderada del rendimiento en Gemma 3B 12B; Q5_K_M presenta un buen equilibrio, mientras que Q8 mantiene la mayor fidelidad pero requiere más recursos.
La quantización a Q4_K_M ofrece una reducción significativa de tamaño con una degradación moderada del rendimiento en Gemma 3B 12B; Q5_K_M presenta un buen equilibrio, mientras que Q8 mantiene la mayor fidelidad pero requiere más recursos.
Durante las pruebas comparativas de quantización para modelos grandes como Gemma 3B 12B, hemos observado patrones consistentes en el trade-off entre tamaño del modelo y rendimiento. Utilizando Ollama para facilitar la ejecución y Qdrant para evaluar la precisión semántica a través de embeddings generados, evaluamos las variantes Q4_K_M, Q5_K_M y Q8. La métrica principal fue la calidad de los embeddings obtenidos, medida por su similitud con un conjunto de referencias conocido. También se monitorizó el consumo de memoria RAM durante la inferencia para cuantificar el impacto en los recursos.
La quantización a Q4_K_M resultó ser la opción más agresiva, reduciendo significativamente el tamaño del modelo (aproximadamente 75% menos que la versión original) pero también introduciendo una degradación notable en la calidad de los embeddings. Se observó una menor capacidad para capturar matices semánticos sutiles, indicando una pérdida de información relevante. Q5_K_M demostró un mejor equilibrio: el tamaño del modelo se redujo considerablemente (alrededor de 60%), y la degradación en la calidad de los embeddings fue menos pronunciada que con Q4_K_M.
Q8, por otro lado, mantuvo la mayor fidelidad al modelo original, mostrando una mínima degradación en la precisión semántica según nuestras métricas. Sin embargo, el beneficio principal es su menor tamaño comparado a la version no cuantizada (una reducción de aproximadamente 35%), lo que implica un mayor consumo de memoria RAM durante la inferencia y, por ende, requiere hardware más robusto para una ejecución eficiente. Para ciertas tareas donde la precisión es primordial, como la generación de respuestas basadas en contexto complejo utilizando LangGraph, Q8 resultó ser superior.
Estos resultados sugieren que la elección del método de quantización debe basarse en un análisis cuidadoso de las prioridades específicas del caso de uso. Para aplicaciones con limitaciones estrictas de recursos (como n8n ejecutándose en máquinas con memoria limitada), Q4_K_M podría ser una opción viable, aceptando una ligera pérdida de precisión. Q5_K_M ofrece un buen punto medio para la mayoría de los casos, mientras que Q8 es recomendable cuando se busca maximizar la fidelidad y se dispone de suficientes recursos computacionales.