Why KV cache stores K and V vectors but never Q? (a popular technical LLM interview question) LLMs are autoregressive so each token is predicted from every token before it, one at a time. This auto…
Este tweet proporciona una explicación detallada del funcionamiento interno de los modelos de lenguaje grandes (LLMs), específicamente sobre cómo se utilizan los vectores de clave y valor en el caché de atención. Es valioso para equipos de desarrollo avanzado e investigación de IA porque profundiza en conceptos críticos para la optimización y comprensión de estos modelos complejos.