Google rückt mit TurboQuant die bislang eher exotische Quantisierung des KV-Cache in den Mainstream. Das Verfahren zeigt, wie sich Speicherbedarf bei LLMs deutlich senken lässt, ohne die Nutzung des Cache-Prinzips grundsätzlich aufzugeben.
Google rückt mit TurboQuant die bislang eher exotische Quantisierung des KV-Cache in den Mainstream. Das Verfahren zeigt, wie sich Speicherbedarf bei LLMs deutlich senken lässt, ohne die Nutzung des Cache-Prinzips grundsätzlich aufzugeben.