Deepseek nutzt mit DSpark eine Form spekulativer Decodierung, bei der Token-Raten zur besseren Auslastung von GPUs beitragen. Dadurch sollen Inferenzsysteme deutlich effizienter laufen, ohne dass die Qualität der generierten Ausgaben sinkt. Das Verfahren ist laut Bericht bereits produktiv im Einsatz.