Google Releases Multi-Token Prediction Drafters for Gemma 4 with 3x Speedup
Google AI released Multi-Token Prediction drafters for the Gemma 4 model family using speculative decoding, achieving up to 3x faster inference without quality loss by addressing memory-bandwidth bottlenecks.
·2 sources