AI Mimarisi

Speculative Decoding: Küçük Taslak Model ile Büyük Modelin Hızını 3x Yapma

Küçük bir taslak modelin (Draft Model) hızla birkaç token üretip büyük ana model tarafından tek seferde doğrulanması tekniği.

3 dk

Matematiksel Doğruluk Kaybı Yoktur

Speculative Decoding bir model budama veya kaliteden ödün verme tekniği değildir; ana modelin matematiksel dağılımı %100 korunarak token üretim hızı 2 ila 3 katına çıkar.