AI Mimarisi
Speculative Decoding: Küçük Taslak Model ile Büyük Modelin Hızını 3x Yapma
Küçük bir taslak modelin (Draft Model) hızla birkaç token üretip büyük ana model tarafından tek seferde doğrulanması tekniği.
3 dk
Matematiksel Doğruluk Kaybı Yoktur
Speculative Decoding bir model budama veya kaliteden ödün verme tekniği değildir; ana modelin matematiksel dağılımı %100 korunarak token üretim hızı 2 ila 3 katına çıkar.