Multi-Token Prediction: DeepSeek V3'ün Eğitim Hızlandırma Fikri
Klasik LLM tek bir gelecek token tahmin eder. Multi-token prediction birkaç adım ileriyi aynı anda öğrenir — DeepSeek V3 ile sahnede.

Klasik tahmin: tek token
Standart LLM eğitiminde her pozisyonda model bir sonraki tek tokeni tahmin eder:
Bu causal language modeling denir. Basit, çalışıyor — ama bilgi yoğun değil. Model uzun planlama yerine kısa görüşlü olabilir.
MTP fikri
Multi-Token Prediction (MTP): aynı pozisyondan adım ileri birden tahmin et:
Yani model her adımda 5-10 token sonrasının dağılımını tahmin etmeyi de öğrenir.
Neden işe yarıyor?
- Daha zengin sinyal: tek token yerine birkaç token öğretmen sinyali → her örnek daha verimli.
- Uzun vadeli planlama: model "gelecek 5 token nedir?" diye düşünmek zorunda → daha tutarlı.
- Inference hızlanması: birkaç token aynı anda üretilebilir → speculative decoding doğal eşi.
Meta makalesi (2024)
Gloeckle et al. — "Better & Faster Large Language Models via Multi-token Prediction".
Bulgular:
- Aynı veri, aynı compute → MTP daha iyi performans.
- Özellikle kod, çeviri, matematik görevlerinde belirgin kazanım.
- 13B+ modellerde fark netleşiyor (küçüklerde sınırlı).
DeepSeek V3 (Aralık 2024)
DeepSeek V3 (671B parametre, ~37B aktif MoE) MTP'yi standart eğitim hedefi olarak kullandı.
Mimari detay:
- Ana model her pozisyonda bir sonraki token tahmin eder.
- MTP modülleri: ek ince katmanlar, 2-4 token ileriyi ayrı tahmin eder.
- Eğitim sonrası MTP modülleri speculative decoding için kullanılabilir → ~2x inference hızı.
DeepSeek V3'ün 3-4 milyon GPU saat ile GPT-4 sınıfı performans çıkarmasında MTP'nin payı önemli.
Hangi mimariyle uyumlu?
- Decoder-only Transformer: doğal uyum.
- Mamba/SSM: planlanıyor, henüz ana akım değil.
- Encoder-decoder: encoder kısmı zaten görüyor, fayda sınırlı.
Hesaplama maliyeti
MTP ek başlık (head) eklenir → model parametresi artar (~%5).
Ama örnek verimliliği %30+ artabilir → toplam compute kazanımı net.
Speculative decoding ile bağlantı
Speculative decoding: küçük "draft" model birden fazla token önerir, büyük model paralel doğrular. MTP zaten draft mekanizmasını modelin içine koyuyor — extra model gerekmez.
Bu yüzden DeepSeek-V3 ve benzer modeller doğal hızlı çıkarım yaparlar.
Sınırlamalar
- Küçük modeller: 1-3B sınıfında fayda belirsiz.
- Hyperparameter zorluğu: değeri (1? 4? 8?) görev bağımlı.
- Eğitim kararsızlığı: çok uzak token tahmini gradient sinyalini sulandırabilir.
- Loss ağırlıklandırma: ana tahmin ile MTP'lerin nasıl tartılacağı önemli.
Pratik öneriler
- Ana model: tek token next-token prediction.
- tipik.
- MTP ağırlığı: 0.3-0.5 (ana göreve düşük).
- Inference: speculative decoding doğal eşi.
Kapanış
Multi-token prediction, LLM eğitiminin basit ama etkili bir iyileştirmesi. Tek hedef ekler, hem performans hem inference hızı kazanır. DeepSeek V3 ile ana akım oldu; 2025-2026'da büyük labların çoğu kullanacak.
Etiketler
Kendinizi Test Edin
Cevaplarınız profilinizde istatistik olarak saklanır.
1. MTP klasik LLM eğitiminden farkı?
2. Hangi modern model MTP'yi ana eğitim hedefinde kullandı?
3. Speculative decoding ile bağlantı?
4. Hangi görevlerde MTP belirgin?
5. Sınırlaması?
İlgili Yazılar
Finitizm: Bazı Matematikçiler Neden Sonsuzluğa İnanmaz?
Sonsuzluk, modern matematiğin her yerindedir. Ama küçük bir grup matematikçi, "asla tamamlanamayan" sonsuzun gerçek olmadığını, yalnızca sonlu olanın anlamlı olduğunu savunur. İlginç ve cesur bir karşı duruş.
MatematikSherlock Holmes, Moriarty ve Oyun Teorisi: Bir Kovalamacanın Matematiği
Holmes kaçıyor, Moriarty kovalıyor. Hangi tren istasyonunda inmeli? Bu edebi sahne, oyun teorisinin kurucularından birine "rakibini tahmin edilemez kılmanın" matematiğini ilham etti.
Matematikİki Çocuk Paradoksu: "Biri Kız" Demek Olasılığı Neden Değiştirir?
Bir ailenin iki çocuğu var ve en az biri kız. İkisinin de kız olma olasılığı kaçtır? Çoğu insan "yarı yarıya" der ve yanılır. Bu küçük bulmaca, koşullu olasılığın ne kadar kaygan olduğunu gösterir.