- Token
- Modelin gerçekte okuyup yazdığı birim: sık geçen bir kelime, nadir bir kelimenin parçası ya da bir ek. Bir sayfa düzyazı kabaca 500 token.
- Parameter
- Modelin içindeki, training sırasında ayarlanan tek bir sayı. Model büyüklüğü parametre sayısıyla ifade edilir.
- Weight
- Birimler arasındaki bağlantıya ait parametre. "Open weights", eğitilmiş bu sayıların indirilebilir olması demek.
- Backpropagation
- Bir hatanın sorumluluğunu katmanlar boyunca geriye dağıtan yordam; böylece her weight azıcık itilebilir. 1986'da yaygınlaştı, hâlâ her şey böyle eğitiliyor.
- Transformer
- Bugün neredeyse her frontier modelin arkasındaki 2017 mimarisi. Recurrence'ı atıp bütün diziyi attention ile paralel işler.
- Attention
- Her token'ın kendinden önceki her token'ı tartıp, sırada gelecek için hangisinin ne kadar önemli olduğuna karar verdiği işlem.
- Context window
- Modelin aynı anda dikkate alabildiği token sayısı. 2026'nın önde gelen modelleri bir milyon diyor.
- Mixture-of-experts (MoE)
- Her token için modelin tamamını çalıştırmak yerine birkaç alt ağa yönlendiren mimari; büyüklüğü toplam ve aktif parametre diye ikiye böler.
- Active parameters
- Bir MoE modelin herhangi bir token için çalışan kısmı. Kimi K3 2,8T taşır, 104B'sini çalıştırır.
- Inference
- Eğitilmiş bir modeli cevap almak için çalıştırmak — eğitmenin karşıtı. Milyon token başına fiyatlanır.
- Training run
- Bir modeli sıfırdan eğitmenin kesintisiz tek geçişi. 2026 sınıfı bir run kabaca 10²⁶ FLOP ve yüz gün civarı.
- FLOP
- Kayan noktalı işlem — compute'un sayıldığı birim. Training bütçeleri toplam FLOP olarak verilir.
- Scaling laws
- Loss'un compute, veri ve parametre cinsinden düzgün bir power law ile düştüğüne dair ampirik bulgu; yeteneği bütçeden öngörülebilir kılar.
- Inference-time compute
- Daha büyük model eğitmek yerine soru başına daha çok hesap harcamak — daha uzun düşünmek. 2024'te açılan ikinci scaling ekseni.
- Reasoning model
- Cevaptan önce uzun ara adım zincirleri üretmek üzere eğitilmiş model.
- RLHF
- İnsan geri bildiriminden pekiştirmeli öğrenme: insan tercih karşılaştırmalarıyla bir metin tahmincisini talimat izleyen bir şeye çevirmek.
- Fine-tuning
- Genel bir modeli uzmanlaştırmak için daha dar bir veri kümesiyle eğitime devam etmek.
- Quantisation
- Weight'leri daha düşük sayısal hassasiyetle saklayarak modeli daha az belleğe sığdırmak; kaliteden bir miktar veriyor.
- Distillation
- Küçük bir modeli, büyük bir modelin çıktılarını taklit edecek şekilde eğitmek.
- Benchmark
- Modelleri karşılaştırmak için kullanılan sabit test kümesi. 2024 öncesi kurulmuş her manşet benchmark artık doygun.
- Agent
- Kendisine tool'lar, dosya sistemi ya da tarayıcı verilip, tek seferde cevaplamak yerine çok adımda bir görevi yürütmesi beklenen model.
- World model
- Dünyanın nasıl değiştiğine — sistemin kendi eylemleri altında da — dair içsel, öngörücü bir temsil. Eleştirmenlerin dil modellerinde eksik dediği şey.
- AI winter
- Vaatler sonuçları aştıktan sonra fonun ve itibarın çöktüğü dönem. İki tane oldu: 1974–1980 ve 1987–1993.