Token Nedir? Model Neden Kelimeleri Parçalara Bölüyor?
Token, dil modelinin metni işlediği en küçük sayısal birimdir; kelime, hece, ek veya noktalama olabilir ve her token, modelin vektör tablosunda bir kimlik numarasına karşılık gelir.
Neden kelime değil parça?
Bir dili bütün kelimelerle eşleme tablosu oluşturmak, dilin bilinen kelime sayısı nedeniyle pratikte imkânsızdır. Bu, kelime sayısının yüz binlerle ifade edildiği Türkçe gibi dillerde daha da zordur.
Bunun yerine, yaygın parçaların birleştirildiği bir alt sözlük oluşturulur. Sık geçen kelimeler tek parça olurken, nadir veya eklemeli yapılar daha çok parçaya bölünür.
Bölme algoritmaları
En yaygın yöntem, byte seviyesinde çalışan ve yaygın parçaları tekrar tekrar birleştiren bir yaklaşımdır. Bu yöntem, hangi dilden gelinirse gelsin metni işleyebilir; sözlüğe yeni bir dil eklemek gerektirmez.
Bunun önemli bir yan etkisi, aynı metnin farklı modellerde farklı sayıda token üretebilmesidir. Bu nedenle maliyet karşılaştırması her zaman aynı tokenizer ile yapılmalıdır.
Bağlam penceresi
Bir modelin aynı anda işleyebileceği token sayısı, bağlam penceresini belirler. Bu sınır hem girdi hem çıktı için geçerlidir. Pencereyi aşan içerik ya kesilir ya da özetlenir.
Pencerenin büyüklüğü tek başına yeterli değildir. Modelin gerçekten tüm içeriği aynı dikkatle işlediği, ayrıca ölçülmesi gereken bir özelliktir.
Maliyet
API ücreti genellikle girdi ve çıktı tokenı üzerinden hesaplanır. Girdi ve çıktı için farklı fiyatlandırma yapılabilir. Bu nedenle üretim uzunluğunu sınırlamak, maliyeti doğrudan etkiler.
Aynı istemi kısaltmak da token tasarrufu sağlar. Tekrarlayan bağlamı önbelleklemek, sağlayıcının sunduğu bu özellikle önemli bir tasarruftur.
Türkçe ve verimlilik
Türkçe eklemeli bir dildir; aynı kelime farklı biçimlerde görünebilir. Bu durum token sayısını artırabilir. Daha fazla token, daha yüksek maliyet ve bağlam penceresinin daha hızlı dolması anlamına gelir.
Bu nedenle Türkçe sistemlerde token bütçesi planlaması, İngilizce projelere göre daha dikkatli yapılmalıdır. Resmî token sayacıyla ölçmek, tahmin etmekten daha güvenilirdir.
Sık sorulan sorular
Token ile kelime aynı şey mi?
Hayır. Token bazen kelimeye denk gelir, bazen kelimenin parçasıdır. Oran dil ve içerik türüne göre değişir.
Türkçe neden daha çok token üretiyor?
Eklemeli yapı ve noktalama yoğunluğu, metni daha fazla parçaya bölebilir. Bu da maliyeti ve bağlam tüketimini artırır.
Bağlam penceresi ne kadar olmalı?
Göreve göre değişir. Uzun belge analizinde büyük pencere gerekebilir; kısa görevlerde küçük pencere yeterlidir ve daha hızlıdır.
Token sayısını nasıl ölçerim?
Sağlayıcının resmî token sayacını veya kütüphanesini kullanın. Modele özgü tokenizer ile ölçmek, tahmin etmekten daha güvenilirdir.
Kaynakça
- Tokenleştirme ve model dokümantasyonuHugging Face
- API token sayımı dokümantasyonuAnthropic
Bu konuyla ilgili haberler
- DeepSeek 4 Flash İncelemesi: Yalnızca 100 TL (2.12$) İle Ne Kadar Kod Yazılabilir? Satır Satır Maliyet ve Token Analizi
- Context Window Dolunca Model Neyi “Unutuyor”?
- Tokenization Neden Bu Kadar Önemli? Bir Kelime Nasıl Parçalanır?
- Terminaldeki Otonom Ajan: Claude Code Ücretsiz mi? Token Yutan Hatalar ve Tasarruf Taktikleri