Time-to-First-Token ve Inter-Token Latency
Time-to-first-token, kullanıcının ilk yanıtı ne kadar beklediğini ölçer ve algılanan hızın temel belirleyicisidir; inter-token latency ise tokenlar arası aralığı ölçerek üretim akıcılığını ve verimliliği gösterir.
Neden iki ayrı metrik?
Kullanıcı açısından bir sohbet yanıtı, iki farklı anlamda hızlı olabilir. Ancak her metrik, deneyimin farklı bir boyutunu ölçüyor.
TTFT, kullanıcının bir geri bildirim aldığı ana kadar geçen süreyi ölçer. Bu, sistemin başlangıç maliyetini yansıtır ve algıyı doğrudan etkiler.
Algılanan hız
Kullanıcılar bir yanıtın başlamasına, devam etmesine göre farklı tepki verir. İlk kelimelerin hızlı gelmesi, yavaş devam eden bir yanıttan daha olumlu algılanabilir.
Bu nedenle TTFT genellikle daha yüksek ağırlık taşır. İlk token geciktiğinde kullanıcı, sistemin yanıt vermediğini düşünebilir.
ITL ve verim
ITL, üretim boyunca tokenlar arasındaki ortalama aralığı ölçer. Bu metrik, sistemin toplam çıktı verimini ve donanım kullanımını yansıtır.
Yüksek eşzamanlılık, ortalama ITL değerini artırabilir. Bu, kullanıcı açısından bir kalite düşüşü olsa da, sistem kapasitesi açısından beklenen bir durumdur.
Ölçümü etkileyen faktörler
TTFT, ağ gecikmesi, kuyruk uzunluğu ve ön işlem süresinden etkilenir. Modelin kendi hızından daha fazla bu dış etkenler rol oynar.
ITL ise hesaplama yoğunluk ve bellek erişimiyle doğrudan ilişkilidir. Model boyutu, donanım ve eşzamanlı istek sayısı bu metriği belirler.
İyileştirme stratejileri
TTFT için ön eki paylaşımı, ön işlem önbelleği ve daha küçük modeller etkili. Aynı istemin tekrarları önbellekten hızlıca dönüyor.
ITL için ise verimli dikkat uygulamaları, kuantizasyon ve daha iyi donanım kullanımı yardımcı oluyor. Ağır yük altında bu metrik daha da önem kazanıyor.
- TTFT algılanan hızın temel belirleyicisidir
- ITL üretim akıcılığını ve sistem verimini gösterir
- TTFT kuyruk ve ağ gecikmesine duyarlıdır
- İyileştirme stratejileri metriğe göre farklılaşır
Sık sorulan sorular
TTFT neden bu kadar önemli?
Kullanıcı bir geri bildirim aldığında sistemde yanıt olduğunu anlar. İlk token geciktiğinde kullanıcı, sistemi cevap vermeyen olarak algılayabiliyor.
ITL neden yükselir?
Genellikle eşzamanlı istek sayısı arttığında. Sistem daha çok isteği aynı anda işlediği için tokenlar arası aralık uzar. Bu, kapasite kullanımının doğal bir sonucu.
Hangi metrik öncelikli olmalı?
Kullanım senaryosuna bağlı. Sohbet gibi etkileşimli uygulamalarda TTFT kritikken, toplu işleme veya yüksek hacimli üretimde ITL ve toplam verim daha önemlidir.
TTFT nasıl azaltılır?
Sık kullanılan ön eki paylaşmak, ön işlem sonuçlarını önbelleklemek, kuyruk yönetimini iyileştirmek ve daha küçük modeller kullanmak etkili yöntemlerdir.
Kaynakça
- Büyük dil modeli çıkarımıWikipedia
- Gecikme (mühendislik)Wikipedia
- vLLM ve PagedAttentionarXiv
- Otoregresif dil modellemeWikipedia
- Throughput and latencyWikipedia
Bu konuyla ilgili haberler
- Bulut Pazarında Deprem: Akamai ve Anthropic’ten 11,6 Milyar Dolarlık Tarihi Çıkarım İttifakı
- Nvidia’nın Korkulu Rüyası Positron AI: 875 Milyon Dolar Toplayarak 5 Milyar Dolar Değerlemeye Ulaştı
- Samsung Galaxy S27 AI Çipli 7B Yerel Modeli Cihaza Gömüyor: Bulut Devri Bitiyor mu?
- Yapay Zekâ İçin Hangi Programlama Dili? Python, Rust ve Mojo Karşılaştırması