Time-to-First-Token ve Inter-Token Latency

328 kelime3 dk okuma

Time-to-first-token, kullanıcının ilk yanıtı ne kadar beklediğini ölçer ve algılanan hızın temel belirleyicisidir; inter-token latency ise tokenlar arası aralığı ölçerek üretim akıcılığını ve verimliliği gösterir.

Neden iki ayrı metrik?

Kullanıcı açısından bir sohbet yanıtı, iki farklı anlamda hızlı olabilir. Ancak her metrik, deneyimin farklı bir boyutunu ölçüyor.

TTFT, kullanıcının bir geri bildirim aldığı ana kadar geçen süreyi ölçer. Bu, sistemin başlangıç maliyetini yansıtır ve algıyı doğrudan etkiler.

Algılanan hız

Kullanıcılar bir yanıtın başlamasına, devam etmesine göre farklı tepki verir. İlk kelimelerin hızlı gelmesi, yavaş devam eden bir yanıttan daha olumlu algılanabilir.

Bu nedenle TTFT genellikle daha yüksek ağırlık taşır. İlk token geciktiğinde kullanıcı, sistemin yanıt vermediğini düşünebilir.

ITL ve verim

ITL, üretim boyunca tokenlar arasındaki ortalama aralığı ölçer. Bu metrik, sistemin toplam çıktı verimini ve donanım kullanımını yansıtır.

Yüksek eşzamanlılık, ortalama ITL değerini artırabilir. Bu, kullanıcı açısından bir kalite düşüşü olsa da, sistem kapasitesi açısından beklenen bir durumdur.

Ölçümü etkileyen faktörler

TTFT, ağ gecikmesi, kuyruk uzunluğu ve ön işlem süresinden etkilenir. Modelin kendi hızından daha fazla bu dış etkenler rol oynar.

ITL ise hesaplama yoğunluk ve bellek erişimiyle doğrudan ilişkilidir. Model boyutu, donanım ve eşzamanlı istek sayısı bu metriği belirler.

İyileştirme stratejileri

TTFT için ön eki paylaşımı, ön işlem önbelleği ve daha küçük modeller etkili. Aynı istemin tekrarları önbellekten hızlıca dönüyor.

ITL için ise verimli dikkat uygulamaları, kuantizasyon ve daha iyi donanım kullanımı yardımcı oluyor. Ağır yük altında bu metrik daha da önem kazanıyor.

  • TTFT algılanan hızın temel belirleyicisidir
  • ITL üretim akıcılığını ve sistem verimini gösterir
  • TTFT kuyruk ve ağ gecikmesine duyarlıdır
  • İyileştirme stratejileri metriğe göre farklılaşır

Sık sorulan sorular

TTFT neden bu kadar önemli?

Kullanıcı bir geri bildirim aldığında sistemde yanıt olduğunu anlar. İlk token geciktiğinde kullanıcı, sistemi cevap vermeyen olarak algılayabiliyor.

ITL neden yükselir?

Genellikle eşzamanlı istek sayısı arttığında. Sistem daha çok isteği aynı anda işlediği için tokenlar arası aralık uzar. Bu, kapasite kullanımının doğal bir sonucu.

Hangi metrik öncelikli olmalı?

Kullanım senaryosuna bağlı. Sohbet gibi etkileşimli uygulamalarda TTFT kritikken, toplu işleme veya yüksek hacimli üretimde ITL ve toplam verim daha önemlidir.

TTFT nasıl azaltılır?

Sık kullanılan ön eki paylaşmak, ön işlem sonuçlarını önbelleklemek, kuyruk yönetimini iyileştirmek ve daha küçük modeller kullanmak etkili yöntemlerdir.

Kaynakça

  1. Büyük dil modeli çıkarımıWikipedia
  2. Gecikme (mühendislik)Wikipedia
  3. vLLM ve PagedAttentionarXiv
  4. Otoregresif dil modellemeWikipedia
  5. Throughput and latencyWikipedia

Bu konuyla ilgili haberler