Turing Testi Artık Geçersiz mi?

291 kelime3 dk okuma

Turing testi, bir makinenin insan gibi konuşup konuşmadığını ölçtü ve bugün geçmiş olması, alanın başarısızlığını değil kriterin yetersizleşmesini gösterir; yerine daha dar ve doğrulanabilir kriterler gelmiştir.

Orijinal test ne diyordu?

Alan Turing, 1950’de bir soru sordu: İnsanlar, karşılarındakinin insan mı makine mi olduğunu ayırt edebilir mi? Eğer ayırt edemiyorlarsa, davranış açısından makine insanla eşdeğerdir.

Test, bilinç ya da anlayış ölçmez. Yalnızca ikna edici dil davranışını ölçer. Bu sınırlama, baştan kabul edilmiş bir kısıttı.

Neden geçersizleşti?

Büyük dil modelleri, insanların ayırt edemediği metinler üretmeye başladığında test amacını yitirdi. Testin geçilmesi, sistemin gerçekten anladığını göstermiyor.

Daha derin sorun, ikna ile doğruluğun ayrışmasıdır. Bir model, insanı ikna eden ancak yanlış bir yanıt üretebilir. Testin ölçtüğü şey, kalite değil ayırt edilebilirlikti.

Yerine ne geldi?

Alan, görev bazlı kıyaslamalara kaydı. Belirli bir görevin gerçek dünya zorluğunda çözülüp çözülmediği, daha doğrulanabilir bir ölçüttür.

Ayrıca sürekli değerlendirme, insan geri bildirimi ve red-team değerlendirmeleri kullanılıyor. Hiçbiri kusursuz değil, ancak Turing testinden daha gerçekçi bir temel sunuyor.

Sistematik hata riski

Açık kıyaslama setleri, eğitim verisine sızabilir. Bir model, test sorusunu daha önce görmüş olabilir. Bu, puanları sistematik olarak şişirir.

Bu nedenle taze, gizli tutulan ve gerçek dünya zorluğunda testler gereklidir. Test tasarımı, modelin kendisinden bağımsız bir mühendislik dalıdır.

Daha iyi kriterler

Uzmanlık gerektiren görevlerde insan performansıyla karşılaştırma daha anlamlıdır. Lise matematiği soruları, doktora düzeyindeki bir soruya göre çok daha zayıf bir kriterdir.

Ayrıca dayanıklılık ölçümü önemlidir. Modelin kurgu, biçim değişikliği veya rahatsız edici bir çerçeveye ne kadar dayandığı, kriterin kendisinin kalitesini gösterir.

Sık sorulan sorular

Turing testini modeller geçti mi?

Bazı durumlarda evet. Ancak bu, testin ölçtüğü ikna ediciliği doğrular, sistemin anladığını veya doğru cevap verdiğini göstermez.

Test tamamen işe yaramaz mı?

Hayır. Bilinç ölçmediğini baştan kabul etmesi, onu geçersiz kılmaz. İnsan ayırt etme eşiğini izlemek hâlâ anlamlı bir sinyal.

Ne ölçülmeli?

Görev bazlı kıyaslamalar, uzmanlık düzeyi gerektiren testler, darbe dayanıklılığı ve gerçek dünya performansı.

Kıyaslama puanları güvenilir mi?

Yararlıdır ancak eğitim sızıntısına açıktır. Taze ve gizli testlerle desteklenmelidir.

Kaynakça

  1. Yapay zekâ değerlendirme araştırmalarıStanford HAI
  2. Anthropic değerlendirme ve sistem kartlarıAnthropic

Bu konuyla ilgili haberler