Sertifikalı Bir Skor, Ölçülmeyen Bir Şey
Gelişmiş bir Gemini Deep Think sürümü, 2025 IMO’sunda koordinatörlerce öğrencilerle aynı ölçütlerle derecelendirilip altı problemde 35 puan aldı; skor iyi tanımlı, tek oturumlu kısa problemleri ölçer, araştırma matematiğinin asıl işini ölçmez.
Sertifikanın anatomisi
Uluslararası Matematik Olimpiyatı altmış yıldır aynı gramerle çalışıyor: ülke başına altı lise öncesi yarışmacı, iki oturumda altı problem, problem başına yedi puan, toplam kırk iki. Madalyalar ön sıralardaki yarıya verilir, altın kabaca en iyi yüzde sekize denk gelir.
2025’te bu gramerin içine ilk kez bir AI sistemi resmî olarak sokuldu: Google DeepMind, geliştirdiği Gemini Deep Think sürümünün IMO koordinatörleri tarafından öğrencilerle aynı ölçütlerle derecelendirildiğini, beş problemin eksiksiz çözülüp 35 puan alındığını ve bunun altın seviyesi anlamına geldiğini yayımladı.
Kritik ayrım şu: sonuç, laboratuvarın kendi kapalı testine değil, yarışmanın kendi puanlama sürecine dayanıyor. Aynı yıl OpenAI de dahili bir modelin altın seviyesine ulaştığını açıkladı; bu açıklama resmî derecelendirme değil, kendi koşullarında kurulmuş bir simülasyon olarak kayda geçti.
Neyin kolaylaştığı: problem tipleri
Olimpiyat problemleri cebir, kombinatorik, geometri ve sayılar kuramı arasında dağılır. Ortak payda şudur: ifade kapalı, çözüm sonlu, doğrulama mümkün. Model doğruyu bilmiyor; doğru görünen yolları üretip elemeyi yapıyor.
Deep Think tarafındaki kazanç, tek bir uzun akıl yürütme zincirinden değil, eşzamanlı aday üretiminden geldi: paralel düşünme modu, birbirini tamamlayan birkaç çözüm denemesini aynı anda yürütüp birleştiriyor. Eğitim hattına çok adımlı çıkarım ve teorem ispatı verisi de eklendi.
2024 ile 2025 arasındaki fark mekanizmayı ele veriyor. Bir yıl önce AlphaProof ve AlphaGeometry 2, problemlerin uzmanlarca Lean gibi biçimsel dillere çevrilmesine ve günlerce süren hesaplamaya muhtaçtı; 28 puanla gümüş seviyesinde kaldı. Bir yıl sonra model, resmî problem metninden doğal dilde başlayıp dört buçuk saat içinde yazılı çözüme ulaştı.
Altının ölçmediği üç katman
Birincisi seçim: olimpiyatta problem verilmiştir, araştırmada problemi kimin ve neden seçtiği işin yarısıdır. İkincisi ölçek: yarışma çözümü birkaç sayfa; bir teoremin kanıtı yüzlerce sayfaya ve onlarca lemmaya yayılabilir, tek okuyucunun belleğine sığmaz.
Üçüncüsü topluluk: araştırma, kanıtın hakemden, seminerden ve yeniden üretimden geçtiği sosyal bir süreç. Bir modelin doğru cevabı bulması ile o cevabın matematiğin geri kalanına eklenmesi arasında, ölçülmesi güç bir emek katmanı var.
2026: görünürlük sorunu
2026 Olimpiyatı Şanghay’da yapıldı; altın kesme çizgisi 35 puan olarak kayda geçti. Resmî bireysel sonuç listelerinde, öğrenci sıralamasının içinde derecelendirilmiş bir AI takımının sonucu yayımlanmadı: sertifika pratiği kalıcı bir yarışma kategorisine dönüşmedi.
Bu ayrıntı önemli. Sistemler yalnızca organizatör davetiyle ve ayrı bir kanalda puanlanıyorsa, “altın seviyesi” ifadesi teknik bir iddia olmaktan çıkıp karşılaştırma retoriğine yaklaşır. Ölçüm ile ölçümün kurumsallaşması aynı şey değildir.
Sonuç olarak altın sınırı, modellerin elit düzeyde tümdengelim üretebildiğini gösteriyor. Matematik camiasının ne kadarını ikna ettiği ise ayrı ve henüz açık bir soru.
Doğru kıyaslama nasıl kurulur
Olimpiyat skorunu tek başına “genel matematik yeteneği” okuması yerine üç katmanlı çerçeve kullanmak daha dürüst: ifadeyi anlama, kanıt üretme, üretileni biçimsel olarak doğrulatma. Modeller ilk ikisinde hızla ilerliyor; üçüncüsü hâlâ insan ve araç işbirliğine dayanıyor.
Okura pratik ders: bir modelin matematik iddiasını değerlendirirken skoru değil izi sor — hangi problemler, kimin ölçütleriyle, hangi zaman sınırında, bağımsız doğrulandı mı.
Sık sorulan sorular
Model gerçekten altın madalya aldı mı?
Hayır; madalya öğrencilere verilir. 2025’te bir sistem, IMO koordinatörlerince öğrencilerle aynı ölçütlerle derecelendirilip altın sınırına denk 35 puan aldı. Bu ayrımı korumak için “altın seviyesi” dili daha doğru.
OpenAI’nin iddiası neden farklı okunmalı?
Kendi açıkladığı koşullar yarışmanın resmî puanlama sürecinden geçmedi. Simülasyon ile sertifikalı sonuç arasındaki fark, bu alandaki en yaygın okuma hatası.
Hangi problem tipleri modeller için daha kolay?
İfadesi kapalı, çözümü sonlu ve yerel bir numara gerektiren problemler. Uzun yapı inşası isteyen, alışılmadık çerçeveleme gerektiren sorular hâlâ zor taraf.
Bu ilerleme araştırmacı matematikçiyi neden az etkiliyor?
Araştırma problem vermekle başlamıyor; problem seçimi, kısmi sonuçlar, biçimsel doğrulama ve topluluk onayı sınavda yok. Skor, işin yalnızca görünen dilimini ölçüyor.
Kaynakça
- Gemini Deep Think’in IMO 2025 sonucuGoogle DeepMind
- IMO resmî sonuç arşiviInternational Mathematical Olympiad
- IMO 2026 bireysel sonuçlarıIMO 2026 Şanghay
- Olimpiyat düzeyinde matematiksel akıl yürütme kıyaslamasıIMO-Bench
Bu konuyla ilgili haberler
- Bilim Dünyasında Açık Teorem Devrimi: OpenAI’ın 722 Makalelik Matematik Kataloğu Arama ve Doğrulama Ağına Açıldı
- Kritik Altyapılara Yapay Zeka Kalkanı: Anthropic Glasswing’i Üç Kademeli Siber Programa Birleştirdi
- Deepfake ve Sahte İçeriğe Küresel Kalkan: Google SynthID Doğrulama Sitesini Herkese Açtı
- Matematik Dünyasında AI Depremi: OpenAI Yayımlanmamış Modelden 722 Teorem ve İspat Paylaştı