Production AI Ajanı GPT-5.6'ya Taşımak Neye Değer?

13 Temmuz 2026

AgentSpace’te worker ajanlar her sprint’te token yakıyor, ben de bu faturayı düzenli takip ediyorum. Yeni bir model çıkıp “şu kadar ucuz, şu kadar hızlı” dediğinde ilk refleks hemen geçiş yapmak oluyor. Ama bir production AI ajanını GPT-5.6’ya taşımak gibi bir kararı sadece başkasının yüzde rakamına bakarak vermek, mimariyi hiç ölçmeden değiştirmek demek — ve bu benim işime gelmiyor.

Ploy’un GPT-5.6 Geçişi

Ploy, web sitesi üreten prodüksiyon ajanını Claude Opus’tan GPT-5.6 Sol’a taşıdı ve bunu detaylı bir mühendislik yazısıyla anlattı. Vaat ettikleri sonuç net: “2.2× faster to a finished page, 27% cheaper, and about half the output tokens.” Ama yazının asıl değeri bu rakamda değil, rakama nasıl ulaştıklarında.

AgentSpace İçin Rakamları Doğrudan Almıyorum

Ploy’un kendi anlattığına göre ilk çapraz-model testinde başarısızlıkların üçte biri modelden değil, eval harness’in eski modele göre kalibre olmasından çıkmış — araç çağrısı bütçeleri Opus’un sıralı stiline göre ayarlanmış, GPT-5.6’nın paralel çağrı tarzı bu bütçeleri patlatmış. Daha da çarpıcısı: GPT-5.6 ilk başta Opus’tan %50 daha pahalı görünüyormuş, ama bu model fiyatlamasıyla ilgili değilmiş — prompt cache yapılandırmasıyla ilgiliymiş. Cache anahtarını workspace bazında yeniden kurduklarında maliyet farkı kapanmış.

Bu bizim için asıl ders. AgentSpace’in worker’ları Claude üzerinde koşuyor ve sprint maliyetini şu an sadece kendi mimarimiz içinde izliyorum; GPT-5.6 için eşdeğer bir eval seti veya cache yapılandırması elimde yok. Yani bugün “AgentSpace’i GPT-5.6’ya taşırsam şu kadar tasarruf ederim” diye bir hesap yaparsam, ölçtüğüm şey model değil kendi eksik kurulumum olur — tam olarak Ploy’un başına gelen hata.

Ne Yapacağım, Ne Yapmayacağım

Şimdilik AgentSpace’in worker ajanlarını GPT-5.6’ya taşımıyorum; tek kaynaklu bir migrasyon yazısındaki yüzdeye göre mimari değiştirmek erken. Yapacağım şey daha sıkıcı ama daha faydalı: Ploy’un bulduğu ikinci ders — prompt cache breakpoint’lerinin ve cache hit oranının maliyeti model seçiminden daha çok etkilediği — bizim Claude tabanlı cache kurulumumuz için de geçerli, onu gözden geçireceğim. Bunu henüz ölçmedim, planım bu.

Sonuç olarak: bir modelin “%X ucuz” iddiası, kendi harness’ini ve cache kurulumunu düzeltmeden hiçbir şey söylemez — önce kendi ölçümünü doğrula, sonra model değiştir.

Okuyucu bugün ne yapsın:

  • Model karşılaştırma yazısı okuduğunda ilk soru: “bu fark modelden mi, yoksa yazarın eval/cache kurulumundan mı?”
  • Kendi ajan sisteminde prompt cache breakpoint’lerini kontrol et: statik prefix (sistem prompt + araç şemaları) her konuşmada yeniden mi faturalanıyor, yoksa paylaşılan bir cache girdisine mi düşüyor?
  • Model swap kararını tek bir blog yazısındaki yüzdeye değil, kendi fixture setinle çalıştırdığın en az bir eşleşmiş test çiftine dayandır.

Haftada 1 e-posta: AI otomasyon deneyleri

Denediğim ajan sistemleri, çalışan promptlar, batan denemeler — süzülmüş hâliyle.

Haftada 1 e-posta. Tek tıkla çıkabilirsin.