Claude Haiku 4.5 Maliyeti: AgentSpace Testi
AgentSpace’te worker ajanları sprint boyunca görev alır, alt görevi böler, paralel koşar ve bitirince lider ajana rapor eder. Çok-ajanlı bir sistemi kendi altyapında çalıştırdıysan bu şemayı bilirsin: lider katmanı planı kurar, ama faturanın büyük kısmı worker katmanının hangi modelle koştuğundan çıkar. Bizde bugüne kadar worker katmanı Claude’un daha güçlü modelleriyle çalıştı — kalite yeterliydi, sprint başına token maliyeti ise en çok sorduğumuz soru oldu. Kısacası: claude haiku 4.5 cost sorusu bizim için hız merakı değil, doğrudan sprint faturası merakı.
Ne oldu
Anthropic bugün Claude Haiku 4.5’i duyurdu: şirkete göre yeni küçük model, beş ay önce en gelişmiş model olan Claude Sonnet 4’e yakın kodlama performansı veriyor — üçte bir maliyetle ve iki kattan fazla hızla. API fiyatı milyon token başına 1$/5$ (girdi/çıktı). Anthropic ayrıca Sonnet 4.5’in karmaşık bir problemi adımlara bölüp alt görevleri paralel Haiku 4.5 ekibine dağıtabileceğini belirtiyor — bizim lider/worker şemamıza kavramsal olarak yakın bir senaryo.
AgentSpace’te ne değişir
Planımız şu: AgentSpace’in worker katmanında bir sonraki sprint’i Haiku 4.5 ile koşturup, aynı görev setinin mevcut worker modelimizle çıkan faturasıyla yan yana koyacağız. Anthropic’in iddia ettiği üçte bir maliyet ve iki kat hız worker sprintlerinde birebir yansırsa, worker katmanını Haiku 4.5’e kaydırmak sprint bütçesini doğrudan küçültür. Lider ajan katmanına dokunmuyoruz — plan bölme ve orkestrasyon hâlâ daha güçlü modelde kalmalı, bunu değiştirmeyi düşünmüyoruz.
Değişmeyecek olan: kalıcı ajan hafızası, görev panosu, onay akışı. Bunlar model bağımsız, worker hangi modelle koşarsa koşsun aynı kalıyor. Değişebilecek olan: aynı bütçeyle kaç worker’ı aynı anda koşturabildiğimiz — ama bu şu an sadece Anthropic’in duyurduğu oranlar üzerinden kurduğum bir varsayım, henüz ölçmedim.
Risk
Sonnet 4’e yakın kodlama performansı iddiası genel bir kıyas; bizim worker görevlerimiz (dosya düzenleme, test koşturma, PR açma gibi somut işler) için aynı oranda geçerli olacağının garantisi yok. Kalite düşerse worker hata oranı artar, lider ajan daha çok düzeltme turu yapar, ve token tasarrufu düzeltme turlarında geri gider. Bu yüzden ilk testi tek bir sprint’te, geri kalan worker’ları eski modelde tutarak izole çalıştıracağız.
Okuyucu için sonuç: küçük model duyurusuna “ucuz” diye güvenme, kendi görev setinde ölç — biz de tam bunu yapıp gerçek sprint faturası karşılaştırmasını burada paylaşacağız.
Bugün ne yapsın
1. Mevcut worker modelinizle bir sprint'in token/fatura kaydını çıkarın (baseline).
2. Aynı görev setini claude-haiku-4-5 (API: $1/$5 per M token, girdi/çıktı) ile
tek bir izole worker'da koşturun.
3. İki faturayı VE hata/düzeltme turu sayısını karşılaştırın — sadece token
fiyatına değil, düzeltme turuna da bakın.
4. Kalite düşüşü sprint bütçesindeki kazancı yiyorsa, worker'ı eski modelde
bırakın; yemiyorsa kademeli geçiş yapın.