OpenAI, GPT-6 ailesi için geliştirilmiş prompt caching sistemini duyurdu. Amaç, kalıcı ajanların saatler süren görevlerinde tekrarlanan talimat, araç tanımı ve bağlamı yeniden hesaplamadan kullanmak; böylece gecikmeyi düşürüp önbelleğe alınan girdi tokenlarında %90’a varan indirim sağlamak.
Ne değişti?
Yeni sistem varsayılan olarak daha yüksek cache isabeti vaat ediyor. Uygun paylaşılan önekler 30 dakikalık pencerede yeniden kullanıldığında indirim uygulanıyor. Prompt Caching Dashboard ile isabet oranları ve girdi kompozisyonu izlenebiliyor; beklenmeyen miss’lerde diagnostics aracı model, araç, ayar veya girdi farkını gösteriyor.
Geliştirici kontrolleri
Explicit cache breakpoint’lerle hangi öneklerin saklanacağı seçilebiliyor. GPT-6’da reasoning effort değiştirmek artık cache’i kırmıyor (configuration_update). Araç tanımlarını silmek yerine allowed_tools veya tool_choice: none ile sabit tutmak öneriliyor. Prewarming ile bilinen bağlam istek gelmeden ısıtılabiliyor.
Erken kullanıcı notları
Yazıda GitHub Copilot, Manus ve diğer ekiplerin isabet oranı ve maliyet iyileştirmeleri anlattığı alıntılar yer alıyor; bunlar müşteri deneyimi örnekleridir, her entegrasyon için garanti değildir.
Henüz yorum yok. İlk yorumu siz yapın!