Pi Agent Yeni Geliştirme Notları: DSH ve Claude Code Karşılaştırması
Pi Agent, yapay zeka ajanı geliştirme notlarını güncelleyerek sektörde büyük yankı uyandırdı. @pidotdev ekibi, DeepSeek Harness (DSH), Claude Code ve OpenCode gibi rakip sistemleri detaylı şekilde değerlendirdi. En dikkat çekici eleştiri, DSH’nin “kalıcı kayıplı budayıcı” (permanently-lossy pruner) olarak adlandırdığı context yönetim yaklaşımına yönelik oldu.
DSH Neden Eleştirildi?
DeepSeek Harness sistemi, bir AI ajanı çalışırken araç çıktıları çok uzun olduğunda yalnızca ön ve arka kısımları tutuyor, ortadaki bölümü tamamen siliyor. Pi Agent ekibi bu yaklaşımı “permanently-lossy pruner” olarak nitelendirdi. Sebebi açık: Silinen içerik bir daha geri getirilemiyor.
Pratik bir örnekle açıklamak gerekirse: Bir AI ajanı test sürecinde 30.000 karakterlik log çıktısı üretiyor. Gerçek hata mesajı 12.000. karakterde bulunuyor. DSH’nin budama işlemi sonrasında bu kritik bölüm tamamen kayboluyor. Sonrasında model ne kadar yetenekli olursa olsun, hata mesajı artık mevcut değil — ajan “hava’dan” o bilgiyi çıkaramıyor.
Pi Agent’ın Prune + Spill Çözümü
Pi Agent’ın geliştirdiği alternatif yaklaşım “prune + spill” olarak adlandırılıyor. Bu sistemde context içinde yalnızca küçük bir özet tutuluyor; tam araç çıktısı ise diske yazılıyor. Context bölümünde dosya yolu ve offset bilgisi kalıyor. Model ihtiyaç duyduğunda grep, sed ve read komutlarıyla ilgili bölümü geri çağırabiliyor.
Pi Agent ekibi, bu yöntemi GLM-5.3 ve DeepSeek V4 Flash modelleriyle 19 gerçek kullanım oturumunda test etti. Sonuçlar oldukça etkileyici:
- Context kullanımı yüzde 26 ile yüzde 35 arasında düştü
- Önbelleğe alınmamış prefill (uncached prefill) yüzde 72 ile yüzde 88 arasında azaldı
- Tüm bilgiler tam olarak geri getirilebilir durumda kaldı
Pi Agent’ın açık kayık GitHub çekme isteğinde (PR) bu başarım için “DSH’nin kalıcı kayıplı budayıcısından kesinlikle daha iyi” ifadesi yer aldı.
Claude Code ve Yeni Claude Modelleri
Pi Agent ekibinin bir diğer önemli bulgusu, yeni Claude modellerinin üçüncü taraf harness sistemlerinde bazen araç çağrılarını yanlış yapmasıydı. Pi Agent’ın edit aracı için şema açık ve net olmasına rağmen, model “requireUnique”, “matchCase” veya “oldText2” gibi Pi Agent’ta hiç bulunmayan parametreler üretebiliyor.
Araştırmacılar bu durumun muhtemel nedenini Claude’un son eğitim sürecinin Claude Code’un kendi harness sistemine daha fazla uyum sağlamasına bağlıyor. Başka bir deyişle, Claude modelleri özellikle Claude Code ortamında en iyi performansı veriyor; üçüncü taraf sistemlerde ise beklenmedik hatalar ortaya çıkabiliyor.
Sonuç ve Değerlendirme
Pi Agent’ın yeni geliştirme notları, AI ajanı ekosisteminde context yönetiminin ne denli kritik olduğunu bir kez daha gözler önüne serdi. Uzun süreli ajan görevlerinde bellek yönetimi, modelin görevlerinin farkında olmasını doğrudan etkiliyor. Pi Agent’ın önerdiği prune + spill yaklaşımı, hem verimlilik hem de bilgi bütünlüğü sağlaması açısından sektörde yeni bir standart belirleyebilir.
AI ajanı teknolojileri hakkında daha fazla bilgi için OpenAI Codex 20 Milyon Aktif Kullanıcı ve NVIDIA AVO ARC-AGI-3 Başarısı haberlerimizi inceleyebilirsiniz.
Henüz yorum yok. İlk yorumu siz yapın!