Yapay Zeka Coding Ajanlari Testleri Gecse de Gorevi Kaciriyor
@kimmonismus hesabindan yapilan paylasima gorere, yapay zeka coding ajanlari birim testlerinde yuksek basari oranlari elde etse de gercek dunyada kod tabani yeniden yapilandirma gorevlerinde ciddi basarisizliklarla karsilasiyor. SWE Refactor Bench uzerinde gerceklestirilen kapsamli degerlendirmede ortaya cikan bulgular, yapay zeka yazilim gelistirme araclarinin mevcut sinirlarina isaret ediyor.
SWE Refactor Bench: 520 Deneme, Yalnizca 28 Basarili
Yapay zeka coding ajanlarinin gercek kod tabani yeniden yapilandirma yeteneklerini olcmek amaciyla tasarlanan SWE Refactor Bench’de, 520 ayri deneme gerceklestirildi. Uc asamali degerlendirme suresinde ajanlarin yalnizca 28’i (%5.4) tum asamalari basariyla tamamlayabildi. Bu oran, yapay zeka kodlama araclarinin %5’inden azinin gercek uretim ortamlarinda guvenilir sekilde calisabildigini gosteriyor.
Neden Yapay Zeka Coding Ajanlari Bu Kadar Basarisiz?
Araştirmacilar, bu basarisizligin birkac temel nedene dayandigini vurguluyor:
- Baglam kaybi: Ajanlar bireysel fonksiyonlari test ederken basarili olabiliyor, ancak tum kod tabanini kapsayan genis kapsamli gorevlerde baglami kaybediyor.
- Yan etki yonetimi eksikligi: Bir degisiklik yapilirken diger moduller uzerindeki dolayli etkilerin yonetimi ajanlar icin en zorlu alanlardan biri.
- Test onyargisi: 340 deneme gocu tamamladi, 88 her sabit testi gecti ancak yalnizca 28 uc asamayi da gecti. Bu fark, birim testlerinin gercek entegrasyon sorunlarini yakalayamadigini kanitliyor.
Test Basarisi Gercek Performansi Yansitmiyor
Arastirma sonuclari, mevcut yapay zeka benchmark’larinin gercek dunya performansini yansitmakta yetersiz kaldigini ortaya koyuyor. Yalnizca %8.2 oraninda basari saglayan ajanlar, standart test kumelerinde %80’in uzerinde basari gosterebiliyor. Bu uçurum, yapay zeka coding ajanlarinin uretken ortamlarda dikkatli kullanilmasi gerektigine isaret ediyor.
Otonom Yazilim Gelistirme Yolunda Kritik Engel
SWE Refactor Bench sonuclari, tamamen otonom yazilim gelistirme hayalinin henuz cok uzak oldugunu gosteriyor. Mevcut yapay zeka coding ajanlari, tekrar eden ve iyi tanimlanmis gorevlerde etkileyici sonuclar elde etse de, karmasik ve birbirine bagli kod tabanlarinda guvenilir calismaktan uzak. Gelistiricilerin yapay zeka araclarini kullanirken bu sinirlamalari gozonunde bulundurmasi ve ajanlarin uretdigi kodlari mutlaka gozden gecirmesi gerekiyor.
Kaynak: @kimmonismus / X
Henüz yorum yok. İlk yorumu siz yapın!