FreeToken ile RTX 4060’da Artik 35B Model Kesintisiz Calisiyor
Ne: UC Berkeley, MIT ve UT Austin arastirmacilari tarafindan gelistirilen FreeToken, buyuk MoE modellerini masaustu gucunde calistirmayi mümkün kiliyor. Nasil: GPU, CPU, sistem RAM’i ve PCIe’yi birlikte kullanarak VRAM sinirlamalarini ortadan kaldiriyor. Kim: Bireysel gelistiriciler, ogrenciler, AI meraklilari. Neden: Yuzlerce milyarlarca parametreli modelleri artik sadece sunucularda degil, evdeki oyun bilgisayarinda da calistirabilmek icin. Nerede: GitHub uzerinden acik kaynak olarak yayinlandi. Ne zaman: Ağustos 2026’da yayinlandi.
FreeToken Nedir?
FreeToken, Muhtesraf MoE (Mixture of Experts) modellerini normal dogrultma veya agir quantization olmadan masaustu GPU’larinda calistiran bir cikarim cercevesi. Geleneksel olarak, 35B veya daha buyuk parametreli modelleri calistirmak icin yüksek VRAM kapasiteli profesyonel GPU’lar gerekiyordu. FreeToken bu denklemi bozuyor. MoE modellerinin her token icin yalnizca az sayida Expert’i aktive etmesinden yola cikarak, tüm parametrelerin VRAM’de tutulmasi zorunlulugunu kaldiriyor.
Benchmark Sonuclari
FreeToken’in paylastigi benchmark sonuclari etkileyici: RTX 4060 (8GB Laptop GPU), Qwen3.6 35B modelini 39.3 token/saniye hizla calistiriyor. Bu hiz, Codex’in online cikarim icin bildirdigi 33 token/saniye median hizini asiyor. RTX 5090 ile DeepSeek-V4-Flash 284B modeli 22-25 token/saniye hizla calisiyor. RTX PRO 6000 Workstation ile GLM-5.2 753B modeli yaklasik 15 token/saniye hizla cikis yapabiliyor.
Teknik Altyapi: GPU, CPU ve RAM Birlikte
FreeToken’in yenilikci yanı, kaynak havuzlamasi yaklasiminda. Sistem su sekilde calisiyor: Hangi parametrelerin GPU VRAM’inde kalici oldugu, hangilerinin gecici olarak RAM’den GPU’ya tasiindigi ve hangilerinin dogrudan CPU uzerinde hesaplandigi dinamik olarak belirleniyor. Prefill asamasinda bir sonraki katmanin Expert’i onceden getiriliyor. Decode asamasinda ise CPU, GPU ve PCIe’nin gercek zamanli hizlarina gore is bolumu yapiliyor. Bunun yaninda, ajanlarin arac cagirirlari, baglami degistirdikleri veya goreve devam ettikleri zamanlarda gereksiz prefill islemlerini azaltan ozel bir Agent State Cache sistemi de mevcut.
Yapay Zeka Ajani Kullanimi
FreeToken’in en heyecan verici kullanim alanlarindan biri, yerel AI ajani calistirmak. Bir 4060 ekran kartli oyun bilgisayari, 7/24 calisan bir yerel ajan ayaga kaldirmak icin yeterli hale geliyor. Demo’larda kod yazma, e-posta okuma, arac cagirimi ve hatta oyun oynama gibi gorevler gosteriliyor. Framework, Claude Code veya Codex gibi ajan harnesleri ile de uyumlu calisiyor. Boylece kullanicilar cloud’a bagli kalmadan kendi bilgisayarlarinda ileri duzey AI ajanlari kullanabiliyorlar.
Sonuclari ve Dunya Icin Anlami
FreeToken’in yayinlanmasi, yapay zeka teknolojisinin demokratiklesmesinde onemli bir adim. Onceden yuz milyarlarca parametreli modelleri calistirmak icin sunucu duzeyinde donanim gerekirkense, artik bir oyun bilgisayari bile yeterli olabiliyor. Bu durum, yapay zeka ile ilgilenen herkesin deneme ve gelistirme yapmasini kolaylastiriyor. Ogrencilerden arastirmacilara, bireysel gelistiricilerden startup’lara kadar genis bir kitle icin yeni imkanlar aciliyor.
Henüz yorum yok. İlk yorumu siz yapın!