Attention ve bağlam
GQA, MQA, verimli KV cache, uzun bağlam belleği ve seçici attention yaklaşımları.
WonAI, güçlü yapay zekânın pahalı GPU’lara, uzak sunuculara, aboneliklere ve API kotalarına mecbur olmadığı bir gelecek için geliştirilen bağımsız, açık kaynak araştırma projesidir.
Donanımın.
Modelin.
Zekân.
01 / MİSYON
Temel soru basit: Ryzen 5 5500 sınıfı bir tüketici işlemcisinde, ayrı GPU olmadan ne kadar yetenekli bir yapay zekâ çalıştırılabilir?
WonAI donanım sınırını sonradan değil, ilk günden tasarım girdisi kabul eder.02 / NEYİ HEDEFLİYOR?
Yerel yapay zekâ yalnızca çevrimdışı çalışma değildir. Maliyet, erişim, gizlilik ve karar yetkisinin çalıştıran kişide kalmasıdır.
Prompt.
Senin CPU’n.
Senin zekân.
03 / NEDEN?
Bugün gelişmiş yerel modeller çoğu zaman yüksek VRAM, pahalı GPU ve büyük bellek ister. WonAI soruyu tersine çevirir: sınırlı hesap ve bellek bütçesine ne kadar zekâ sığdırabiliriz?
REFERANS SİSTEM
| İşlemci | AMD Ryzen 5 5500 sınıfı |
|---|---|
| Çekirdek / İş parçacığı | 6 / 12 |
| Komut seti | AVX2 / FMA |
| GPU | Gerekmemesi hedefleniyor |
| Bellek | Tüketici sınıfı DDR4 |
| Sistem | Windows / Linux |
BAŞARI TANIMI
WonAI için tek başına model büyüklüğü bir başarı ölçüsü değildir. Değer; yetenek, bellek ve işlem maliyeti arasındaki ilişkide aranır.
04 / SIFIRDAN
Uzun vadeli amaç; tokenizer, mimari, eğitim hattı, sıkıştırma yöntemleri ve CPU çalışma zamanını WonAI kapsamında geliştirmektir.
05 / CPU BİRİNCİ SINIF HEDEF
GPU için tasarlayıp sonradan CPU’ya uyarlamak yerine; bant genişliği, önbellek, aktif parametre ve ilk token gecikmesi mimari kararın başında ölçülür.
| Ölçüm | Neden önemli? | Raporlama |
|---|---|---|
| Üretim hızı | Gerçek zamanlı kullanım hissi | token / saniye |
| Gecikme | Her token’ın maliyeti | ms / token |
| İlk token | Etkileşim başlangıcı | milisaniye |
| Tepe RAM | Erişilebilir donanım sınırı | GB |
| Bellek bant genişliği | CPU inference darboğazı | GB / saniye |
| Aktif parametre | Her token’daki gerçek iş | parametre / token |
| Enerji | Uzun süreli çalışma maliyeti | joule / token |
06 / BELLEK MESELESİ
CPU inference çoğu zaman yalnızca işlem gücüyle değil, ağırlıkların bellekten taşınma maliyetiyle sınırlanır. Her teknik üretime girmeden önce ayrı ayrı benchmark edilecektir.
GQA, MQA, verimli KV cache, uzun bağlam belleği ve seçici attention yaklaşımları.
Mixture of Experts, expert routing, expert caching, structured sparsity, layer skipping ve dinamik hesaplama.
INT8, INT4, deneysel 2/3-bit ağırlıklar, mixed precision, low-rank faktörizasyon ve tensör önem analizi.
Memory-mapped model formatı, ön getirme, thread affinity, fused RMSNorm, fused activation ve AVX2/FMA odaklı SIMD çekirdekleri.
07 / UZUN VADELİ ARAŞTIRMA
Yaklaşık 8 GB model bütçesinde, GPU olmadan ne kadar kullanışlı zekâ üretilebilir?
Bu bir araştırma hedefidir, mevcut performans iddiası değildir. Sonuçlar yalnızca yeniden üretilebilir benchmarklarla paylaşılacaktır.
08 / DİL
Türkçe, modele sonradan eklenen ikincil bir dil olmayacak. Eklemeli yapı, teknik anlatım ve uzun form üretim tokenizer’dan değerlendirmeye kadar ayrı bir araştırma alanıdır.
TOKENIZER ÖLÇÜMLERİ
Karakter / token, kelime başına token, fertility, encode/decode hızı, sayı ve Unicode davranışı; Türkçe, İngilizce, kaynak kod ve matematik üzerinde ayrı ayrı izlenecek.
YETENEK ALANLARI
Türkçe, akıl yürütme, matematik, programlama, bilgi, talimat izleme, uzun bağlam ve araç kullanımı ayrı test kümeleriyle değerlendirilecek. Test verisi mümkün olduğunca eğitim verisinden ayrılacak.
09 / MİMARİ & RUNTIME
İlk deneylerin temiz bir decoder-only Transformer tabanıyla başlaması; sonrasında ölçüm sonuçlarına göre yeni yapılara ilerlemesi planlanıyor.
RMSNorm, RoPE, Causal Attention, GQA/MQA, SwiGLU, KV Cache ve Weight Tying.
Toplam parametresi yüksek fakat token başına aktif parametresi düşük yapılarda uzmanlaşma, yönlendirme ve cache davranışı.
WonAI formatı → C/C++ runtime → SIMD çekirdekleri → AVX2/FMA → CPU. Üretim inference’ının uzun vadede Python ve PyTorch’a bağlı kalmaması hedefleniyor.
10 / YOL HARİTASI
30 milyon parametreli bir model, mimari hatayı 7 milyarlık bir modelden daha hızlı ve ucuz gösterir. Ölçek her aşamada kanıtla büyütülecek.
Depo yapısı, araştırma belgeleri, eğitim ortamı, benchmark ve CPU profilleme altyapısı.
Sıfırdan tokenizer, ilk mimari, eğitim döngüsü, küçük checkpoint, loss convergence, üretim ve KV cache.
Türkçe öncelikli veri, değerlendirme paketi, yeniden üretilebilir checkpoint, quantization ve bellek profili.
Daha güçlü veri, ölçek deneyleri, mimari karşılaştırma, uzun bağlam ve talimat izleme çalışmaları.
INT8/INT4, mixed precision, tensör hassasiyeti ve CPU’ya özel düşük bit optimizasyonları.
Sparse FFN, MoE, router eğitimi, uzman önbellekleme ve daha az aktif parametre.
Native C/C++ runtime, AVX2 çekirdekleri, özel model formatı ve üretim CPU inference.
11 / ŞEFFAFLIK
Her anlamlı sürüm; parametre, model boyutu, tepe RAM, prompt işleme, üretim hızı, gecikme, bağlam, CPU kullanımı, quantization ve kalite sonuçlarını birlikte raporlamalıdır. Tek bir iyi prompt kalite kanıtı değildir.
%95 HEDEFİ HAKKINDA
Daha büyük öğretmen modellerden bilgi aktarımıyla açıkça tanımlanmış testlerde yaklaşık %95 yetenek koruma oranına yaklaşmak uzun vadeli bir araştırma yönüdür. WonAI bugün bunu başardığını söylemez.
Örnek ölçüm: öğretmen skoru 80, WonAI skoru 76 → ölçülen yetenek koruma oranı %95. Metriğin anlamlı olması için test kümesi, değerlendirme yöntemi ve hesaplama bütçesi birlikte yayınlanmalıdır.
12 / BUGÜNKÜ DURUM
WonAI erken araştırma ve geliştirme aşamasındadır. İlk herkese açık model henüz yayımlanmadı. Mimari deneyleri, tokenizer, veri hazırlığı, eğitim altyapısı ve CPU inference araştırması ilerledikçe bileşenlerin aşamalı paylaşılması planlanıyor.
Tek geliştirici. Açık bir problem. Uzun vadeli kararlılık.Bulut yok. Zorunlu GPU yok. API bağımlılığı yok. Yerel zekâ araştırmasını ilk deneyden itibaren takip et.
GitHub’da WonAI↗Geliştirici profilini gör↗