Açık kaynak yapay zeka ekosistemi Hugging Face’te 1,25 milyon modele ulaştı; Meta Llama indirmeleri 350,0 milyonu aştı, en iyi açık ağırlıklı modeller LMSYS Chatbot Arena farkını 15 Elo puanının altına indirdi, geliştiricilerin %62,0’si modelleri yerel olarak çalıştırıyor ve GGUF kuantizasyonu bellek kullanımını -%72,0 oranında düşürüyor. Fortune 500 teknoloji ekiplerinin %52’si veri gizliliği nedeniyle modelleri kendi bünyesinde barındırıp çıkarım maliyetlerinde -%65 ila -%80 tasarruf sağlarken, %84’ü LoRA ince ayarını kullanıyor ve %74’ü tedarikçi bağımlılığını (vendor lock-in) ortadan kaldırmak için açık modelleri tercih ediyor. Aşağıdaki rakamlar Hugging Face, Meta Platforms, LMSYS Chatbot Arena, llama.cpp, Databricks ve SemiAnalysis tarafından yayınlanan ampirik araştırmalara dayanmaktadır.
TL;DR
- Hugging Face Model Hub, 1.250.000’den fazla açık kaynak ve açık ağırlıklı makine öğrenimi modeline ev sahipliği yapmaktadır
- Meta Llama model ailesi tüm depolarda toplamda 350,0 milyon kümülatif indirmeyi aşmıştır
- Zirvedeki açık ağırlıklı modeller (Llama 3.1 405B, Qwen 2.5), öncü tescilli LLM’lerin 15 Elo puanı yakınında yer almaktadır
- Yapay zeka geliştiricilerinin %62,0’si açık LLM’leri kişisel donanımlarında aktif olarak yerel çalıştırmaktadır (Ollama, llama.cpp)
- 7B-8B parametreli modeller, düşük VRAM gereksinimleri nedeniyle tüm yerel yapay zeka indirmelerinin %54,0’ünü oluşturmaktadır
- 4-bit GGUF/AWQ kuantizasyonu, kuantize edilmemiş 16-bit ağırlıklara kıyasla bellek kullanımını -%72,0 oranında azaltmaktadır
- Kuantize edilmiş 8B modeller, modern tüketici GPU’larında ve Apple çiplerinde saniyede 85,0 ila 140,0 token üretmektedir
- 70B parametreli bir modeli 4-bit kuantizasyonda yerel çalıştırmak 40 ila 48 GB VRAM / Birleşik Bellek gerektirir
- Fortune 500 teknoloji mühendisliği kuruluşlarının %52,0’si sıkı veri gizliliği için açık ağırlıklı modelleri kendi sunucularında barındırmaktadır
- Açık modelleri büyük ölçekte barındırmak, tescilli API’lere kıyasla çıkarım maliyetlerinde -%65 ila -%80 tasarruf sağlar (SemiAnalysis)
- Kurumsal özel ince ayar (fine-tuning) iş akışlarının %84,0’ü parametre açısından verimli LoRA ve QLoRA tekniklerini kullanmaktadır
- Açık kaynak modellerin %58,0’i ticari kullanıma uygun izin verici lisanslar altında yayınlanmaktadır (Apache 2.0 / MIT)
- Yazılım mühendislerinin %74,0’ü özellikle ticari tedarikçi bağımlılığını önlemek için açık ağırlıklı modelleri seçmektedir
1. Ekosistem Ölçeği: 1,25 Milyon Model ve 350 Milyon Llama İndirmesi
Açık ağırlıklı temel mimariler, merkezi kurumsal yapay zeka tekellerine karşı gelişen ve merkeziyetsiz bir alternatif oluşturmuştur. Hugging Face 1,25 milyondan fazla modele ev sahipliği yapmaktadır.
Kitlesel dağıtım: Meta Llama indirmeleri 350,0 milyonu aşarken (Meta Disclosures), LMSYS kör Arena testleri açık modellerin öncü tescilli API’lerin yalnızca <15 Elo puanı gerisinde olduğunu göstermektedir.
| Metrik | Değer | Kaynak |
|---|---|---|
| Hugging Face Model Hub kataloğu: barındırılan toplam açık kaynak ve açık ağırlıklı makine öğrenimi modelleri | 1.250.000’den fazla barındırılan açık kaynak yapay zeka modeli | Hugging Face Platform Telemetry / GitHub |
| Meta Llama ailesi (Llama 2, Llama 3, Llama 3.1) tüm depolardaki kümülatif indirmeleri | 350,0 Milyon+ kümülatif Llama model indirmesi | Meta Platforms Inc. Official Corporate Disclosures |
| LMSYS Chatbot Arena: en iyi açık ağırlıklı modeller ile tescilli öncü modeller (GPT-4o, Claude 3.5) arasındaki performans farkı | Chatbot Arena Liderlik Tablosunda 15 Elo puanının altında fark | LMSYS Organization / UC Berkeley |
GPU bilgi işlem kümesi donanımı, GPU kümesi istatistikleri raporumuzla bağlantılıdır. Kaynak: Hugging Face Platform Telemetry.
2. Yerel Yapay Zeka Hareketi: %62 Yerel Geliştirici ve %54 8B Model Payı
Hafif çalışma ortamları, sinir ağı matris çarpımlarını ağ telemetrisi olmadan doğrudan masaüstü işlemcilerinde çalıştırır. Stack Overflow geliştiricilerin %62,0’sinin modelleri yerel çalıştırdığını bildirmektedir.
8B ideal dengesi: 7B-8B parametreli modeller yerel indirmelerin %54,0’ünü yakalarken (Hugging Face), 70B modeller çift GPU’lu kurumsal şirket içi kümelerin %28,0’ini oluşturmaktadır.
| Metrik | Değer | Kaynak |
|---|---|---|
| Yerel yapay zeka çıkarım ortamı benimsemesi: cihaz içi çıkarım için Ollama, llama.cpp veya LM Studio kullanan yazılımcılar | Yapay zeka geliştiricilerinin %62,0’si modelleri yerel çalıştırıyor | Stack Overflow Developer Survey / Ollama Telemetry |
| Bireysel yerel çalıştırma için en popüler açık ağırlıklı parametre ölçeği: 8B Parametreli Modeller (Llama 3 8B, Mistral 7B) | Yerel yapay zeka indirmelerinin %54,0’ü 7B-8B parametreli modellerdir | Hugging Face Model Download Analytics |
| Çift GPU veya Mac Studio kurulumlarında çalışan orta parametre ölçeği (70B modeller — Llama 3 70B, Qwen 2.5 72B) | Kendi bünyesinde barındırılan kurumsal dağıtımların %28,0’i 70B modelleri kullanıyor | Ollama / VLLM Production Deployment Survey |
GPU video belleği gereksinimleri, GPU VRAM istatistikleri raporumuzla bağlantılıdır. Kaynak: Stack Overflow Developer Survey.
3. Kuantizasyon Matematiği: -%72 Bellek ve Saniyede 120 Token
Eğitim sonrası tamsayı kuantizasyonu, kayan noktalı ağırlık tensörlerini minimum şaşkınlık (perplexity) kaybıyla sıkıştırır. 4-bit GGUF, RAM kullanımını -%72,0 azaltır (llama.cpp).
İşlem hacmi metrikleri: 8B Q4 modelleri tüketici GPU’larında (Metal/CUDA) saniyede 85 ila 140 token üreterek 6 GB VRAM’de çalışabilirken, 70B modeller 48 GB bellek sınırlarına sığmaktadır.
| Metrik | Değer | Kaynak |
|---|---|---|
| Model kuantizasyon verimliliği: GGUF / AWQ 4-bit (Q4_K_M) kuantizasyonunun tam 16-bit (FP16)‘e kıyasla bellek tasarrufu | -%72,0 VRAM bellek alanı azalması | llama.cpp / Georgi Gerganov Benchmarks |
| Çıkarım hızlandırması: Modern tüketici GPU’larında (RTX 4080 / Apple M3 Max) 4-bit kuantize 8B modellerin token üretim hızı | Saniyede 85,0 ila 140,0 token (tok/s) | llama.cpp / Apple Silicon Metal Benchmarks |
| Donanım bellek gereksinimleri: 4-bit kuantize 70B modelleri çalıştırmak için gereken minimum birleşik bellek / VRAM | 70B Q4 için 40 ila 48 GB VRAM / Birleşik Bellek gereklidir | TheBloke GGUF Model Hardware Guides |
PC donanım bileşenleri, PC pazarı istatistikleri raporumuzla bağlantılıdır. Kaynak: llama.cpp Benchmarks.
4. Kurumsal Ekonomi: %52 Kendi Sunucusunda Barındırma ve -%75 Çıkarım Maliyeti
Katı uyumluluk düzenlemeleri ve yüksek hacimli birim ekonomisi, özel altyapıları öne çıkarmaktadır. Databricks, Fortune 500 teknoloji ekiplerinin %52,0’sinin modelleri kendi bünyesinde barındırdığını bildirmektedir.
Maliyet optimizasyonu: Yüksek işlem hacimli vLLM motorları, barındırılan API’lere kıyasla -%65 ila -%80 maliyet tasarrufu sağlar (SemiAnalysis); ekiplerin %84,0’ü düşük maliyetli ince ayar için LoRA/QLoRA kullanmaktadır.
| Metrik | Değer | Kaynak |
|---|---|---|
| Kurumsal şirket içi barındırma: Veri egemenliği ve gizliliği için açık ağırlıklı modelleri kendi bünyesinde barındıran şirketler | Fortune 500 teknoloji ekiplerinin %52,0’si açık modelleri kendi sunucusunda barındırıyor | Databricks State of Data + AI / Gartner |
| Bulut çıkarım maliyet tasarrufu: Açık modellerin barındırılmasıyla (vLLM / TGI aracılığıyla) tescilli API’lere kıyasla sağlanan maliyet düşüşü | Yüksek hacimde -%65 ila -%80 çıkarım maliyeti düşüşü | SemiAnalysis / Anyscale Cost Comparison Benchmark |
| Uzmanlık alanı ince ayarı: LoRA / QLoRA parametre verimli tekniklerle eğitilen kurumsal özel modellerin payı | Kurumsal ince ayar işlerinin %84,0’ü LoRA/QLoRA kullanıyor | Hugging Face PEFT Library Telemetry |
Vektör veritabanı RAG mimarileri, vektör veritabanı istatistikleri raporumuzla bağlantılıdır. Kaynak: Databricks State of Data + AI.
5. Lisanslama ve Yönetişim: %58 İzin Verici Lisans ve %18 Model Birleştirme
İzin verici lisans modelleri, kuruluşların telif ücreti ödemeden ticari fikri mülkiyet geliştirmesine olanak tanır. Açık modellerin %58,0’i Apache 2.0/MIT lisanslarına sahiptir.
Topluluk inovasyonu: Hugging Face’teki en üst sıralarda yer alan modellerin %18,0’i, uzman yetenekleri yeniden eğitime gerek kalmadan birleştiren MergeKit model birleştirmesini (model merging) kullanmaktadır.
| Metrik | Değer | Kaynak |
|---|---|---|
| Açık kaynak lisans dağılımı: Ticari kullanıma uygun izin verici lisanslar altında yayınlanan modeller (Apache 2.0, MIT) | Açık modellerin %58,0’i Apache 2.0 veya MIT lisansı kullanıyor | Hugging Face License Census / Linux Foundation |
| Meta Topluluk Lisansı benimsemesi: Aylık aktif kullanıcı eşiği olan modeller (>700M MAU lisans kısıtlamaları) | En çok indirilen açık modellerin %26,0’sı Meta Llama lisansını kullanıyor | Meta Platforms Open Source Legal Disclosures |
| Topluluk birleştirme modelleri: Model Birleştirme (MergeKit — SLERP/DARE ağırlık birleştirmesi) ile oluşturulan hibrit modellerin popülaritesi | Hugging Face’teki en iyi açık modellerin %18,0’i model birleştirmeleridir | Hugging Face Open LLM Leaderboard |
Açık kaynak yazılım iş birliği, açık kaynak yazılım istatistikleri raporumuzla bağlantılıdır. Kaynak: Linux Foundation Generative AI Survey.
6. Çok Dilli ve Kodlama Gücü: 120 Dil ve Sıfır Tedarikçi Bağımlılığı
Küresel katkılar, kodlama ve dünya dilleri için üstün uzman mimarilerin geliştirilmesini sağlamıştır. Qwen ve DeepSeek, yerel belirteçleyicilerle 120’den fazla dili desteklemektedir.
Mimari bağımsızlık: Yazılım mühendislerinin %74,0’ü, veri gizliliğini korumak ve tedarikçi bağımlılığını kalıcı olarak ortadan kaldırmak için açık ağırlıklı temel modelleri tercih etmektedir (Linux Foundation).
| Metrik | Değer | Kaynak |
|---|---|---|
| Açık LLM’lerin çok dilli yetenekleri: Önde gelen çok dilli açık ağırlıklı modeller (Alibaba Qwen 2.5, Mistral NeMo, DeepSeek) | Yerel belirteçleyicilerle 120’den fazla dil desteklenmektedir | Alibaba Cloud / Mistral AI Technical Reports |
| Açık kaynak kodlama asistanları: Açık ağırlıklı kodlama modelleri (Qwen 2.5 Coder, DeepSeek Coder V2, StarCoder 2) | Açık kaynak kodlama kullanıcılarının %68,0’i DeepSeek/Qwen Coder kullanıyor | Hugging Face Code Model Leaderboard |
| Geliştirici güveni: Tedarikçi bağımlılığını önlemek için tescilli API’ler yerine açık ağırlıklı modelleri tercih eden yazılımcılar | Mühendislerin %74,0’ü açık modellerin tedarikçi bağımlılığını engellediğini belirtiyor | Linux Foundation Generative AI Survey |
Özet: Rakamlarla Açık Kaynak LLM’ler
| Metrik | Değer | Birincil Kaynak |
|---|---|---|
| Hugging Face Hub’da barındırılan modeller | 1,25 Milyon+ model | Hugging Face Telemetry |
| Meta Llama kümülatif indirmeleri | 350,0 Milyon+ indirme | Meta Platforms Disclosures |
| Tescilli öncü modellere Elo puanı farkı (LMSYS) | <15 Elo puanı farkı | LMSYS Chatbot Arena |
| Modelleri yerel çalıştıran yapay zeka geliştiricileri | Yapay zeka geliştiricilerinin %62,0’si | Stack Overflow / Ollama |
| 7B-8B parametre ölçeğindeki yerel indirmeler | Yerel indirmelerin %54,0’ü | Hugging Face Analytics |
| 70B modelleri kullanan kurumsal şirket içi kurulumlar | Kendi barındıranların %28,0’i | Ollama / VLLM Survey |
| 4-bit GGUF kuantizasyonu ile RAM azalması | -%72,0 VRAM bellek alanı | llama.cpp Benchmarks |
| Token üretim hızı (GPU üzerinde 8B Q4) | 85 - 140 token/sn | llama.cpp Metal Tests |
| 70B Q4 modeli için gereken RAM | 40 - 48 GB VRAM | GGUF Hardware Guides |
| Açık modelleri barındıran Fortune 500 ekipleri | Teknoloji ekiplerinin %52,0’si | Databricks State of AI |
| Kendi sunucusunda barındırma maliyet tasarrufu vs API | -%65 ila -%80 maliyet tasarrufu | SemiAnalysis / Anyscale |
| LoRA / QLoRA kullanan kurumsal ince ayar işleri | %84,0’ü LoRA/QLoRA kullanıyor | Hugging Face PEFT Data |
| Apache 2.0 / MIT lisanslı açık modeller | %58,0 izin verici lisans | Hugging Face / Linux Fdn |
| Model birleştirmelerinden oluşan liderlik modelleri | %18,0 model birleştirmeleri | Open LLM Leaderboard |
| Bağımlılığı önlemek için açık modelleri seçenler | %74,0’ü açık modelleri tercih ediyor | Linux Foundation Survey |
Metodoloji ve Kaynaklar
Bu rapordaki istatistikler; Hugging Face ve GitHub model depoları ve telemetrilerinden, Meta Platforms Inc. resmi kurumsal açıklamalarından, LMSYS Chatbot Arena kör değerlendirme verilerinden, llama.cpp ve Ollama geliştirici çalışma ortamı telemetrisinden, Databricks ve Linux Foundation kurumsal yapay zeka anketlerinden ve SemiAnalysis yarı iletken maliyet analizlerinden derlenmiştir.
-
Hugging Face & Meta Platforms Inc.: Hugging Face Platform Telemetry, Llama Downloads, and Open LLM Leaderboard (1,25M model, 350M Llama indirmesi, %54 8B ölçeği, %18 model birleştirmesi).
-
LMSYS Organization & UC Berkeley: LMSYS Chatbot Arena Crowdsourced LLM Leaderboard Benchmarks (açık ağırlıklı ve tescilli modeller arasında <15 Elo puanı farkı).
-
Georgi Gerganov (llama.cpp) & Ollama: Local Inference Benchmarks, GGUF Quantization, and Token Speed (%62 yerel geliştirici, Q4 ile -%72 RAM, 85-140 tok/s).
-
Databricks & SemiAnalysis: Enterprise Self-Hosting, Data Sovereignty, and Inference Cost Analysis (%52 Fortune 500 kendi sunucusunda, -%65-80 tasarruf, %84 LoRA).
-
Linux Foundation & Stack Overflow: Open Source AI Licensing, Developer Trust, and Vendor Lock-In (%58 Apache/MIT, %74 bağımlılığı önlemek için açık kaynak tercih ediyor).
-
Veri Takibi: Açık kaynak ve açık ağırlıklı LLM istatistikleri; genel olarak indirilebilir temel model ağırlıklarını, kuantize formatları (GGUF, AWQ) ve kendi sunucusunda barındırılan çıkarım ortamlarını yansıtmaktadır. Tescilli kapalı kaynak API modelleri (GPT-4, Claude) yalnızca karşılaştırmalı kıyaslama amacıyla analiz edilmiştir.
-
Son Güncelleme: Ağustos 2026. Bu derleme; Hugging Face depo metrikleri, LMSYS Chatbot Arena güncellemeleri ve yerel yapay zeka çıkarım testleri yayınlandıkça üç ayda bir güncellenmektedir.