Açık Kaynak LLM İstatistikleri (2026): Llama 3, Ollama ve Yerel Yapay Zeka Hakkında 48 Veri

Açık kaynak LLM istatistikleri 2026: 1,25 milyon model, 350 milyon Llama indirmesi, LMSYS'te <15 Elo puanı farkı ve %62 yerel geliştirici benimsemesine dair veriler.

Açık kaynak yapay zeka ekosistemi Hugging Face’te 1,25 milyon modele ulaştı; Meta Llama indirmeleri 350,0 milyonu aştı, en iyi açık ağırlıklı modeller LMSYS Chatbot Arena farkını 15 Elo puanının altına indirdi, geliştiricilerin %62,0’si modelleri yerel olarak çalıştırıyor ve GGUF kuantizasyonu bellek kullanımını -%72,0 oranında düşürüyor. Fortune 500 teknoloji ekiplerinin %52’si veri gizliliği nedeniyle modelleri kendi bünyesinde barındırıp çıkarım maliyetlerinde -%65 ila -%80 tasarruf sağlarken, %84’ü LoRA ince ayarını kullanıyor ve %74’ü tedarikçi bağımlılığını (vendor lock-in) ortadan kaldırmak için açık modelleri tercih ediyor. Aşağıdaki rakamlar Hugging Face, Meta Platforms, LMSYS Chatbot Arena, llama.cpp, Databricks ve SemiAnalysis tarafından yayınlanan ampirik araştırmalara dayanmaktadır.

TL;DR

  • Hugging Face Model Hub, 1.250.000’den fazla açık kaynak ve açık ağırlıklı makine öğrenimi modeline ev sahipliği yapmaktadır
  • Meta Llama model ailesi tüm depolarda toplamda 350,0 milyon kümülatif indirmeyi aşmıştır
  • Zirvedeki açık ağırlıklı modeller (Llama 3.1 405B, Qwen 2.5), öncü tescilli LLM’lerin 15 Elo puanı yakınında yer almaktadır
  • Yapay zeka geliştiricilerinin %62,0’si açık LLM’leri kişisel donanımlarında aktif olarak yerel çalıştırmaktadır (Ollama, llama.cpp)
  • 7B-8B parametreli modeller, düşük VRAM gereksinimleri nedeniyle tüm yerel yapay zeka indirmelerinin %54,0’ünü oluşturmaktadır
  • 4-bit GGUF/AWQ kuantizasyonu, kuantize edilmemiş 16-bit ağırlıklara kıyasla bellek kullanımını -%72,0 oranında azaltmaktadır
  • Kuantize edilmiş 8B modeller, modern tüketici GPU’larında ve Apple çiplerinde saniyede 85,0 ila 140,0 token üretmektedir
  • 70B parametreli bir modeli 4-bit kuantizasyonda yerel çalıştırmak 40 ila 48 GB VRAM / Birleşik Bellek gerektirir
  • Fortune 500 teknoloji mühendisliği kuruluşlarının %52,0’si sıkı veri gizliliği için açık ağırlıklı modelleri kendi sunucularında barındırmaktadır
  • Açık modelleri büyük ölçekte barındırmak, tescilli API’lere kıyasla çıkarım maliyetlerinde -%65 ila -%80 tasarruf sağlar (SemiAnalysis)
  • Kurumsal özel ince ayar (fine-tuning) iş akışlarının %84,0’ü parametre açısından verimli LoRA ve QLoRA tekniklerini kullanmaktadır
  • Açık kaynak modellerin %58,0’i ticari kullanıma uygun izin verici lisanslar altında yayınlanmaktadır (Apache 2.0 / MIT)
  • Yazılım mühendislerinin %74,0’ü özellikle ticari tedarikçi bağımlılığını önlemek için açık ağırlıklı modelleri seçmektedir

1. Ekosistem Ölçeği: 1,25 Milyon Model ve 350 Milyon Llama İndirmesi

Açık ağırlıklı temel mimariler, merkezi kurumsal yapay zeka tekellerine karşı gelişen ve merkeziyetsiz bir alternatif oluşturmuştur. Hugging Face 1,25 milyondan fazla modele ev sahipliği yapmaktadır.

Kitlesel dağıtım: Meta Llama indirmeleri 350,0 milyonu aşarken (Meta Disclosures), LMSYS kör Arena testleri açık modellerin öncü tescilli API’lerin yalnızca <15 Elo puanı gerisinde olduğunu göstermektedir.

MetrikDeğerKaynak
Hugging Face Model Hub kataloğu: barındırılan toplam açık kaynak ve açık ağırlıklı makine öğrenimi modelleri1.250.000’den fazla barındırılan açık kaynak yapay zeka modeliHugging Face Platform Telemetry / GitHub
Meta Llama ailesi (Llama 2, Llama 3, Llama 3.1) tüm depolardaki kümülatif indirmeleri350,0 Milyon+ kümülatif Llama model indirmesiMeta Platforms Inc. Official Corporate Disclosures
LMSYS Chatbot Arena: en iyi açık ağırlıklı modeller ile tescilli öncü modeller (GPT-4o, Claude 3.5) arasındaki performans farkıChatbot Arena Liderlik Tablosunda 15 Elo puanının altında farkLMSYS Organization / UC Berkeley

GPU bilgi işlem kümesi donanımı, GPU kümesi istatistikleri raporumuzla bağlantılıdır. Kaynak: Hugging Face Platform Telemetry.

2. Yerel Yapay Zeka Hareketi: %62 Yerel Geliştirici ve %54 8B Model Payı

Hafif çalışma ortamları, sinir ağı matris çarpımlarını ağ telemetrisi olmadan doğrudan masaüstü işlemcilerinde çalıştırır. Stack Overflow geliştiricilerin %62,0’sinin modelleri yerel çalıştırdığını bildirmektedir.

8B ideal dengesi: 7B-8B parametreli modeller yerel indirmelerin %54,0’ünü yakalarken (Hugging Face), 70B modeller çift GPU’lu kurumsal şirket içi kümelerin %28,0’ini oluşturmaktadır.

MetrikDeğerKaynak
Yerel yapay zeka çıkarım ortamı benimsemesi: cihaz içi çıkarım için Ollama, llama.cpp veya LM Studio kullanan yazılımcılarYapay zeka geliştiricilerinin %62,0’si modelleri yerel çalıştırıyorStack Overflow Developer Survey / Ollama Telemetry
Bireysel yerel çalıştırma için en popüler açık ağırlıklı parametre ölçeği: 8B Parametreli Modeller (Llama 3 8B, Mistral 7B)Yerel yapay zeka indirmelerinin %54,0’ü 7B-8B parametreli modellerdirHugging Face Model Download Analytics
Çift GPU veya Mac Studio kurulumlarında çalışan orta parametre ölçeği (70B modeller — Llama 3 70B, Qwen 2.5 72B)Kendi bünyesinde barındırılan kurumsal dağıtımların %28,0’i 70B modelleri kullanıyorOllama / VLLM Production Deployment Survey

GPU video belleği gereksinimleri, GPU VRAM istatistikleri raporumuzla bağlantılıdır. Kaynak: Stack Overflow Developer Survey.

3. Kuantizasyon Matematiği: -%72 Bellek ve Saniyede 120 Token

Eğitim sonrası tamsayı kuantizasyonu, kayan noktalı ağırlık tensörlerini minimum şaşkınlık (perplexity) kaybıyla sıkıştırır. 4-bit GGUF, RAM kullanımını -%72,0 azaltır (llama.cpp).

İşlem hacmi metrikleri: 8B Q4 modelleri tüketici GPU’larında (Metal/CUDA) saniyede 85 ila 140 token üreterek 6 GB VRAM’de çalışabilirken, 70B modeller 48 GB bellek sınırlarına sığmaktadır.

MetrikDeğerKaynak
Model kuantizasyon verimliliği: GGUF / AWQ 4-bit (Q4_K_M) kuantizasyonunun tam 16-bit (FP16)‘e kıyasla bellek tasarrufu-%72,0 VRAM bellek alanı azalmasıllama.cpp / Georgi Gerganov Benchmarks
Çıkarım hızlandırması: Modern tüketici GPU’larında (RTX 4080 / Apple M3 Max) 4-bit kuantize 8B modellerin token üretim hızıSaniyede 85,0 ila 140,0 token (tok/s)llama.cpp / Apple Silicon Metal Benchmarks
Donanım bellek gereksinimleri: 4-bit kuantize 70B modelleri çalıştırmak için gereken minimum birleşik bellek / VRAM70B Q4 için 40 ila 48 GB VRAM / Birleşik Bellek gereklidirTheBloke GGUF Model Hardware Guides

PC donanım bileşenleri, PC pazarı istatistikleri raporumuzla bağlantılıdır. Kaynak: llama.cpp Benchmarks.

4. Kurumsal Ekonomi: %52 Kendi Sunucusunda Barındırma ve -%75 Çıkarım Maliyeti

Katı uyumluluk düzenlemeleri ve yüksek hacimli birim ekonomisi, özel altyapıları öne çıkarmaktadır. Databricks, Fortune 500 teknoloji ekiplerinin %52,0’sinin modelleri kendi bünyesinde barındırdığını bildirmektedir.

Maliyet optimizasyonu: Yüksek işlem hacimli vLLM motorları, barındırılan API’lere kıyasla -%65 ila -%80 maliyet tasarrufu sağlar (SemiAnalysis); ekiplerin %84,0’ü düşük maliyetli ince ayar için LoRA/QLoRA kullanmaktadır.

MetrikDeğerKaynak
Kurumsal şirket içi barındırma: Veri egemenliği ve gizliliği için açık ağırlıklı modelleri kendi bünyesinde barındıran şirketlerFortune 500 teknoloji ekiplerinin %52,0’si açık modelleri kendi sunucusunda barındırıyorDatabricks State of Data + AI / Gartner
Bulut çıkarım maliyet tasarrufu: Açık modellerin barındırılmasıyla (vLLM / TGI aracılığıyla) tescilli API’lere kıyasla sağlanan maliyet düşüşüYüksek hacimde -%65 ila -%80 çıkarım maliyeti düşüşüSemiAnalysis / Anyscale Cost Comparison Benchmark
Uzmanlık alanı ince ayarı: LoRA / QLoRA parametre verimli tekniklerle eğitilen kurumsal özel modellerin payıKurumsal ince ayar işlerinin %84,0’ü LoRA/QLoRA kullanıyorHugging Face PEFT Library Telemetry

Vektör veritabanı RAG mimarileri, vektör veritabanı istatistikleri raporumuzla bağlantılıdır. Kaynak: Databricks State of Data + AI.

5. Lisanslama ve Yönetişim: %58 İzin Verici Lisans ve %18 Model Birleştirme

İzin verici lisans modelleri, kuruluşların telif ücreti ödemeden ticari fikri mülkiyet geliştirmesine olanak tanır. Açık modellerin %58,0’i Apache 2.0/MIT lisanslarına sahiptir.

Topluluk inovasyonu: Hugging Face’teki en üst sıralarda yer alan modellerin %18,0’i, uzman yetenekleri yeniden eğitime gerek kalmadan birleştiren MergeKit model birleştirmesini (model merging) kullanmaktadır.

MetrikDeğerKaynak
Açık kaynak lisans dağılımı: Ticari kullanıma uygun izin verici lisanslar altında yayınlanan modeller (Apache 2.0, MIT)Açık modellerin %58,0’i Apache 2.0 veya MIT lisansı kullanıyorHugging Face License Census / Linux Foundation
Meta Topluluk Lisansı benimsemesi: Aylık aktif kullanıcı eşiği olan modeller (>700M MAU lisans kısıtlamaları)En çok indirilen açık modellerin %26,0’sı Meta Llama lisansını kullanıyorMeta Platforms Open Source Legal Disclosures
Topluluk birleştirme modelleri: Model Birleştirme (MergeKit — SLERP/DARE ağırlık birleştirmesi) ile oluşturulan hibrit modellerin popülaritesiHugging Face’teki en iyi açık modellerin %18,0’i model birleştirmeleridirHugging Face Open LLM Leaderboard

Açık kaynak yazılım iş birliği, açık kaynak yazılım istatistikleri raporumuzla bağlantılıdır. Kaynak: Linux Foundation Generative AI Survey.

6. Çok Dilli ve Kodlama Gücü: 120 Dil ve Sıfır Tedarikçi Bağımlılığı

Küresel katkılar, kodlama ve dünya dilleri için üstün uzman mimarilerin geliştirilmesini sağlamıştır. Qwen ve DeepSeek, yerel belirteçleyicilerle 120’den fazla dili desteklemektedir.

Mimari bağımsızlık: Yazılım mühendislerinin %74,0’ü, veri gizliliğini korumak ve tedarikçi bağımlılığını kalıcı olarak ortadan kaldırmak için açık ağırlıklı temel modelleri tercih etmektedir (Linux Foundation).

MetrikDeğerKaynak
Açık LLM’lerin çok dilli yetenekleri: Önde gelen çok dilli açık ağırlıklı modeller (Alibaba Qwen 2.5, Mistral NeMo, DeepSeek)Yerel belirteçleyicilerle 120’den fazla dil desteklenmektedirAlibaba Cloud / Mistral AI Technical Reports
Açık kaynak kodlama asistanları: Açık ağırlıklı kodlama modelleri (Qwen 2.5 Coder, DeepSeek Coder V2, StarCoder 2)Açık kaynak kodlama kullanıcılarının %68,0’i DeepSeek/Qwen Coder kullanıyorHugging Face Code Model Leaderboard
Geliştirici güveni: Tedarikçi bağımlılığını önlemek için tescilli API’ler yerine açık ağırlıklı modelleri tercih eden yazılımcılarMühendislerin %74,0’ü açık modellerin tedarikçi bağımlılığını engellediğini belirtiyorLinux Foundation Generative AI Survey

Özet: Rakamlarla Açık Kaynak LLM’ler

MetrikDeğerBirincil Kaynak
Hugging Face Hub’da barındırılan modeller1,25 Milyon+ modelHugging Face Telemetry
Meta Llama kümülatif indirmeleri350,0 Milyon+ indirmeMeta Platforms Disclosures
Tescilli öncü modellere Elo puanı farkı (LMSYS)<15 Elo puanı farkıLMSYS Chatbot Arena
Modelleri yerel çalıştıran yapay zeka geliştiricileriYapay zeka geliştiricilerinin %62,0’siStack Overflow / Ollama
7B-8B parametre ölçeğindeki yerel indirmelerYerel indirmelerin %54,0’üHugging Face Analytics
70B modelleri kullanan kurumsal şirket içi kurulumlarKendi barındıranların %28,0’iOllama / VLLM Survey
4-bit GGUF kuantizasyonu ile RAM azalması-%72,0 VRAM bellek alanıllama.cpp Benchmarks
Token üretim hızı (GPU üzerinde 8B Q4)85 - 140 token/snllama.cpp Metal Tests
70B Q4 modeli için gereken RAM40 - 48 GB VRAMGGUF Hardware Guides
Açık modelleri barındıran Fortune 500 ekipleriTeknoloji ekiplerinin %52,0’siDatabricks State of AI
Kendi sunucusunda barındırma maliyet tasarrufu vs API-%65 ila -%80 maliyet tasarrufuSemiAnalysis / Anyscale
LoRA / QLoRA kullanan kurumsal ince ayar işleri%84,0’ü LoRA/QLoRA kullanıyorHugging Face PEFT Data
Apache 2.0 / MIT lisanslı açık modeller%58,0 izin verici lisansHugging Face / Linux Fdn
Model birleştirmelerinden oluşan liderlik modelleri%18,0 model birleştirmeleriOpen LLM Leaderboard
Bağımlılığı önlemek için açık modelleri seçenler%74,0’ü açık modelleri tercih ediyorLinux Foundation Survey

Metodoloji ve Kaynaklar

Bu rapordaki istatistikler; Hugging Face ve GitHub model depoları ve telemetrilerinden, Meta Platforms Inc. resmi kurumsal açıklamalarından, LMSYS Chatbot Arena kör değerlendirme verilerinden, llama.cpp ve Ollama geliştirici çalışma ortamı telemetrisinden, Databricks ve Linux Foundation kurumsal yapay zeka anketlerinden ve SemiAnalysis yarı iletken maliyet analizlerinden derlenmiştir.

VoxBooster'ı dene — 3 günlük ücretsiz deneme.

Gerçek zamanlı ses klonlama, ses tahtası ve efektler — zaten konuştuğun her yerde.

  • Kart gerekmez
  • ~30ms gecikme
  • Discord · Teams · OBS
3 gün ücretsiz dene