L’écosystème d’IA open source a atteint 1,25 million de modèles sur Hugging Face alors que les téléchargements de Meta Llama ont dépassé 350,0 millions, les meilleurs modèles à poids ouverts ont réduit l’écart sur LMSYS Chatbot Arena à moins de 15 points Elo, 62,0 % des développeurs exécutent des modèles localement et la quantification GGUF réduit la mémoire de -72,0 %. Alors que 52 % des équipes technologiques du Fortune 500 auto-hébergent des modèles pour la confidentialité des données et économisent de -65 % à -80 % sur les coûts d’inférence, 84 % utilisent le fine-tuning LoRA et 74 % choisissent des modèles ouverts pour éliminer la dépendance vis-à-vis des fournisseurs (vendor lock-in). Les chiffres ci-dessous proviennent de recherches empiriques publiées par Hugging Face, Meta Platforms, LMSYS Chatbot Arena, llama.cpp, Databricks et SemiAnalysis.
TL;DR
- Le Hugging Face Model Hub héberge plus de 1 250 000 modèles d’apprentissage automatique open source et à poids ouverts
- La famille de modèles Meta Llama a dépassé les 350,0 millions de téléchargements cumulés sur l’ensemble des référentiels
- Les meilleurs modèles à poids ouverts (Llama 3.1 405B, Qwen 2.5) se situent à moins de 15 points de classement Elo des LLM propriétaires de pointe
- 62,0 % des développeurs en intelligence artificielle exécutent activement des LLM ouverts localement sur leur propre matériel (Ollama, llama.cpp)
- Les modèles de 7B à 8B paramètres représentent 54,0 % de tous les téléchargements de modèles d’IA locale grâce à leurs faibles exigences en VRAM
- La quantification 4 bits GGUF/AWQ réduit l’empreinte mémoire de -72,0 % par rapport aux poids 16 bits non quantifiés
- Les modèles 8B quantifiés génèrent entre 85,0 et 140,0 tokens par seconde sur les GPU grand public modernes et les puces Apple
- L’exécution locale d’un modèle de 70B paramètres en quantification 4 bits nécessite de 40 à 48 Go de VRAM / mémoire unifiée
- 52,0 % des organisations d’ingénierie technologique du Fortune 500 auto-hébergent des modèles à poids ouverts pour une stricte confidentialité des données
- L’auto-hébergement de modèles ouverts à grande échelle permet des réductions de coûts d’inférence de -65 % à -80 % par rapport aux API propriétaires (SemiAnalysis)
- 84,0 % des flux de travail d’ajustement personnalisé en entreprise utilisent les techniques LoRA et QLoRA économes en paramètres
- 58,0 % des modèles open source sont publiés sous des licences permissives adaptées à un usage commercial (Apache 2.0 / MIT)
- 74,0 % des ingénieurs logiciels choisissent des modèles fondation à poids ouverts spécifiquement pour éviter le verrouillage fournisseur (vendor lock-in)
1. Échelle de l’écosystème : 1,25M de modèles et 350M de téléchargements Llama
Les architectures fondationnelles à poids ouverts ont créé une alternative décentralisée florissante face aux silos propriétaires d’IA d’entreprise. Hugging Face héberge plus de 1,25 million de modèles.
Diffusion massive : les téléchargements de Meta Llama ont franchi les 350,0 millions (Meta Disclosures), tandis que les évaluations aveugles LMSYS Arena montrent que les modèles ouverts ne sont qu’à <15 points Elo des API propriétaires de pointe.
| Métrique | Valeur | Source |
|---|---|---|
| Catalogue Hugging Face Model Hub : total des modèles de machine learning open source et poids ouverts hébergés | Plus de 1 250 000 modèles d’IA open source hébergés | Hugging Face Platform Telemetry / GitHub |
| Téléchargements cumulés de la famille Meta Llama (Llama 2, Llama 3, Llama 3.1) sur tous les référentiels | Plus de 350,0 millions de téléchargements cumulés de modèles Llama | Meta Platforms Inc. Official Corporate Disclosures |
| LMSYS Chatbot Arena : écart de performance entre les meilleurs modèles à poids ouverts et les modèles propriétaires de pointe (GPT-4o, Claude 3.5) | Écart inférieur à 15 points de classement Elo sur le Chatbot Arena Leaderboard | LMSYS Organization / UC Berkeley |
Le matériel pour clusters de calcul GPU est abordé dans nos statistiques sur les clusters de GPU. Source : Hugging Face Platform Telemetry.
2. Le mouvement de l’IA locale : 62 % de développeurs locaux et 54 % de modèles 8B
Les environnements d’exécution légers réalisent des multiplications matricielles neuronales nativement sur processeurs de bureau sans télémétrie réseau. Stack Overflow enregistre 62,0 % d’exécutions locales de modèles.
L’équilibre idéal des 8B : les modèles de 7B à 8B paramètres captent 54,0 % des téléchargements locaux (Hugging Face), tandis que les modèles 70B représentent 28,0 % des clusters d’entreprise dual-GPU sur site.
| Métrique | Valeur | Source |
|---|---|---|
| Adoption des environnements d’inférence IA locale : développeurs logiciels utilisant Ollama, llama.cpp ou LM Studio sur appareil | 62,0 % des développeurs d’IA exécutent des modèles localement | Stack Overflow Developer Survey / Ollama Telemetry |
| Échelle de paramètres à poids ouverts la plus populaire pour exécution locale grand public : modèles 8B (Llama 3 8B, Mistral 7B) | 54,0 % des téléchargements d’IA locale sont des modèles de 7B à 8B paramètres | Hugging Face Model Download Analytics |
| Échelle de paramètres moyenne (modèles 70B — Llama 3 70B, Qwen 2.5 72B) exécutés sur configurations dual-GPU ou Mac Studio | 28,0 % des déploiements d’entreprise auto-hébergés utilisent des modèles 70B | Ollama / VLLM Production Deployment Survey |
Les besoins en mémoire vidéo GPU sont détaillés dans nos statistiques sur la VRAM de GPU. Source : Stack Overflow Developer Survey.
3. Mathématiques de la quantification : -72 % de mémoire et 120 tokens/sec
La quantification d’entiers post-entraînement compresse les tenseurs de poids à virgule flottante avec une dégradation négligeable de perplexité. GGUF 4 bits réduit la RAM de -72,0 % (llama.cpp).
Métriques de débit : les modèles 8B Q4 génèrent de 85 à 140 tok/s sur GPU grand public (Metal/CUDA), permettant une exécution locale sur 6 Go de VRAM tandis que les modèles 70B tiennent dans 48 Go de mémoire.
| Métrique | Valeur | Source |
|---|---|---|
| Efficacité de quantification des modèles : réduction de mémoire de la quantification GGUF / AWQ 4 bits (Q4_K_M) vs 16 bits complets (FP16) | Réduction de -72,0 % de l’empreinte mémoire VRAM | llama.cpp / Georgi Gerganov Benchmarks |
| Accélération d’inférence : vitesse de génération de tokens atteinte par les modèles 8B quantifiés en 4 bits sur GPU grand public modernes (RTX 4080 / Apple M3 Max) | 85,0 à 140,0 tokens par seconde (tok/s) | llama.cpp / Apple Silicon Metal Benchmarks |
| Exigences matérielles en mémoire : mémoire unifiée minimale / VRAM requise pour exécuter des modèles 70B quantifiés en 4 bits | 40 à 48 Go de VRAM / mémoire unifiée requis pour 70B Q4 | TheBloke GGUF Model Hardware Guides |
Les composants matériels PC sont présentés dans nos statistiques sur le marché des PC. Source : llama.cpp Benchmarks.
4. Économie d’entreprise : 52 % d’auto-hébergement et -75 % sur les coûts d’inférence
Des réglementations strictes de conformité et l’économie unitaire à fort volume favorisent les infrastructures privées dédiées. Databricks note que 52,0 % des équipes technologiques du Fortune 500 s’auto-hébergent.
Optimisation des coûts : les moteurs vLLM à haut débit offrent des économies de -65 % à -80 % par rapport aux API hébergées (SemiAnalysis), avec 84,0 % utilisant LoRA/QLoRA pour un fine-tuning sur mesure économique.
| Métrique | Valeur | Source |
|---|---|---|
| Auto-hébergement d’entreprise sur site : entreprises auto-hébergeant des modèles à poids ouverts pour la souveraineté et confidentialité des données | 52,0 % des équipes tech du Fortune 500 auto-hébergent des modèles ouverts | Databricks State of Data + AI / Gartner |
| Économies de coûts d’inférence cloud : réduction de coût obtenue par l’auto-hébergement de modèles ouverts (via vLLM / TGI) vs API propriétaires à grande échelle | Réduction de -65 % à -80 % des coûts d’inférence à fort volume | SemiAnalysis / Anyscale Cost Comparison Benchmark |
| Fine-tuning de domaine spécialisé : part des modèles personnalisés d’entreprise entraînés via l’ajustement efficace LoRA / QLoRA | 84,0 % des projets de fine-tuning en entreprise utilisent LoRA/QLoRA | Hugging Face PEFT Library Telemetry |
Les architectures RAG avec bases vectorielles sont traitées dans nos statistiques sur les bases de données vectorielles. Source : Databricks State of Data + AI.
5. Licences et gouvernance : 58 % permissives et 18 % de fusions de modèles
Les modèles de licences permissives permettent aux organisations de développer leur propre propriété intellectuelle commerciale sans redevances. 58,0 % des modèles ouverts détiennent des licences Apache 2.0/MIT.
Innovation communautaire : 18,0 % des modèles les mieux classés sur Hugging Face utilisent la fusion de modèles MergeKit, combinant des capacités expertes spécialisées en poids unifiés sans réentraînement.
| Métrique | Valeur | Source |
|---|---|---|
| Distribution des licences open source : modèles publiés sous des licences permissives adaptées à un usage commercial (Apache 2.0, MIT) | 58,0 % des modèles ouverts utilisent des licences Apache 2.0 ou MIT | Hugging Face License Census / Linux Foundation |
| Adoption de la licence communautaire Meta : modèles avec seuils d’utilisateurs actifs mensuels (restrictions de licence >700M MAU) | 26,0 % des téléchargements de modèles à poids ouverts utilisent la licence Meta Llama | Meta Platforms Open Source Legal Disclosures |
| Modèles de fusion communautaires : popularité des modèles hybrides créés via fusion de modèles (MergeKit — fusion de poids SLERP/DARE) | 18,0 % des modèles ouverts de premier plan sur Hugging Face sont des fusions | Hugging Face Open LLM Leaderboard |
La collaboration open source est analysée dans nos statistiques sur les logiciels open source. Source : Linux Foundation Generative AI Survey.
6. Puissance multilingue et programmation : 120 langues et aucun verrouillage fournisseur
Les contributions mondiales ont produit des architectures d’élite spécialisées dans la programmation et les langues internationales. Qwen et DeepSeek prennent en charge plus de 120 langues avec des tokeniseurs natifs.
Indépendance architecturale : 74,0 % des ingénieurs logiciels choisissent des modèles fondation à poids ouverts pour préserver la confidentialité des données et éliminer durablement le verrouillage fournisseur (Linux Foundation).
| Métrique | Valeur | Source |
|---|---|---|
| Capacités multilingues des LLM ouverts : principaux modèles à poids ouverts multilingues (Alibaba Qwen 2.5, Mistral NeMo, DeepSeek) | Plus de 120 langues prises en charge avec tokeniseurs natifs | Alibaba Cloud / Mistral AI Technical Reports |
| Assistants de programmation open source : modèles de code à poids ouverts (Qwen 2.5 Coder, DeepSeek Coder V2, StarCoder 2) | 68,0 % des utilisateurs de code open source utilisent DeepSeek/Qwen Coder | Hugging Face Code Model Leaderboard |
| Confiance des développeurs : ingénieurs logiciels préférant les modèles à poids ouverts aux API propriétaires pour éviter le verrouillage fournisseur | 74,0 % des ingénieurs affirment que les modèles ouverts évitent le verrouillage fournisseur | Linux Foundation Generative AI Survey |
Résumé : Les LLM open source en chiffres
| Métrique | Valeur | Source principale |
|---|---|---|
| Modèles hébergés sur le Hub Hugging Face | Plus de 1,25 million de modèles | Hugging Face Telemetry |
| Téléchargements cumulés de Meta Llama | Plus de 350,0 millions de téléchargements | Meta Platforms Disclosures |
| Écart de score Elo par rapport aux modèles propriétaires (LMSYS) | Écart <15 points Elo | LMSYS Chatbot Arena |
| Développeurs d’IA exécutant des modèles localement | 62,0 % des développeurs d’IA | Stack Overflow / Ollama |
| Téléchargements locaux à l’échelle 7B-8B paramètres | 54,0 % des téléchargements locaux | Hugging Face Analytics |
| Déploiements sur site d’entreprise utilisant du 70B | 28,0 % des auto-hébergés | Ollama / VLLM Survey |
| Réduction de RAM via quantification GGUF 4 bits | Réduction de -72,0 % de la VRAM | llama.cpp Benchmarks |
| Vitesse de génération de tokens (8B Q4 sur GPU) | 85 - 140 tokens/sec | llama.cpp Metal Tests |
| RAM requise pour un modèle 70B Q4 | 40 - 48 Go de VRAM | GGUF Hardware Guides |
| Équipes du Fortune 500 auto-hébergeant des modèles ouverts | 52,0 % des équipes technologiques | Databricks State of AI |
| Économies d’inférence auto-hébergée vs API | Réduction de -65 % à -80 % des coûts | SemiAnalysis / Anyscale |
| Fine-tuning en entreprise utilisant LoRA / QLoRA | 84,0 % utilisent LoRA/QLoRA | Hugging Face PEFT Data |
| Modèles ouverts sous licences Apache 2.0 / MIT | 58,0 % de licences permissives | Hugging Face / Linux Fdn |
| Modèles du classement Hugging Face issus de fusions | 18,0 % de fusions de modèles | Open LLM Leaderboard |
| Ingénieurs préférant les modèles ouverts contre le verrouillage | 74,0 % préfèrent les modèles ouverts | Linux Foundation Survey |
Méthodologie et sources
Les statistiques de ce rapport ont été compilées à partir des référentiels de modèles et de la télémétrie de Hugging Face et GitHub, des communications officielles de Meta Platforms Inc., des données d’évaluation à l’aveugle de LMSYS Chatbot Arena, de la télémétrie d’exécution de llama.cpp et Ollama, des enquêtes d’entreprise sur l’IA de Databricks et de la Linux Foundation, et des analyses de coûts des semi-conducteurs de SemiAnalysis.
-
Hugging Face & Meta Platforms Inc.: Hugging Face Platform Telemetry, Llama Downloads, and Open LLM Leaderboard (1,25M de modèles, 350M de téléchargements Llama, 54% échelle 8B, 18% fusions).
-
LMSYS Organization & UC Berkeley: LMSYS Chatbot Arena Crowdsourced LLM Leaderboard Benchmarks (écart <15 points Elo entre poids ouverts et propriétaires).
-
Georgi Gerganov (llama.cpp) & Ollama: Local Inference Benchmarks, GGUF Quantization, and Token Speed (62% devs locaux, -72% RAM via Q4, 85-140 tok/s).
-
Databricks & SemiAnalysis: Enterprise Self-Hosting, Data Sovereignty, and Inference Cost Analysis (52% Fortune 500 auto-hébergent, -65-80% d’économies, 84% LoRA).
-
Linux Foundation & Stack Overflow: Open Source AI Licensing, Developer Trust, and Vendor Lock-In (58% Apache/MIT, 74% préfèrent ouvert pour éviter le verrouillage).
-
Observation sur les données : Les statistiques sur les LLM open source et à poids ouverts reflètent les poids de modèles fondamentaux téléchargeables publiquement, les formats quantifiés (GGUF, AWQ) et les environnements d’inférence auto-hébergés. Les modèles propriétaires fermés sur API (GPT-4, Claude) sont analysés strictement à des fins comparatives.
-
Dernière mise à jour : Août 2026. Ce tour d’horizon est actualisé trimestriellement à mesure que les métriques du référentiel Hugging Face, les mises à jour de LMSYS Chatbot Arena et les benchmarks d’exécution d’IA locale sont publiés.