Thống kê LLM Mã nguồn mở (2026): 48 Dữ liệu về Llama 3, Ollama và AI Cục bộ

Thống kê LLM mã nguồn mở 2026: dữ liệu Hugging Face và Meta về 1,25 triệu mô hình, 350 triệu lượt tải Llama, cách biệt <15 điểm Elo trên LMSYS và 62% triển khai cục bộ.

Hệ sinh thái AI mã nguồn mở đã đạt 1,25 triệu mô hình trên Hugging Face khi số lượt tải Meta Llama vượt qua 350,0 triệu, các mô hình trọng số mở hàng đầu thu hẹp khoảng cách trên LMSYS Chatbot Arena xuống dưới 15 điểm Elo, 62,0% nhà phát triển chạy mô hình cục bộ và lượng tử hóa GGUF cắt giảm bộ nhớ tới -72,0%. Trong khi 52% nhóm công nghệ thuộc Fortune 500 tự lưu trữ mô hình để bảo mật dữ liệu và tiết kiệm -65% đến -80% chi phí suy luận, 84% sử dụng tinh chỉnh LoRA và 74% chọn mô hình mở để loại bỏ sự phụ thuộc vào nhà cung cấp (vendor lock-in). Các số liệu dưới đây dựa trên nghiên cứu thực nghiệm được công bố bởi Hugging Face, Meta Platforms, LMSYS Chatbot Arena, llama.cpp, Databricks và SemiAnalysis.

TL;DR

  • Hugging Face Model Hub lưu trữ hơn 1.250.000 mô hình học máy mã nguồn mở và trọng số mở
  • Dòng mô hình Meta Llama đã vượt qua 350,0 triệu lượt tải tích lũy trên các kho lưu trữ
  • Các mô hình trọng số mở hàng đầu (Llama 3.1 405B, Qwen 2.5) chỉ cách các LLM độc quyền tiên tiến trong vòng 15 điểm Elo
  • 62,0% nhà phát triển trí tuệ nhân tạo chủ động chạy LLM mở cục bộ trên phần cứng cá nhân (Ollama, llama.cpp)
  • Các mô hình quy mô 7B đến 8B tham số chiếm 54,0% tổng số lượt tải AI cục bộ nhờ yêu cầu VRAM thấp
  • Lượng tử hóa 4-bit GGUF/AWQ giúp giảm -72,0% dung lượng bộ nhớ so với trọng số 16-bit chưa lượng tử hóa
  • Mô hình 8B được lượng tử hóa tạo ra từ 85,0 đến 140,0 token mỗi giây trên các GPU tiêu dùng hiện đại và chip Apple
  • Chạy mô hình 70B cục bộ ở lượng tử hóa 4-bit yêu cầu từ 40 đến 48 GB VRAM / bộ nhớ hợp nhất
  • 52,0% tổ chức kỹ thuật công nghệ thuộc Fortune 500 tự lưu trữ mô hình trọng số mở vì lý do bảo mật dữ liệu nghiêm ngặt
  • Tự lưu trữ mô hình mở ở quy mô lớn giúp giảm -65% đến -80% chi phí suy luận so với API độc quyền (SemiAnalysis)
  • 84,0% quy trình tinh chỉnh tùy chỉnh của doanh nghiệp sử dụng các kỹ thuật hiệu quả tham số LoRA và QLoRA
  • 58,0% mô hình mã nguồn mở được phát hành theo giấy phép thông thoáng cho phép thương mại hóa (Apache 2.0 / MIT)
  • 74,0% kỹ sư phần mềm chọn các mô hình nền tảng trọng số mở để tránh bị khóa vào nhà cung cấp thương mại

1. Quy mô hệ sinh thái: 1,25 triệu mô hình và 350 triệu lượt tải Llama

Các kiến trúc nền tảng trọng số mở đã tạo ra một giải pháp thay thế phi tập trung phát triển mạnh mẽ trước các khối AI khép kín của doanh nghiệp. Hugging Face lưu trữ hơn 1,25 triệu mô hình.

Phân phối đại chúng: Lượt tải Meta Llama đã vượt qua 350,0 triệu (Meta Disclosures), trong khi các thử nghiệm ẩn danh LMSYS Arena cho thấy mô hình mở chỉ kém các API độc quyền tiên tiến <15 điểm Elo.

Chỉ sốGiá trịNguồn
Danh mục Hugging Face Model Hub: tổng số mô hình học máy mã nguồn mở và trọng số mở được lưu trữ1.250.000+ mô hình AI mã nguồn mở được lưu trữHugging Face Platform Telemetry / GitHub
Lượt tải tích lũy của dòng Meta Llama (Llama 2, Llama 3, Llama 3.1) trên tất cả các kho lưu trữ350,0+ Triệu lượt tải mô hình Llama tích lũyMeta Platforms Inc. Official Corporate Disclosures
LMSYS Chatbot Arena: khoảng cách hiệu suất giữa mô hình trọng số mở hàng đầu và mô hình độc quyền hàng đầu (GPT-4o, Claude 3.5)Cách biệt dưới 15 điểm xếp hạng Elo trên Chatbot Arena LeaderboardLMSYS Organization / UC Berkeley

Phần cứng cụm máy tính GPU liên kết với thống kê cụm GPU của chúng tôi. Nguồn: Hugging Face Platform Telemetry.

2. Phong trào AI cục bộ: 62% nhà phát triển chạy cục bộ và 54% mô hình 8B

Các môi trường thực thi gọn nhẹ xử lý các phép nhân ma trận nơ-ron cục bộ trên bộ xử lý máy tính để bàn mà không cần truyền dữ liệu mạng. Stack Overflow ghi nhận 62,0% người dùng chạy mô hình cục bộ.

Điểm cân bằng 8B: các mô hình 7B-8B chiếm 54,0% lượt tải cục bộ (Hugging Face), trong khi mô hình 70B chiếm 28,0% các cụm máy chủ nội bộ GPU kép cao cấp.

Chỉ sốGiá trịNguồn
Tỷ lệ chấp nhận môi trường suy luận AI cục bộ: nhà phát triển phần mềm sử dụng Ollama, llama.cpp hoặc LM Studio trên thiết bị62,0% nhà phát triển AI chạy mô hình cục bộStack Overflow Developer Survey / Ollama Telemetry
Quy mô tham số trọng số mở phổ biến nhất cho người dùng cá nhân: Mô hình 8B tham số (Llama 3 8B, Mistral 7B)54,0% lượt tải AI cục bộ là các mô hình quy mô 7B-8B tham sốHugging Face Model Download Analytics
Quy mô tham số tầm trung (mô hình 70B — Llama 3 70B, Qwen 2.5 72B) chạy trên GPU kép hoặc Mac Studio28,0% triển khai tự lưu trữ của doanh nghiệp sử dụng mô hình 70BOllama / VLLM Production Deployment Survey

Yêu cầu bộ nhớ video GPU liên kết với thống kê VRAM của GPU của chúng tôi. Nguồn: Stack Overflow Developer Survey.

3. Toán học lượng tử hóa: Giảm -72% bộ nhớ và tốc độ 120 token/giây

Lượng tử hóa số nguyên sau đào tạo nén các tensor trọng số dấu phẩy động với sự suy giảm độ phức tạp (perplexity) không đáng kể. GGUF 4-bit giúp giảm -72,0% dung lượng RAM (llama.cpp).

Chỉ số thông lượng: các mô hình 8B Q4 tạo ra từ 85 đến 140 tok/s trên GPU tiêu dùng (Metal/CUDA), cho phép chạy cục bộ với 6 GB VRAM trong khi mô hình 70B vừa vặn trong giới hạn 48 GB bộ nhớ.

Chỉ sốGiá trịNguồn
Hiệu quả lượng tử hóa mô hình: mức giảm dung lượng bộ nhớ của GGUF / AWQ 4-bit (Q4_K_M) so với 16-bit đầy đủ (FP16)Giảm -72,0% dung lượng bộ nhớ VRAMllama.cpp / Georgi Gerganov Benchmarks
Tăng tốc suy luận: tốc độ tạo token đạt được bởi mô hình 8B lượng tử hóa 4-bit trên GPU hiện đại (RTX 4080 / Apple M3 Max)85,0 đến 140,0 token mỗi giây (tok/s)llama.cpp / Apple Silicon Metal Benchmarks
Yêu cầu bộ nhớ phần cứng: dung lượng bộ nhớ hợp nhất / VRAM tối thiểu để chạy mô hình 70B lượng tử hóa 4-bitCần 40 đến 48 GB VRAM / bộ nhớ hợp nhất cho 70B Q4TheBloke GGUF Model Hardware Guides

Các thành phần phần cứng máy tính liên kết với thống kê thị trường PC của chúng tôi. Nguồn: llama.cpp Benchmarks.

4. Kinh tế doanh nghiệp: 52% tự lưu trữ và tiết kiệm -75% chi phí suy luận

Các quy định tuân thủ nghiêm ngặt và tính kinh tế đơn vị ở quy mô lớn thúc đẩy việc sử dụng cơ sở hạ tầng riêng biệt. Databricks ghi nhận 52,0% nhóm kỹ thuật Fortune 500 tự lưu trữ mô hình.

Tối ưu hóa chi phí: công cụ vLLM thông lượng cao mang lại mức tiết kiệm -65% đến -80% so với API lưu trữ sẵn (SemiAnalysis), với 84,0% sử dụng LoRA/QLoRA để tinh chỉnh chi phí thấp.

Chỉ sốGiá trịNguồn
Tự lưu trữ nội bộ tại doanh nghiệp: các công ty tự lưu trữ mô hình trọng số mở vì quyền tự chủ và bảo mật dữ liệu52,0% nhóm công nghệ Fortune 500 tự lưu trữ mô hình mởDatabricks State of Data + AI / Gartner
Tiết kiệm chi phí suy luận đám mây: mức giảm chi phí khi tự lưu trữ mô hình mở (qua vLLM / TGI) so với API độc quyền ở quy mô lớnGiảm -65% đến -80% chi phí suy luận ở khối lượng lớnSemiAnalysis / Anyscale Cost Comparison Benchmark
Tinh chỉnh theo miền chuyên sâu: tỷ lệ mô hình doanh nghiệp tùy chỉnh được huấn luyện qua kỹ thuật hiệu quả tham số LoRA / QLoRA84,0% tác vụ tinh chỉnh của doanh nghiệp sử dụng LoRA/QLoRAHugging Face PEFT Library Telemetry

Kiến trúc RAG với cơ sở dữ liệu vector liên kết với thống kê cơ sở dữ liệu vector của chúng tôi. Nguồn: Databricks State of Data + AI.

5. Cấp phép và quản trị: 58% giấy phép thông thoáng và 18% mô hình hợp nhất

Các mô hình cấp phép thông thoáng cho phép doanh nghiệp xây dựng tài sản trí tuệ thương mại riêng mà không chịu gánh nặng phí bản quyền. 58,0% mô hình mở mang giấy phép Apache 2.0 hoặc MIT.

Đổi mới cộng đồng: 18,0% mô hình xếp hạng hàng đầu trên Hugging Face sử dụng phương pháp hợp nhất mô hình MergeKit, kết hợp các năng lực chuyên biệt vào trọng số duy nhất mà không cần đào tạo lại.

Chỉ sốGiá trịNguồn
Phân phối giấy phép mã nguồn mở: các mô hình được phát hành theo giấy phép thông thoáng thân thiện với thương mại (Apache 2.0, MIT)58,0% mô hình mở sử dụng giấy phép Apache 2.0 hoặc MITHugging Face License Census / Linux Foundation
Áp dụng giấy phép Meta Community: các mô hình có ngưỡng người dùng hoạt động hàng tháng (hạn chế giấy phép >700M MAU)26,0% lượt tải trọng số mở hàng đầu sử dụng giấy phép Meta LlamaMeta Platforms Open Source Legal Disclosures
Mô hình hợp nhất cộng đồng: mức độ phổ biến của các mô hình lai tạo qua Hợp nhất Mô hình (MergeKit — kết hợp trọng số SLERP/DARE)18,0% mô hình mở hàng đầu trên Hugging Face là mô hình hợp nhấtHugging Face Open LLM Leaderboard

Hợp tác phần mềm mã nguồn mở liên kết với thống kê phần mềm mã nguồn mở của chúng tôi. Nguồn: Linux Foundation Generative AI Survey.

6. Sức mạnh đa ngôn ngữ & lập trình: 120 ngôn ngữ và không bị khóa nhà cung cấp

Đóng góp toàn cầu đã tạo ra các kiến trúc chuyên biệt xuất sắc cho lập trình và các ngôn ngữ thế giới. Qwen và DeepSeek hỗ trợ hơn 120 ngôn ngữ với các bộ mã hóa (tokenizer) gốc.

Độc lập về kiến trúc: 74,0% kỹ sư phần mềm chọn các mô hình nền tảng trọng số mở để duy trì quyền riêng tư dữ liệu và loại bỏ vĩnh viễn sự phụ thuộc vào nhà cung cấp (Linux Foundation).

Chỉ sốGiá trịNguồn
Năng lực đa ngôn ngữ của LLM mở: các mô hình trọng số mở đa ngôn ngữ hàng đầu (Alibaba Qwen 2.5, Mistral NeMo, DeepSeek)120+ ngôn ngữ được hỗ trợ với tokenizer gốcAlibaba Cloud / Mistral AI Technical Reports
Trợ lý viết mã nguồn mở: các mô hình lập trình trọng số mở (Qwen 2.5 Coder, DeepSeek Coder V2, StarCoder 2)68,0% người dùng công cụ mã nguồn mở sử dụng DeepSeek/Qwen CoderHugging Face Code Model Leaderboard
Niềm tin của nhà phát triển: kỹ sư phần mềm ưu tiên mô hình trọng số mở hơn API thương mại để tránh bị khóa vào nhà cung cấp74,0% kỹ sư khẳng định mô hình mở ngăn ngừa vendor lock-inLinux Foundation Generative AI Survey

Tóm tắt: LLM mã nguồn mở qua các con số

Chỉ sốGiá trịNguồn chính
Mô hình được lưu trữ trên Hugging Face Hub1,25+ Triệu mô hìnhHugging Face Telemetry
Lượt tải tích lũy của Meta Llama350,0+ Triệu lượt tảiMeta Platforms Disclosures
Khoảng cách điểm Elo so với mô hình độc quyền (LMSYS)Cách biệt <15 điểm EloLMSYS Chatbot Arena
Nhà phát triển AI chạy mô hình cục bộ62,0% nhà phát triển AIStack Overflow / Ollama
Lượt tải cục bộ ở quy mô 7B-8B tham số54,0% lượt tải cục bộHugging Face Analytics
Triển khai nội bộ tại doanh nghiệp dùng 70B28,0% hệ thống tự lưu trữOllama / VLLM Survey
Giảm dung lượng RAM nhờ lượng tử hóa GGUF 4-bitGiảm -72,0% dung lượng VRAMllama.cpp Benchmarks
Tốc độ tạo token (8B Q4 trên GPU)85 - 140 token/giâyllama.cpp Metal Tests
RAM cần thiết cho mô hình 70B Q440 - 48 GB VRAMGGUF Hardware Guides
Các nhóm Fortune 500 tự lưu trữ mô hình mở52,0% nhóm công nghệDatabricks State of AI
Tiết kiệm chi phí suy luận tự lưu trữ vs APITiết kiệm -65% đến -80% chi phíSemiAnalysis / Anyscale
Tinh chỉnh doanh nghiệp sử dụng LoRA / QLoRA84,0% dùng LoRA/QLoRAHugging Face PEFT Data
Mô hình mở có giấy phép Apache 2.0 / MIT58,0% giấy phép thông thoángHugging Face / Linux Fdn
Mô hình bảng xếp hạng Hugging Face từ hợp nhất18,0% mô hình hợp nhấtOpen LLM Leaderboard
Kỹ sư ưu tiên mô hình mở để tránh lock-in74,0% ưu tiên mô hình mởLinux Foundation Survey

Phương pháp luận và nguồn dữ liệu

Các số liệu thống kê trong báo cáo này được tổng hợp từ kho lưu trữ mô hình và dữ liệu viễn trắc của Hugging Face và GitHub, các thông cáo chính thức của Meta Platforms Inc., dữ liệu đánh giá mù từ LMSYS Chatbot Arena, dữ liệu môi trường nhà phát triển từ llama.cpp và Ollama, khảo sát AI doanh nghiệp từ Databricks và Linux Foundation, cùng các phân tích chi phí bán dẫn từ SemiAnalysis.

Dùng thử VoxBooster — 3 ngày dùng thử miễn phí.

Nhân bản giọng thời gian thực, soundboard và hiệu ứng — ở mọi nơi bạn đã nói chuyện.

  • Không cần thẻ tín dụng
  • ~30ms độ trễ
  • Discord · Teams · OBS
Dùng thử miễn phí 3 ngày