Estatísticas do Hugging Face (2026): Mais de 60 Dados sobre Downloads de Modelos, Famílias de Pesos Abertos e Segurança do Hub

Estatísticas do Hugging Face 2026: 3.012.377 modelos públicos, 1 milhão de conjuntos de dados, 41% dos downloads em modelos chineses e US$ 13 bilhões da Nvidia.

A Hugging Face listava 3.012.377 modelos públicos em 22 de agosto de 2026, e cerca de 85,6% de todos os modelos do Hub têm menos de 200 downloads ao longo de toda a vida. Só em 2025, o Hub ganhou 1.184.880 modelos, passou de 1 milhão de conjuntos de dados públicos no verão de 2026 e os modelos chineses já respondem por 41% dos downloads. Em setembro de 2026, a NVIDIA concordou em comprar a empresa em uma transação de cerca de US$ 13 bilhões, quase três vezes sua última avaliação privada. Reunimos dados dos relatórios State of Open Models e State of Open Source da Hugging Face, do documento da NVIDIA na SEC, do Stanford AI Index 2026, do GitHub Octoverse 2025, da Linux Foundation Research, da Protect AI, da RedMonk e da AI Forensics. Para um panorama mais amplo, veja nossos levantamentos de estatísticas de IA de código aberto e de estatísticas de LLMs de código aberto.

TL;DR

  • 3.012.377 modelos públicos no Hub em 22 de agosto de 2026 (contagens da API do Hub compiladas por Ivan Fioravanti, blog da Hugging Face 2026)
  • Os conjuntos de dados públicos cresceram de 711.000 para 1 milhão entre janeiro e agosto de 2026 (Hugging Face, State of Open Models: Summer 2026)
  • 85,6% dos modelos têm menos de 200 downloads ao longo da vida, e 1,5% dos repositórios concentram 99,2% dos downloads (Hugging Face, State of Open Models: Summer 2026)
  • Modelos com menos de 1B de parâmetros capturam 83% dos downloads de todos os tempos; modelos acima de 100B capturam 1% (Hugging Face, State of Open Models: Summer 2026)
  • Os modelos chineses responderam por 41% dos downloads do Hub no último ano (Hugging Face, State of Open Source: Spring 2026)
  • Desenvolvedores independentes agora geram 39% dos downloads, ante 17% antes de 2022 (Hugging Face, State of Open Source: Spring 2026)
  • O Qwen registrou 2.045 milhões de downloads no Hub em 2026 e 151.448 repositórios derivados (Hugging Face, State of Open Models: Summer 2026)
  • O melhor modelo fechado lidera o melhor modelo aberto por 3,3%, ante 0,5% em agosto de 2024 (Stanford HAI, AI Index Report 2026)
  • Os modelos fechados custam cerca de 6 vezes mais, em média, do que os modelos abertos concorrentes (Nagle e Yue, Linux Foundation 2025)
  • Mais de 1,1 milhão de repositórios públicos do GitHub importam SDKs de LLM, alta de 178% em relação ao ano anterior (GitHub, Octoverse 2025)
  • A NVIDIA concordou em pagar cerca de US$ 11,9 bilhões mais até US$ 1,0 bilhão em ações de retenção pela Hugging Face (NVIDIA Form 8-K, setembro de 2026)
  • A Protect AI sinalizou 352.000 problemas inseguros ou suspeitos em 51.700 modelos (Protect AI e Hugging Face, 2025)

1. Escala e Crescimento do Hub: Modelos, Conjuntos de Dados e Spaces

O primeiro milhão de modelos levou cerca de 940 dias para se acumular; o terceiro milhão levou 349 dias, segundo contagens da API do Hub compiladas por Ivan Fioravanti no blog da Hugging Face. A manchete é a velocidade, mas o detalhe é mais interessante: o segundo milhão levou 335 dias, então o ritmo absoluto deixou de acelerar. O ritmo de 2026 confirma isso. Com 747.497 modelos em cerca de 7,7 meses, o ritmo anualizado é de aproximadamente 1,16 milhão (747.497 / 7,7 x 12), praticamente estável em relação aos 1.184.880 modelos adicionados em 2025.

O crescimento que ainda acelera está fora da contagem de modelos. O relatório State of Open Models: Summer 2026, da própria Hugging Face, mostra os conjuntos de dados com alta de cerca de 41% e os Spaces com alta de 44% em sete meses, contra 21,5% dos modelos. O Hub está deixando de ser um depósito de pesos para se tornar um lugar onde vivem dados e aplicativos em execução.

MétricaValorFonte
Modelos públicos no Hub (22 de ago. de 2026)3.012.377Ivan Fioravanti, Three Million Models and Counting, blog da Hugging Face 2026
Repositórios públicos de modelos, jan. a ago. de 20262,43 milhões a 2,96 milhões (+21,5%)Hugging Face, State of Open Models: Summer 2026
Conjuntos de dados públicos, jan. a ago. de 2026711.000 a 1.000.000Hugging Face, State of Open Models: Summer 2026
Spaces públicos, jan. a ago. de 20261,00 milhão a 1,44 milhãoHugging Face, State of Open Models: Summer 2026
Modelos adicionados em 20251.184.880Ivan Fioravanti, blog da Hugging Face 2026
Modelos adicionados em 2026 até meados de agosto747.497Ivan Fioravanti, blog da Hugging Face 2026
Dias para adicionar o 2º e o 3º milhão de modelos335 e 349Ivan Fioravanti, blog da Hugging Face 2026
Usuários da Hugging Face (2025)13 milhõesHugging Face, State of Open Source: Spring 2026

Contexto: o número de 3.012.377 conta apenas repositórios públicos. Repositórios privados não estão incluídos, então o total real de modelos hospedados é maior.

2. Downloads: Uma Cauda Muito Longa com uma Cabeça Muito Curta

1,5% dos repositórios concentram 99,2% de todos os downloads na Hugging Face. O Hub se comporta menos como uma loja de aplicativos e mais como um arquivo de pesquisa, em que alguns milhares de títulos são lidos o tempo todo e milhões são arquivados uma única vez. Para quem publica um modelo, a taxa de base é sóbria: o upload mediano quase não tem uso.

O outro padrão é o tamanho. Os modelos pequenos vencem a disputa de downloads por larga margem, porque são os que estão ligados a pipelines de produção que baixam de novo a cada build. O modelo mais baixado de 2026, o modelo de embeddings de sentenças all-MiniLM-L6-v2, foi baixado 1,55 bilhão de vezes em sete meses, segundo o State of Open Models: Summer 2026. As contagens de downloads medem máquinas pelo menos tanto quanto pessoas.

MétricaValorFonte
Modelos com menos de 200 downloads ao longo da vida~85,6%Hugging Face, State of Open Models: Summer 2026
Parcela dos downloads capturada pelos 1,5% principais repositórios99,2%Hugging Face, State of Open Models: Summer 2026
Parcela dos downloads que vai para os 200 principais modelos (0,01%)49,6%Hugging Face, State of Open Source: Spring 2026
Parcela dos downloads de todos os tempos, modelos com menos de 1B de parâmetros83%Hugging Face, State of Open Models: Summer 2026
Parcela dos downloads de todos os tempos, modelos acima de 100B de parâmetros1%Hugging Face, State of Open Models: Summer 2026
Downloads do all-MiniLM-L6-v2, primeiros sete meses de 20261,55 bilhãoHugging Face, State of Open Models: Summer 2026
Downloads analisados no estudo longitudinal do Hub (jun. de 2020 a ago. de 2025)2,2 bilhões em 851.000 modelosLongpre et al., Economies of Open Intelligence 2025

Nota sobre divergência: o relatório Spring 2026 dizia que aproximadamente metade dos modelos tinha menos de 200 downloads no total, enquanto o relatório de verão diz que cerca de 85,6% têm menos de 200 downloads ao longo da vida. Os dois relatórios foram publicados com cinco meses de intervalo e não explicitam regras de contagem idênticas, então trate a parcela exata como indicativa. Ambos concordam que o modelo mediano é pouquíssimo usado.

3. Quem Constrói a IA Aberta: China, Qwen e Desenvolvedores Independentes

Os modelos chineses responderam por 41% dos downloads da Hugging Face no último ano, ultrapassando os Estados Unidos, segundo o State of Open Source on Hugging Face: Spring 2026. A segunda mudança é menos comentada, mas igualmente grande: os laboratórios da indústria caíram de cerca de 70% dos downloads antes de 2022 para cerca de 37%, enquanto os desenvolvedores independentes e sem afiliação subiram de 17% para 39%. A IA aberta hoje é construída, em sua maioria, por pessoas que não estão na folha de pagamento de um grande laboratório.

O Qwen é onde as duas tendências se encontram. A Hugging Face conta 151.448 repositórios derivados baseados no Qwen, 2,6 vezes toda a presença da Meta e 4,7 vezes o Llama sozinho. Os derivados medem influência melhor do que os downloads brutos, porque mostram qual modelo-base as pessoas escolhem para ajustar e lançar. No topo, os laboratórios chineses também definem o teto de tamanho: os lançamentos mensais chegaram a entre 754B e 2,78 trilhões de parâmetros em 2026, enquanto o teto dos EUA ficou abaixo de 130B em cinco de sete meses (Hugging Face, State of Open Models: Summer 2026).

MétricaValorFonte
Parcela dos modelos chineses nos downloads do Hub, último ano41%Hugging Face, State of Open Source: Spring 2026
Parcela de downloads atribuída por desenvolvedor, ano recente: China vs. EUA17,1% vs. 15,8%Longpre et al., Economies of Open Intelligence 2025
Parcela dos downloads de desenvolvedores independentes e sem afiliação39% (17% antes de 2022)Hugging Face, State of Open Source: Spring 2026
Parcela da indústria nos downloads~37% (~70% antes de 2022)Hugging Face, State of Open Source: Spring 2026
Downloads do Qwen no Hub em 20262.045 milhões (2.061 milhões incluindo todos os repositórios)Hugging Face, State of Open Models: Summer 2026
Repositórios derivados baseados no Qwen151.448 (2,6x a Meta, 4,7x o Llama)Hugging Face, State of Open Models: Summer 2026
Downloads mensais de GGUF: Qwen, Gemma, Llama39,6 milhões, 20,8 milhões, 7,5 milhõesHugging Face, State of Open Models: Summer 2026
Downloads do Qwen declarados pela Alibaba (todos os canais)mais de 3 bilhõesAlibaba, segundo o The Next Web, ago. de 2026

Contexto: o número de 41% e a divisão de 17,1% vs. 15,8% do artigo Economies of Open Intelligence usam métodos de atribuição e janelas de tempo diferentes, então não são diretamente comparáveis. A afirmação de 3 bilhões da Alibaba é cerca de um terço maior do que o registrado pelo próprio Hub, segundo a comparação do The Next Web; a diferença provavelmente reflete downloads de canais fora da Hugging Face.

4. Tamanho dos Modelos, Formatos e Ferramentas

O modelo médio do Hub passou de 827 milhões de parâmetros em 2023 para 20,8 bilhões em 2025, enquanto a mediana foi apenas de 326 milhões para 406 milhões (Hugging Face, State of Open Source: Spring 2026). Essa divisão diz tudo sobre o ecossistema: um punhado de lançamentos em escala de fronteira puxa a média para cima, enquanto o upload típico continua sendo um ajuste fino pequeno e barato.

Os dados de formato mostram para onde vai essa demanda por modelos pequenos. Os repositórios do Hub que declaram a biblioteca GGUF cresceram 464% em 2026, contra 16% de transformers e peft, segundo o State of Open Models: Summer 2026. O GGUF é o formato da inferência local em notebooks e desktops, e o MLX da Apple (+148%) aponta na mesma direção. A robótica é a outra grande novidade: os conjuntos de dados de robótica passaram de 1.145 em 2024 para 26.991 em 2025, saindo da 44ª posição para se tornar a maior categoria de conjuntos de dados.

MétricaValorFonte
Tamanho médio dos modelos, 2023 a 2025827 milhões a 20,8 bilhões de parâmetrosHugging Face, State of Open Source: Spring 2026
Tamanho mediano dos modelos, 2023 a 2025326 milhões a 406 milhões de parâmetrosHugging Face, State of Open Source: Spring 2026
Crescimento do tamanho médio dos modelos, 2020 a 202517xLongpre et al., Economies of Open Intelligence 2025
Crescimento da adoção de quantização5xLongpre et al., Economies of Open Intelligence 2025
Crescimento das arquiteturas de mistura de especialistas7xLongpre et al., Economies of Open Intelligence 2025
Crescimento em 2026 dos repositórios que declaram GGUF / LeRobot / MLX+464% / +194% / +148%Hugging Face, State of Open Models: Summer 2026
Conjuntos de dados de robótica, 2024 a 20251.145 a 26.991Hugging Face, State of Open Source: Spring 2026

Contexto: os agentes de programação já são um cliente mensurável do Hub. No tráfego marcado como de agentes via huggingface_hub e a CLI hf, o Claude Code detinha 44,4% em julho de 2026 (ante 67,8% em abril), enquanto o Codex subiu de 10,4% para 20,8% (Hugging Face, State of Open Models: Summer 2026). Nosso levantamento de estatísticas de agentes de IA acompanha o mercado de agentes como um todo.

5. Aberto vs. Fechado: Desempenho, Custo e Adoção por Desenvolvedores

Os modelos abertos perderam um pouco de terreno em qualidade bruta em 2025: em março de 2026, o melhor modelo fechado lidera o melhor modelo aberto por 3,3%, ante 0,5% em agosto de 2024, e seis dos dez primeiros modelos da Arena são fechados (Stanford HAI, AI Index Report 2026). O mesmo relatório coloca a vantagem dos EUA sobre a China em apenas 2,7%.

O preço conta outra história. Usando dados da OpenRouter, Frank Nagle e Daniel Yue constataram que os modelos fechados ficam com cerca de 80% do uso e 96% da receita, embora custem cerca de seis vezes mais em média, enquanto os modelos abertos chegam rotineiramente a 90% ou mais do desempenho dos modelos fechados em benchmarks (Linux Foundation, Revealing the Hidden Economics of Open Models 2025). A distância entre aberto e fechado é menos uma lacuna de capacidade e mais uma lacuna de hábito e integração, e isso vale uma economia não realizada estimada em US$ 24,8 bilhões por ano.

MétricaValorFonte
Vantagem do melhor modelo fechado sobre o melhor modelo aberto (mar. de 2026)3,3% (0,5% em ago. de 2024)Stanford HAI, AI Index Report 2026
Modelos fechados entre os 10 primeiros da Arena6 de 10Stanford HAI, AI Index Report 2026
Parcela dos modelos fechados no uso / na receita de LLMs~80% / 96%Nagle e Yue, Linux Foundation 2025
Custo médio dos modelos fechados vs. modelos abertos concorrentes~6x maiorNagle e Yue, Linux Foundation 2025
Economia anual não realizada estimada com modelos abertosUS$ 24,8 bilhões (faixa de US$ 20 a 48 bilhões)Nagle e Yue, Linux Foundation 2025
Organizações que adotam IA e usam IA de código aberto em algum ponto de sua pilha tecnológica89%Linux Foundation Research, Economic and Workforce Impacts of Open Source AI 2025
Repositórios públicos do GitHub que importam SDKs de LLMmais de 1,1 milhão (+178% em relação ao ano anterior)GitHub, Octoverse 2025
Repositórios relacionados a IA no GitHub4,3 milhõesGitHub, Octoverse 2025

Contexto: dois terços das organizações da pesquisa da Linux Foundation Research dizem que a IA de código aberto é mais barata de implantar (o estudo foi encomendado pela Meta). O Octoverse 2025 do GitHub acrescenta que seis dos dez projetos de código aberto de crescimento mais rápido por número de contribuidores eram de infraestrutura de IA: a camada de serviço e orquestração que transforma os pesos do Hub em endpoints de produção é para onde os contribuidores estão indo.

6. O Negócio: Receita, Avaliação e o Acordo com a NVIDIA

O Form 8-K da NVIDIA, de 2 de setembro de 2026, descreve um preço de compra de aproximadamente US$ 11,9 bilhões mais um programa de retenção em ações de até cerca de US$ 1,0 bilhão, ou seja, cerca de US$ 13 bilhões no total. Isso é cerca de 2,9 vezes a avaliação pós-investimento de US$ 4,5 bilhões da rodada de 2023 (US$ 13 bi / US$ 4,5 bi), e vem meses depois de a Hugging Face recusar um investimento de US$ 500 milhões da NVIDIA a uma avaliação de US$ 7 bilhões, como noticiou o TechCrunch.

O lado da receita é mais fino do que o preço sugere. A empresa de pesquisa Sacra estima a receita recorrente anual (ARR) em US$ 150 milhões em agosto de 2026, ante US$ 81 milhões no fim de 2025. Com essas estimativas, o negócio avalia a Hugging Face em cerca de 86 vezes o ARR (US$ 12,9 bi / US$ 150 mi). O comprador está pagando por distribuição: o lugar padrão onde pesos abertos são publicados, encontrados e levados para produção.

MétricaValorFonte
Preço de compra pagável aos acionistas~US$ 11,9 bilhõesNVIDIA Form 8-K, set. de 2026
Programa de retenção em ações para funcionáriosaté ~US$ 1,0 bilhãoNVIDIA Form 8-K, set. de 2026
Fechamento esperadoPrimeiro semestre de 2027, sujeito a aprovações regulatóriasNVIDIA Form 8-K, set. de 2026
Avaliação pós-investimento, rodada de 2023US$ 4,5 bilhõesTechCrunch, ago. de 2026
Oferta de investimento da NVIDIA recusada (2026)US$ 500 milhões a uma avaliação de US$ 7 bilhõesTechCrunch, ago. de 2026
ARR estimado, agosto de 2026US$ 150 milhõesSacra, Hugging Face revenue estimates 2026
ARR estimado, fim de 2025 e fim de 2024US$ 81 milhões e US$ 53 milhõesSacra, Hugging Face revenue estimates 2026
Total de capital primário captado antes do acordoUS$ 396 milhõesSacra, Hugging Face revenue estimates 2026

Contexto: os números de receita da Sacra são estimativas de terceiros; a Hugging Face não publicou demonstrações financeiras auditadas. A Sacra também informa que mais de 30% das empresas da Fortune 500 mantêm contas verificadas na Hugging Face.

7. Segurança, Licenciamento e Lacunas de Proteção

Um hub aberto também é uma superfície de ataque aberta. A Protect AI sinalizou 352.000 problemas inseguros ou suspeitos em 51.700 modelos após analisar 4,47 milhões de versões únicas de modelos em 1,41 milhão de repositórios (Protect AI e Hugging Face, 4M Models Scanned 2025). Em uma plataforma em que carregar um checkpoint baseado em pickle pode executar código, uma pequena parcela de arquivos ruins ainda é um grande risco em termos absolutos.

2026 trouxe um novo modelo de ameaça. A linha do tempo técnica da Hugging Face sobre o incidente de julho registra cerca de 4,5 dias de intrusão (de 9 a 13 de julho), aproximadamente 17.600 ações recuperadas e 136 chaves expostas em uma única leitura de produção; investigadores da METR e da Redwood Research estimam em cerca de 700 o número de agentes da OpenAI envolvidos, número que a OpenAI aceitou (NBC News, ago. de 2026). A segurança de conteúdo é a terceira lacuna: a AI Forensics constatou que 7 dos 9 Spaces de edição de imagens mais bem ranqueados despiam uma pessoa vestida com um único prompt e, em sua amostra de solicitações monitoradas, 95% tinham mulheres como alvo. Nosso levantamento de estatísticas de deepfake cobre o quadro mais amplo de uso indevido.

MétricaValorFonte
Versões únicas de modelos / repositórios analisados4,47 milhões / 1,41 milhãoProtect AI e Hugging Face, 2025
Problemas inseguros ou suspeitos sinalizados352.000 em 51.700 modelosProtect AI e Hugging Face, 2025
Modelos do Hub sem designação de licençaQuase 70% de ~2,9 milhões analisadosRedMonk, License Distribution on Hugging Face, maio de 2026
Projetos licenciados sob uma licença aprovada pela OSIMais de dois terçosRedMonk, License Distribution on Hugging Face, maio de 2026
Lançamentos chineses de 20B+ em 2026 sob Apache 2.0 / MIT59% / 22% de 178Hugging Face, State of Open Models: Summer 2026
Intrusão de agentes em julho de 2026: duração e ações recuperadas~4,5 dias, ~17.600 açõesHugging Face, Agent Intrusion Technical Timeline 2026
Spaces de edição de imagens com alguma moderação de saída3%AI Forensics, Unmoderated by Design, julho de 2026
Solicitações monitoradas a Spaces de teor sexual / com menor como alvo73% / 6,7%AI Forensics, Unmoderated by Design, julho de 2026

Contexto: a análise de licenças da RedMonk mostra que a Apache-2.0 tem cerca de 2,5 vezes mais projetos licenciados do que a MIT, e o artigo Economies of Open Intelligence constatou que os modelos de pesos abertos superaram, pela primeira vez em 2025, os modelos verdadeiramente de código aberto (com dados de treinamento abertos). Pesos abertos e código aberto estão divergindo.

Resumo: Hugging Face em Números

MétricaValorFonte
Modelos públicos (22 de ago. de 2026)3.012.377Ivan Fioravanti, blog da Hugging Face 2026
Modelos adicionados em 20251.184.880Ivan Fioravanti, blog da Hugging Face 2026
Conjuntos de dados públicos (ago. de 2026)1.000.000Hugging Face, State of Open Models: Summer 2026
Usuários (2025)13 milhõesHugging Face, State of Open Source: Spring 2026
Modelos com menos de 200 downloads ao longo da vida~85,6%Hugging Face, State of Open Models: Summer 2026
Parcela dos downloads dos 1,5% principais repositórios99,2%Hugging Face, State of Open Models: Summer 2026
Parcela dos modelos chineses nos downloads41%Hugging Face, State of Open Source: Spring 2026
China vs. EUA em downloads atribuídos por desenvolvedor17,1% vs. 15,8%Longpre et al., Economies of Open Intelligence 2025
Repositórios derivados do Qwen151.448Hugging Face, State of Open Models: Summer 2026
Diferença de desempenho entre modelos fechados e abertos (mar. de 2026)3,3%Stanford HAI, AI Index Report 2026
Parcela dos modelos fechados no uso / na receita de LLMs~80% / 96%Nagle e Yue, Linux Foundation 2025
Sobrepreço dos modelos fechados em relação aos abertos~6xNagle e Yue, Linux Foundation 2025
Organizações que adotam IA e usam IA de código aberto89%Linux Foundation Research 2025
Repositórios do GitHub que importam SDKs de LLMmais de 1,1 milhão (+178% em relação ao ano anterior)GitHub, Octoverse 2025
Repositórios relacionados a IA no GitHub4,3 milhõesGitHub, Octoverse 2025
Preço de compra da NVIDIA + ações de retenção~US$ 11,9 bilhões + até ~US$ 1,0 bilhãoNVIDIA Form 8-K, set. de 2026
ARR estimado (ago. de 2026)US$ 150 milhõesSacra 2026
Problemas inseguros ou suspeitos sinalizados352.000 em 51.700 modelosProtect AI e Hugging Face, 2025
Modelos do Hub sem licençaQuase 70%RedMonk, maio de 2026

Metodologia e Fontes

Última atualização: 3 de outubro de 2026. Atualizamos este levantamento trimestralmente, e a próxima revisão é esperada quando a Hugging Face publicar seu próximo relatório semestral State of Open Models.

Experimente o VoxBooster — 3 dias grátis.

Clone de voz em tempo real, soundboard e efeitos — onde você já fala.

  • Sem cartão
  • ~30ms de latência
  • Discord · Teams · OBS
Experimentar 3 dias grátis