Мировые капитальные затраты на инфраструктуру GPU-кластеров достигли $68,0 млрд, так как передовые кластеры обучения масштабировались до 100 000–150 000 объединенных GPU с энергопотреблением 100–150 МВт, 84,2% суперкомпьютеров TOP500 используют GPU, а кластеры на 100k чипов выдерживают 8,5–14 аппаратных сбоев ежедневно. В то время как InfiniBand занимает 68% сетевой инфраструктуры кластеров, а строительство дата-центров на 100k GPU обходится в $4,0 млрд, 62% мощностей сосредоточено в США, а 24% запланированных мегакластеров изучают возможность использования атомной энергии. Приведенные ниже данные основаны на эмпирических исследованиях TOP500, Meta FAIR, SemiAnalysis, Uptime Institute, FERC, 650 Group и Epoch AI.
TL;DR
- Ежегодные мировые капзатраты на ИИ-мегакластеры и GPU-суперкомпьютеры достигли $68,0 млрд
- Передовые кластеры для обучения искусственного интеллекта масштабируются от 100 000 до 150 000 объединенных GPU
- 84,2% мощнейших суперкомпьютеров рейтинга TOP500 используют узлы с GPU-ускорителями (TOP500)
- Суперкомпьютерный мегакластер на 100 000 GPU потребляет от 100 до 150 мегаватт (МВт) постоянной мощности
- Современные дата-центры для ИИ достигают показателя энергоэффективности PUE от 1,12 до 1,18
- Ожидание подключения к электросетям мощностью более 100 МВт составляет в среднем от 3,5 до 5,0 лет (FERC)
- Сетевая архитектура NVIDIA InfiniBand обеспечивает работу 68,0% передовых обучающих кластеров (32% используют Ethernet RoCE v2)
- Кластер на 100k GPU в среднем испытывает от 8,5 до 14,0 аппаратных сбоев компонентов в день (Meta FAIR)
- Среднее время безотказной работы (MTBF) в кластерах на 100k GPU составляет от 2,8 до 4,2 часа до критического сбоя
- 12,0% общего времени обучения на суперкомпьютере тратится на запись, синхронизацию и восстановление чекпоинтов весов
- Строительство ИИ-мега-дата-центра на 100 000 GPU требует около $4,00 млрд капитальных затрат (SemiAnalysis)
- 24,0% вновь планируемых ИИ-мега-дата-центров мощностью >500MW изучают прямое подключение к ядерной энергии
- 62,0% мировых мощностей передовых суперкомпьютерных кластеров ИИ географически сосредоточено в США
1. Передовая инфраструктура: $68B капекса и кластеры на 150 000 GPU
Обучение базовых моделей следующего поколения с триллионами параметров требует массивных параллельных суперкомпьютеров. SemiAnalysis оценивает годовой капекс GPU-кластеров в $68,0 млрд.
Масштабирование кластеров: ведущие лаборатории развертывают от 100 000 до 150 000 объединенных GPU (Meta FAIR/xAI), при этом 84,2% суперкомпьютеров TOP500 оснащены узлами с GPU-ускорителями.
| Метрика | Значение | Источник |
|---|---|---|
| Мировые капзатраты на инфраструктуру ИИ-мегакластеров и GPU-суперкомпьютеров (гиперскейлеры и суверенный ИИ) | $68,0 млрд ежегодного капекса на GPU-кластеры | SemiAnalysis / Synergy Research Group / IDC |
| Масштаб передовых кластеров обучения: число объединенных GPU в крупнейших рабочих ИИ-кластерах мира | От 100 000 до 150 000 объединенных GPU на мегакластер | Meta FAIR (кластер Llama 4) / Данные xAI Colossus |
| Рейтинг суперкомпьютеров TOP500: доля 500 мощнейших суперкомпьютеров мира с узлами GPU-ускорителей | 84,2% суперкомпьютеров TOP500 используют GPU-ускорители | Официальный рейтинг суперкомпьютеров TOP500 (июнь 2026) |
Характеристики полупроводникового оборудования для ИИ связаны с нашей статистикой рынка ИИ-чипов. Источник: TOP500 Supercomputer Rankings.
2. Реалии энергетики: 150 Мегаватт, PUE 1,15 и 4 года ожидания в энергосетях
Обеспечение непрерывной базовой мощности в гигаваттных масштабах заменило доступность чипов в качестве главного узкого места масштабирования. Кластер на 100k GPU потребляет от 100 до 150 МВт мощности.
Задержки подключения: согласование подключения к электросетям мощностью более 100 МВт занимает 3,5–5,0 лет (FERC/Berkeley Lab), тогда как специализированные дата-центры демонстрируют эффективный PUE от 1,12 до 1,18 (Uptime Institute).
| Метрика | Значение | Источник |
|---|---|---|
| Энергопотребление мегакластера на 100k GPU (включая вычисления, сеть и жидкостное охлаждение) | От 100 до 150 мегаватт (МВт) постоянной электроэнергии | SemiAnalysis Cluster Power Architecture / IEEE |
| Эффективность использования энергии (PUE): средний рейтинг энергоэффективности современных ИИ-дата-центров | От 1,12 до 1,18 среднего коэффициента PUE | Uptime Institute Global Datacenter Survey |
| Задержки подключения к электросетям: среднее время ожидания дата-центром подключения к сети мощностью 100МВт+ | От 3,5 до 5,0 лет задержки в очереди на подключение к сети | Federal Energy Regulatory Commission (FERC) / Lawrence Berkeley Lab |
Электрическая инфраструктура центров обработки данных связана с нашей статистикой дата-центров. Источник: Uptime Institute Datacenter Survey.
3. Архитектура межсоединений: 68% InfiniBand и 1,8 ТБ/с NVLink
Тензорный параллелизм All-to-all требует неблокирующей пропускной способности бисекции с ультранизкой задержкой между стойками. 650 Group фиксирует 68,0% кластеров на базе InfiniBand.
Высокоскоростные фабрики: NVLink обеспечивает двунаправленную пропускную способность 1,8 ТБ/с на узел (NVIDIA), в то время как RoCE v2 Ethernet составляет 32,0% развертываний гиперскейлеров (Ultra Ethernet Consortium).
| Метрика | Значение | Источник |
|---|---|---|
| Сетевые протоколы межсоединений: доля NVIDIA Quantum-2 / Quantum-X800 InfiniBand в передовых кластерах | 68,0% передовых ИИ-кластеров используют InfiniBand | 650 Group / Crehan Research Datacenter Networking |
| Внедрение RoCE v2 (RDMA over Converged Ethernet) в корпоративных кластерах гиперскейлеров (Arista, Cisco, Broadcom) | 32,0% ИИ-кластеров развертывают RoCE v2 Ethernet | Данные Ultra Ethernet Consortium (UEC) |
| Сетевая пропускная способность бисекции: двунаправленная пропускная способность сети на узел GPU в кластерах NVLink | 1,8 терабайт в секунду (ТБ/с) пропускной способности NVLink | Технический отчет NVIDIA NVLink 5.0 |
Сетевая пропускная способность центров обработки данных связана с нашей статистикой дата-центров. Источник: 650 Group Networking Telemetry.
4. Надежность оборудования: 12 сбоев в день и 3-часовой цикл MTBF
Эксплуатация десятков тысяч тепловых модулей при пиковом напряжении приводит к постоянному износу компонентов. Meta FAIR фиксирует от 8,5 до 14,0 аппаратных сбоев в день.
Среднее время между сбоями: кластеры сталкиваются с неисправимым сбоем каждые 2,8–4,2 часа, из-за чего 12,0% общего вычислительного времени уходит на сохранение контрольных точек (чекпоинтов) на высокоскоростные массивы NVMe.
| Метрика | Значение | Источник |
|---|---|---|
| Частота отказов оборудования в кластерах на 100k GPU: среднее число сбоев GPU, HBM или оптических трансиверов в день | От 8,5 до 14,0 сбоев компонентов оборудования в день | Meta FAIR Llama 3 Infrastructure Retrospective |
| Среднее время безотказной работы (MTBF): среднее непрерывное время обучения до критического сбоя узла | От 2,8 до 4,2 часа среднего MTBF в кластерах на 100k GPU | Данные о надежности ИИ Google Cloud / Microsoft Azure |
| Накладные расходы на сохранение чекпоинтов: время на запись и восстановление весов моделей из параллельных NVMe | 12,0% общего времени обучения кластера тратится на чекпоинты | Databricks / MosaicML Training Benchmarks |
Непрерывность корпоративных ИТ-сервисов связана с нашей статистикой сбоев ИТ. Источник: Meta FAIR Infrastructure Retrospective.
5. Экономика капитала: мега-дата-центры за $4,0B и 68% доли кремния
Финансирование гигаваттной инфраструктуры требует инвестиционных синдикатов суверенного уровня. SemiAnalysis оценивает стоимость объекта на 100k GPU в $4,00 млрд.
Распределение CapEx: 68,0% капитала расходуется на кремниевые GPU ($2,7B), тогда как высокоскоростные оптические трансиверы 800G/1.6T и сетевые фабрики занимают 14,5% общих бюджетов (LightCounting).
| Метрика | Значение | Источник |
|---|---|---|
| Структура затрат CapEx на строительство ИИ-мега-дата-центра на 100 000 GPU ($3,5B–$4,5B общих капитальных затрат) | $4,00 млрд общих затрат на строительство и оборудование | SemiAnalysis Megacluster Cost Breakdown |
| Доля кремниевых GPU в общем бюджете CapEx мега-дата-центра (по сравнению с сетью, землей и подстанциями) | 68,0% общего бюджета расходуется непосредственно на кремний GPU | Synergy Research Group Infrastructure Analysis |
| Доля оптических трансиверов и оптики в общем CapEx кластера (оптические трансиверы 800G/1.6T) | 14,5% общего бюджета расходуется на высокоскоростную оптику | Отчет LightCounting по оптическим коммуникациям |
Оценка рынка полупроводников для ИИ связана с нашей статистикой рынка ИИ-чипов. Источник: SemiAnalysis Megacluster Cost Breakdown.
6. Геополитика и энергетика: 62% доли США и 24% проектов с атомной энергией
Национальная конкурентоспособность и углеродные ограничения стимулируют прямое совместное размещение с безуглеродными реакторами. 24,0% планируемых кластеров 500MW+ изучают атомную энергию.
Географическая концентрация: 62,0% передовых вычислительных мощностей ИИ сосредоточено в США (Epoch AI), при этом 28 стран запустили национальные суверенные кластеры суперкомпьютеров (OECD).
| Метрика | Значение | Источник |
|---|---|---|
| Интеграция атомной и чистой энергии: ИИ-мегакластеры рядом с АЭС или выделенными реакторами SMR | 24,0% вновь планируемых ИИ-дата-центров >500MW изучают ядерную энергию | Constellation Energy / Энергетические соглашения Microsoft |
| Глобальная географическая концентрация: доля мировых мощностей GPU-суперкомпьютеров в США | 62,0% глобальных мощностей суперкомпьютеров ИИ в США | Epoch AI Supercomputer Geography Census |
| Кластеры суверенных суперкомпьютеров ИИ: государства, финансирующие национальные суверенные GPU-кластеры (ЕС, Япония, ОАЭ, Великобритания) | 28 действующих национальных инициатив суверенных суперкомпьютеров ИИ | OECD AI Policy Observatory / Gartner |
Резюме: GPU-кластеры в цифрах
| Метрика | Значение | Основной источник |
|---|---|---|
| Ежегодный глобальный капекс GPU-кластеров | $68,0 млрд | SemiAnalysis / Synergy Research |
| Масштаб GPU в передовых кластерах обучения | 100k - 150k GPU/кластер | Meta FAIR / Данные xAI |
| Суперкомпьютеры TOP500 с GPU | 84,2% систем TOP500 | Официальный рейтинг TOP500 |
| Потребляемая мощность кластера на 100k GPU | 100 - 150 Мегаватт (МВт) | SemiAnalysis / IEEE |
| Энергоэффективность PUE ИИ-дата-центров | 1,12 - 1,18 средний PUE | Опрос Uptime Institute |
| Задержка в очереди на подключение к электросети | 3,5 - 5,0 лет задержки | FERC / Berkeley Lab |
| Доля InfiniBand в передовых кластерах | 68,0% доля InfiniBand | 650 Group / Crehan Research |
| Двунаправленная пропускная способность узла NVLink | 1,8 ТБ/с ширина полосы NVLink | Технический отчет NVIDIA |
| Сбои компонентов в день (100k GPU) | 8,5 - 14,0 сбоев/день | Данные об инфраструктуре Meta FAIR |
| Среднее время наработки на отказ (MTBF) | 2,8 - 4,2 часа MTBF | Данные Google Cloud / Azure |
| Время обучения, затрачиваемое на чекпоинты | 12,0% времени обучения | Databricks / MosaicML |
| Общий CapEx дата-центра на 100k GPU | $4,00 млрд общая стоимость | Анализ затрат SemiAnalysis |
| Доля кремния GPU в CapEx дата-центра | 68,0% общего бюджета | Synergy Research Group |
| Планируемые мегакластеры с изучением атомной энергии | 24,0% изучают атомную энергию | Constellation / Microsoft |
| Глобальная мощность ИИ-кластеров в США | 62,0% находится в США | Перепись суперкомпьютеров Epoch AI |
Методология и источники
Статистика в этом отчете собрана на основе бенчмарков суперкомпьютеров организации TOP500, официальных отчетов по инженерии инфраструктуры Meta Platforms Inc. (FAIR) и Google Cloud, анализов затрат и энергопотребления дата-центров SemiAnalysis и Synergy Research Group, данных энергосетей FERC, а также международных географических исследований Epoch AI и OECD.
-
TOP500 Organization & Meta Platforms (FAIR): TOP500 Supercomputer Rankings and Llama 3 Infrastructure Retrospective ($68B капекса, 84,2% GPU в TOP500, масштаб 100k-150k, 8,5-14 сбоев/день).
-
SemiAnalysis: Mega-Cluster Economics: 100k GPU Datacenter CapEx, Power Grids, and Optical Networking (стоимость $4,0B, мощность 100-150MW, 68% InfiniBand, 68% доля кремния).
-
Uptime Institute & Federal Energy Regulatory Commission (FERC): Datacenter Energy Efficiency (PUE) and Grid Queue Delays (PUE 1,12-1,18, очередь к сети 3,5-5,0 лет).
-
650 Group & Ultra Ethernet Consortium (UEC): Datacenter Networking Telemetry: InfiniBand vs RoCE v2 Ethernet (68% InfiniBand, 32% RoCE v2, 1,8 TB/s NVLink).
-
Epoch AI & OECD AI Policy Observatory: Geographical Distribution of AI Compute and Sovereign Supercomputers (доля США 62%, 28 суверенных инициатив, 24% атомная энергия).
-
Мониторинг данных: Статистика GPU-кластеров отражает взаимосвязанные высокопроизводительные суперкомпьютеры (HPC) и корпоративные дата-центры ИИ, содержащие более 10 000 узлов ускорителей. Небольшие локальные серверные стойки подразделений (<1 000 GPU) классифицируются отдельно.
-
Последнее обновление: Август 2026 г. Этот обзор обновляется ежеквартально по мере публикации полугодовых списков TOP500, отчетов Meta по инфраструктуре ИИ и аналитических обзоров дата-центров SemiAnalysis.