Орбитальные AI дата-центры обещают дешёвую энергию, масштабируемый compute и пассивное охлаждение. Но при переносе AI-инфраструктуры в космос главным ограничением становится не энергия и не охлаждение, а сеть. Особенно остро проблема проявляется при распределённом обучении больших языковых моделей (LLM).
Первое, во что упирается AI compute в космосе, — это не количество доступной энергии, а поведение распределённой системы при масштабировании.
На уровне физики концепция выглядит привлекательно. Запуск инфраструктуры на низкую околоземную орбиту (LEO) постепенно дешевеет, солнечная генерация обеспечивает высокую плотность мощности, а пассивное радиационное охлаждение потенциально снижает эксплуатационные расходы. В сравнении с наземным дата-центром мощностью 1 GW орбитальная архитектура может получить существенное преимущество по энергетике и охлаждению.
Но это только половина системы.
Вторая половина — сеть, и именно она определяет, насколько эффективно можно загрузить compute.
Главная проблема орбитальных AI дата-центров — топология сети
Наземные AI-кластеры строятся вокруг высокоскоростных Clos-сетей с высокой bisection bandwidth и низкой latency. Такая архитектура хорошо подходит для интенсивного обмена данными между ускорителями и поддерживает коммуникационные паттерны, необходимые для распределённого обучения.
В космосе ситуация принципиально другая.
Вместо фиксированной кабельной инфраструктуры используется mesh-сеть на базе лазерных inter-satellite links (ISL). Даже при высокой пропускной способности отдельных каналов общая производительность определяется уже не одним линком, а топологией всей сети: количеством hops, доступной bisection bandwidth, latency и возможностью быстро перестраивать маршруты.
Это превращает сеть из инфраструктурного компонента в фундаментальное ограничение орбитального AI compute.
Torus, mesh или «Clos in space»?
Выбор архитектуры становится компромиссом между физикой орбитальной группировки и требованиями распределённого AI.
2D- и 3D-torus-сети естественно соответствуют геометрии спутниковых созвездий. Они позволяют упростить маршрутизацию и сделать структуру сети более предсказуемой.
Цена — ограниченная пропускная способность отдельных разрезов сети (bisection bandwidth) и потенциальные проблемы с congestion и блокировками.
Теоретически возможен и другой подход — условный «Clos in space». Но для него потребуются дополнительные коммуникационные узлы и более сложная архитектура маршрутизации. В результате преимущество топологии наземных AI-кластеров переносится в космос ценой существенного усложнения системы.
Увеличение пропускной способности самих лазерных каналов с помощью WDM и free-space optics способно значительно улучшить ситуацию. Но даже очень быстрый линк не решает проблему latency, многохоповой маршрутизации и ограниченной bisection bandwidth всей сети.
Именно поэтому AI дата-центр в космосе нельзя оценивать только по скорости отдельного inter-satellite link.
Почему обучение LLM особенно чувствительно к сети
На уровне алгоритмов проблема становится ещё заметнее.
Распределённое обучение LLM активно использует операции all-reduce, при которых градиенты должны обмениваться между большим количеством вычислительных узлов. Поэтому производительность зависит не только от FLOPS ускорителей, но и от того, насколько быстро данные проходят через сеть.
Упрощённо время выполнения можно представить как комбинацию трёх компонентов:
compute + latency + communication bandwidth
На наземном AI-кластере высокоскоростная сеть позволяет держать коммуникационные издержки под контролем. В орбитальной системе сетевой компонент становится значительно более заметным.
Особенно сложным становится all-reduce в torus-топологиях: данные должны проходить через несколько измерений сети, создавая дополнительный трафик и увеличивая требования к пропускной способности каналов.
Даже высокая вычислительная интенсивность современных LLM не гарантирует, что сеть перестанет быть bottleneck. При масштабировании модели количество вычислений растёт вместе с объёмом коммуникаций, а физическая топология орбитальной сети ограничивает то, насколько эффективно эти вычисления можно распределить.
Орбитальные AI дата-центры: training против inference
Здесь возникает важное различие между двумя сценариями.
Inference выглядит гораздо реалистичнее
Для inference нагрузку можно в значительной степени локализовать на одном спутнике или небольшой группе узлов. Это резко снижает требования к межспутниковому обмену данными.
В таком режиме сеть перестаёт быть главным ограничением, а производительность снова определяется характеристиками памяти, compute и энергопотреблением.
Это делает AI inference в космосе гораздо более реалистичным сценарием, чем обучение больших моделей.
Особенно интересным он становится при дальнейшем росте эффективности compute на ватт и наличии приложений, которым выгодно обрабатывать данные непосредственно на орбите.
Training — совсем другая история
При распределённом обучении LLM ситуация меняется.
Если модель требует постоянного обмена градиентами между большим количеством спутников, network overhead начинает напрямую снижать model FLOP utilization (MFU). Чем больше коммуникаций приходится на единицу полезных вычислений, тем больше мощности ускорителей простаивает в ожидании данных.
В результате даже дешёвая энергия не обязательно означает дешёвый training.
Именно здесь появляется главный парадокс орбитальных AI дата-центров:
дешёвый compute не имеет большого смысла, если сеть не позволяет эффективно использовать этот compute.
Тысячи спутников — это ещё и проблема надёжности
К сетевой архитектуре добавляется физическая сложность самой орбитальной инфраструктуры.
Система должна поддерживать геометрию большого количества спутников, управлять большим числом лазерных каналов и адаптироваться к отказам отдельных узлов.
Выход одного спутника из строя может изменить топологию сети и потребовать перераспределения нагрузки. При большом количестве узлов это превращается в отдельную задачу fault tolerance и network orchestration.
Дополнительные ограничения создают энергоснабжение и тепловой режим каждого спутника. В наземном дата-центре инженеры могут относительно легко добавлять резервные кабели, коммутаторы и источники питания. В орбитальной системе каждый дополнительный компонент должен быть выведен на орбиту и работать в гораздо более жёстких физических условиях.
Поэтому орбитальная инфраструктура — это не просто «дата-центр, поднятый в космос».
Это принципиально другая распределённая система.
Почему network bandwidth может съесть преимущество космоса
Для орбитальных AI дата-центров экономическое преимущество определяется не стоимостью энергии отдельно, а стоимостью полезного AI compute.
Если спутник получает энергию практически бесплатно, но значительную часть времени ускорители ожидают данные от других узлов, эффективная стоимость вычислений растёт.
Это особенно критично для training. В идеальном случае увеличение числа GPU должно почти линейно сокращать время обучения. В реальной распределённой системе масштабирование ограничивается коммуникациями.
Получается классическая проблема:
больше спутников → больше compute → больше коммуникаций → больше network overhead → меньше эффективного ускорения.
Поэтому масштабирование орбитального AI-кластера нельзя оценивать только количеством ускорителей или общей энергетической мощностью.
Необходимо смотреть на network-to-compute ratio, topology, bisection bandwidth, latency и communication overhead.
Что это означает для AI compute в космосе
На сегодняшний день наиболее убедительно выглядит разделение сценариев.
Inference может получить преимущества от орбитального размещения, особенно если данные уже находятся в космосе и могут обрабатываться непосредственно на спутнике.
Training больших LLM, напротив, остаётся гораздо более сложной задачей. Пока распределённое обучение зависит от интенсивного all-reduce и требует низкой latency и огромной межузловой пропускной способности, орбитальная сеть остаётся потенциальным bottleneck.
И здесь возникает главный инженерный компромисс.
Орбита может дать дешёвую энергию, масштабируемость по физическому железу и эффективное радиационное охлаждение. Но эти преимущества не автоматически превращаются в более дешёвый или быстрый AI compute.
Для орбитальных AI дата-центров решающим фактором становится не количество доступных FLOPS, а способность сети эффективно связать эти FLOPS в единую распределённую систему.
Пока LLM training остаётся network-bound задачей с интенсивным all-reduce, наземные AI-кластеры сохраняют серьёзное преимущество.
Чтобы орбитальное обучение действительно стало конкурентоспособным, потребуются либо значительно более производительные межспутниковые сети, либо новые архитектуры распределённого обучения, которые уменьшают зависимость от постоянного обмена данными.
В космосе compute может быть дешёвым. Вопрос в том, сможет ли сеть позволить ему работать как единое целое.
Источник информации
arXiv — крупнейший открытый репозиторий препринтов (с 1991 года, под эгидой Корнелла),
где исследователи оперативно размещают рабочие версии статей; материалы общедоступны,
но не проходят полное рецензирование, поэтому результаты следует считать предварительными
и, по возможности, сверять с обновленными версиями или рецензируемыми журналами. arxiv.org