LLM serving платформа vLLM и Triton в проде
LLM serving платформа на vLLM и Triton: архитектура, trade-offs и узкие места продакшена при масштабировании инференса
LLM serving платформа на vLLM и Triton: архитектура, trade-offs и узкие места продакшена при масштабировании инференса
Orbital AI compute выглядит дешевле по энергии, но mesh-сети ограничивают LLM training. Разбор узких мест и архитектурных компромиссов
Защита LLM-MAS через continual learning и OOD detection. Разбор OpenEvoShield и его архитектуры против динамических атак
MoE routing в direct-connect сетях: как MoX снижает перегрузку линков и достигает near-switch производительности без динамической реконфигурации
Byzantine Agreement round complexity получает строгую нижнюю границу. Разбор влияния adaptive adversary на latency и архитектуру консенсуса
LLM serving workload в реальных системах ведёт себя нестабильно. Разбираем FineServe и влияние на архитектуру, latency и планирование ресурсов
Как масштабируется in-band SDN control plane без роста state: разбор Periplus и его модели multi-controller coordination
In-band SDN с multi-controller coordination: как Periplus ограничивает forwarding state через border-switch графы и масштабирует сеть без роста нагрузки
AI accelerators for scientific computing: как преодолеть разрыв точности, памяти и исполнения при переносе HPC-нагрузок на NPU —>
Подборка архитектурных инсайтов и релизов, которые мы читали на этой неделе. Infrastructure 🔹 FSZ: Breaking the Prediction-Throughput Trade-off in GPU Lossy Compression Новый подход к lossy-компрессии на GPU позволяет увеличить пропускную способность, сохраняя качество предсказаний. Работа показывает, как компрессия может стать инструментом оптимизации вычислительной инфраструктуры, а не только способом экономии памяти. Читать релиз (EN) 🔹 … Читать далее
Controls: ← → to move, ↑ to rotate, ↓ to drop.
Mobile: use buttons below.