Подборка архитектурных инсайтов и релизов, которые мы читали на этой неделе.
Infrastructure
🔹 FSZ: Breaking the Prediction-Throughput Trade-off in GPU Lossy Compression
Новый подход к lossy-компрессии на GPU позволяет увеличить пропускную способность, сохраняя качество предсказаний. Работа показывает, как компрессия может стать инструментом оптимизации вычислительной инфраструктуры, а не только способом экономии памяти. Читать релиз (EN)
🔹 Robust KV Cache Management for LLM Serving under Output Token Length Uncertainty
Управление KV-кэшем становится особенно сложным, когда заранее неизвестна длина ответа LLM. Предложенный механизм учитывает эту неопределенность при планировании ресурсов, помогая повысить эффективность serving-инфраструктуры и снизить задержки. Читать релиз (EN)
🔹 Hardware-Transparent I/O Governance in Disaggregated Heterogeneous Storage
Новая модель управления I/O для разрозненных гетерогенных систем хранения отделяет политику распределения ресурсов от конкретного оборудования. Такой подход упрощает управление инфраструктурой и позволяет эффективнее использовать разные типы storage-ресурсов. Читать релиз (EN)
Architecture
🔹 DoorDash Uses Envoy and Valkey for a 1.5M RPS Proxy Cache with 99.99999% Availability
DoorDash построил proxy-cache на базе Envoy и Valkey, рассчитанный на нагрузку до 1,5 млн запросов в секунду. Архитектура демонстрирует, как комбинация proxy- и cache-слоев может обеспечивать одновременно экстремальную пропускную способность и доступность на уровне 99,99999%. Читать релиз (EN)
🔹 Multi-Cluster Databases on Kubernetes: Architecture and Deployment
Многокластерные базы данных на Kubernetes становятся отдельным архитектурным паттерном для систем, которым нужны масштабирование и высокая отказоустойчивость. Материал разбирает ключевые подходы к проектированию и развертыванию таких конфигураций. Читать релиз (EN)
Developer Tools
🔹 How to Scale GitOps in the Enterprise: From Single Cluster to Fleet Management
Переход от одного Kubernetes-кластера к управлению целым fleet требует нового уровня GitOps-практик. Материал показывает, как масштабировать автоматизацию, управление конфигурациями и deployment-процессы в больших инфраструктурах. Читать релиз (EN)
🔹 Wait-Free Locks Should Not Fear Later Arrivals
Новая работа рассматривает wait-free синхронизацию в многопоточных системах и проблему потоков, присоединяющихся после начала операции. Предложенный подход направлен на повышение предсказуемости и эффективности concurrent-алгоритмов без ожидания блокировок. Читать релиз (EN)
AI and Machine Learning
🔹 Ascend to Science: Exploration of AI Chips for Scientific Computing
AI-чипы постепенно выходят за рамки классических задач машинного обучения. Работа исследует их применение в научных вычислениях и показывает, какие архитектурные особенности могут сделать специализированные ускорители эффективным инструментом для HPC-нагрузок. Читать релиз (EN)
🔹 OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks
OpenEvoShield предлагает адаптивный подход к защите multi-agent систем от атак в динамической среде. Архитектура учитывает, что характер угроз может меняться со временем, и поэтому сама система защиты должна постоянно адаптироваться. Читать релиз (EN)