× Install ThecoreGrid App
Tap below and select "Add to Home Screen" for full-screen experience.
B2B Engineering Insights & Architectural Teardowns

LLM serving с latency budget вместо очередей

Latency budget в LLM serving меняет приоритеты планирования. CASCADE показывает, как связать scheduling и KV-cache для роста goodput.

Проблема начинается там, где все запросы формально равны по SLO, но фактически — нет. В одном кластере одновременно живут chat, code generation и reasoning. Их стоимость различается на порядки: длина prompt, длина генерации, наличие KV-cache. При этом классические политики вроде FCFS или SJF не учитывают реальную “срочность” запроса. В результате возникает head-of-line blocking: тяжёлый запрос блокирует очередь, сжигая latency budget других. Даже cache-хиты из NVMe могут ухудшать ситуацию — экономия compute оборачивается ростом latency из-за transfer cost. Система теряет goodput не потому, что не хватает ресурсов, а потому что неправильно распределяет задержки.

CASCADE делает прагматичный сдвиг: вводит per-request latency budget как основной управляющий сигнал. Это разница между SLO и прогнозируемым временем выполнения. В отличие от deadline-based подходов, budget учитывает не только дедлайн, но и оставшуюся работу. Это позволяет сравнивать “срочность” гетерогенных запросов. Ключевой trade-off — точность оценки. Ошибка в прогнозе приводит к неверному распределению задержек: переоценка бюджета даёт ложную уверенность и ведёт к SLO violation. Поэтому система использует консервативную оценку с guardband.

Архитектурно CASCADE объединяет два ранее независимых контура: request scheduling и KV-cache management. Планировщик использует стратегию least-remaining-budget-first — в первую очередь исполняются запросы с минимальным запасом. Это снижает head-of-line blocking без систематического вытеснения длинных запросов, как в SJF. Параллельно тот же budget управляет перемещением KV-cache между HBM, DRAM и NVMe. Если восстановление cache не укладывается в бюджет, система предпочитает recompute. Это важный компромисс: больше GPU compute, но меньше latency риска. Таким образом, CASCADE не минимизирует задержки глобально, а перераспределяет их туда, где они безопасны.

Реализация построена поверх vLLM без изменения модели. Добавлены три компонента: TTFT estimator, latency budget engine и dual-queue scheduler. Очередь делится на Tier-1 (положительный budget) и Tier-2 (отрицательный). Последние не отбрасываются, а обрабатываются opportunistically. Budget пересчитывается на каждом шаге, что делает систему адаптивной к текущей нагрузке. KV-cache интегрирован через LMCache и многоуровневую память (HBM, DRAM, NVMe). Prefetch ограничивается объёмом, который “помещается” в оставшийся budget. Даже preemption подчиняется той же логике: вытесняются запросы с максимальным запасом времени.

Результаты показывают, что ключевая проблема — не вычисления, а неэффективное использование latency headroom. CASCADE увеличивает SLO-compliant goodput до 2.4× относительно FCFS и снижает нарушения SLO на 40%. При этом сохраняется fairness между классами запросов, что обычно ломается в SJF. Улучшения особенно заметны на длинных запросах и смешанных workload’ах. При снижении ресурсов система продолжает держать приемлемый уровень SLO, в отличие от baseline, где начинается лавинообразный рост очередей. Важно, что метрики достигаются без изменения hardware или модели — только за счёт координации планирования и памяти.

В более широком контексте, CASCADE отражает индустриальный тренд: переход от статических политик к runtime-адаптивным стратегиям, где ключевым ресурсом становится не CPU или GPU, а latency budget. Это особенно актуально для LLM inference, где стоимость запроса непредсказуема, а хвостовые задержки критичны. Подход не устраняет все ограничения — он зависит от качества предсказаний и усложняет планирование — но даёт более устойчивое поведение под нагрузкой.


Источник информации

arXiv — крупнейший открытый репозиторий препринтов (с 1991 года, под эгидой Корнелла), где исследователи оперативно размещают рабочие версии статей; материалы общедоступны, но не проходят полное рецензирование, поэтому результаты следует считать предварительными и, по возможности, сверять с обновленными версиями или рецензируемыми журналами. arxiv.org

Смотреть оригинал исследования PDF

×

🚀 Deploy the Blocks

Controls: ← → to move, ↑ to rotate, ↓ to drop.
Mobile: use buttons below.