К Roadmap

LLM-инженерия

LLM serving: KV-cache и батчинг

Как LLM отвечает токен за токеном: prefill/decode, KV-cache, continuous batching, метрики задержки и выбор vLLM/SGLang/TensorRT-LLM/TGI.

Полный доступ

Открыть Roadmap «Продвинутая ML-инженерия»

Все опубликованные темы Roadmap
Объяснения, формулы и примеры в подготовленных главах
Практика в главах, где она уже подготовлена
Будущие обновления без доплаты

Отдельная покупка остаётся в аккаунте навсегда и включает будущие обновления.