LLM deep dive: архитектура, обучение и inference
Глубокая секция для LLM Engineer: от устройства Transformer до latency/cost trade-offs в production inference.
Подходит для: LLM Engineer, ML Engineer
Длительность
≈ 66 мин
Вопросы
10 вопросов
Практика
Без coding-задач
Структура
3 секции
Откуда взялась программа
Программа собрана по 43 проверенным вопросам об LLM inference. Это редакторская выборка из разобранных собеседований, а не статистика всего рынка.
Проверено: 24 собеседования · 23 компании · 43 релевантных вопроса
Программа и маршрут подготовки
Раскройте этап, повторите связанные темы roadmap и проверьте, что можете ответить без подсказки. В самом mock вопросы показываются последовательно.
Архитектура и контекст
≈ 19 мин · 25% оценкиAttention, RoPE и длинный контекст.
Что проверяет: Self-attention и causal mask
Полная формулировка и разбор откроются в Premium.
Что проверяет: RoPE и позиционные представления
Полная формулировка и разбор откроются в Premium.
Что проверяет: Long context: память, качество и архитектурные ограничения
Полная формулировка и разбор откроются в Premium.
Генерация и serving
≈ 26 мин · 33% оценкиPrefill/decode, batching и управление KV cache.
Что проверяет: Prefill и decode
Полная формулировка и разбор откроются в Premium.
Что проверяет: Continuous batching
Полная формулировка и разбор откроются в Premium.
Что проверяет: KV cache: механизм и стоимость памяти
Полная формулировка и разбор откроются в Premium.
Что проверяет: Диагностика latency, качества и стоимости LLM-сервиса
Полная формулировка и разбор откроются в Premium.
Оптимизация inference и обучение
≈ 21 мин · 42% оценкиSpeculative decoding, quantization и distributed training.
Что проверяет: Speculative decoding и доля принятия
Полная формулировка и разбор откроются в Premium.
Что проверяет: W8A8, W4A16 и trade-off качества с производительностью
Полная формулировка и разбор откроются в Premium.
Что проверяет: DDP и перекрытие коммуникаций с backprop
Полная формулировка и разбор откроются в Premium.