NLP basics: текст, токенизация и Transformer
Базовая NLP-секция без ухода в serving LLM: представление текста, архитектуры и корректная оценка качества.
Подходит для: NLP Engineer, Data Scientist
Длительность
≈ 47 мин
Вопросы
7 вопросов
Практика
Без coding-задач
Структура
3 секции
Откуда взялась программа
Программа собрана по 17 проверенным вопросам NLP. Это редакторская выборка из разобранных собеседований, а не статистика всего рынка.
Проверено: 11 собеседований · 10 компаний · 17 релевантных вопросов
Программа и маршрут подготовки
Раскройте этап, повторите связанные темы roadmap и проверьте, что можете ответить без подсказки. В самом mock вопросы показываются последовательно.
Представление текста
≈ 19 мин · 32% оценкиTF-IDF, embeddings и токенизация.
Что проверяет: Когда TF-IDF достаточно, а когда нужны embeddings
Полная формулировка и разбор откроются в Premium.
Что проверяет: BPE и токенизация
Полная формулировка и разбор откроются в Premium.
Что проверяет: Word/subword alignment
Полная формулировка и разбор откроются в Premium.
Модели последовательностей
≈ 20 мин · 40% оценкиRNN, Transformer и BERT: контекст, обучение и ограничения.
Что проверяет: BERT: objective и bidirectional context
Полная формулировка и разбор откроются в Premium.
Что проверяет: Transformer против RNN
Полная формулировка и разбор откроются в Premium.
Что проверяет: Sequence labeling вместо генерации
Полная формулировка и разбор откроются в Premium.
Оценка качества
≈ 8 мин · 28% оценкиМетрики, классы ошибок и продуктовые срезы для NLP.
Что проверяет: Метрики восстановления пунктуации и регистра
Полная формулировка и разбор откроются в Premium.