Введение
Полный гид по вопросам на собеседовании AI-инженера: концепции LLM, инфраструктура инференса, RAG, дизайн агентов, оценка моделей, практическое кодирование и стратегии. Все вопросы собраны с реальных собеседований в OpenAI, Anthropic, Scale AI, Sierra, xAI, Databricks, Perplexity и других компаниях.
Топ-10 самых частых вопросов (с указанием компании)
- Разработайте систему батчинга для инференса на одном GPU, обрабатывающую до 100 запросов в батче, при синхронном ожидании пользователей. (Anthropic)
- Разработайте сквозную систему батчинга для LLM-запросов. (Anthropic)
- Спроектируйте агента для обработки страховых исков, который принимает заявки и выносит решение об одобрении, используя RAG, с контролем токен-бюджета и стоимости. (Scale AI)
- Объясните, как работает RAG. (Sierra)
- Постройте агента службы поддержки для гипотетической компании, продающей снаряжение для активного отдыха. (Sierra)
- Исследуйте и устраните проблему модели, которая даёт уверенные, но фактологически неверные ответы в сценариях с высокими рисками. (Anthropic, ML-инженер)
- Реализуйте систему управления GPU-кредитами. (OpenAI)
- Напишите код для пайплайна обработки изображений, применяющего преобразования, заданные в файлах инструкций для каждого изображения. (Anthropic)
- Разработайте стратегию для сервиса дообучения (fine-tuning) OpenAI. (OpenAI)
- Как вы подходите к безопасности генеративного ИИ в потребительских продуктах? (OpenAI, Anthropic, Google)
Концепции LLM и генеративного ИИ
Эти вопросы проверяют, понимаете ли вы, что происходит под капотом API-вызова.
Пример из жизни: Sierra часто просит кандидатов объяснить RAG с нуля.
Вопросы
- Объясните, как работает RAG. (Sierra)
- Какие навыки в области генеративного ИИ станут критическими в следующем году? (Anthropic)
- Что такое токенизатор и почему количество токенов влияет на стоимость и лимит контекста?
- Что такое эмбеддинг и что означает «семантическая близость» в системе поиска?
- Что такое контекстное окно и что ломается, когда вы его превышаете?
- Что контролирует параметр temperature и когда вы установите его почти в ноль?
- Что такое квантизация и чем вы платите за её применение?
- Промптинг, RAG или дообучение: как выбрать?
Сервисная инфраструктура и инференс LLM
Это самая характерная категория для AI-инженера. Вопросы удивительно типичны. Ожидается, что вы будете группировать запросы в батчи для максимальной утилизации GPU без ущерба для задержки (латентности).
Особенность: Anthropic задаёт такие вопросы на собеседованиях для SWE, ML-инженеров, аппаратчиков и даже менеджеров.
Вопросы
- Разработайте систему батчинга для одного GPU (до 100 входов/батч, синхронные пользователи). (Anthropic)
- Разработайте сквозную систему батчинга для LLM-запросов. (Anthropic)
- Спроектируйте API для эффективной выборки из больших моделей, с хорошим батчингом и оркестрацией запросов. (Anthropic)
- Разработайте систему для поддержки ML-моделей. (Scale AI)
- Реализуйте систему управления GPU-кредитами. (OpenAI)
- Спроектируйте OpenAI Playground. (OpenAI)
- Разработайте пайплайн обработки документов, который индексирует большие объёмы разнородных документов для использования LLM. (Databricks)
- Спроектируйте платформу для отслеживания и анализа ML-экспериментов. (Google)
Дизайн RAG-систем и агентов
Дизайн агентов — теперь стандартный вопрос, особенно в компаниях, чей продукт и есть агент (Sierra, Scale, Glean). Здесь ценятся механизмы безопасности (guardrails), контроль стоимости и наличие «человека в петле».
Вопросы
- Спроектируйте агента для страховых исков, который использует RAG и контролирует стоимость токенов. (Scale AI)
- Постройте агента поддержки для компании по продаже снаряжения. (Sierra)
- Спроектируйте агентскую ИИ-систему для поддержки Spotify. (Sierra)
- Спроектируйте ИИ-агента для стримингового сервиса. (Sierra)
- Спроектируйте ИИ-систему для интеграции с данными и бизнес-процессами сторонней компании. (Sierra)
- Строили ли вы сквозные агентские системы? (Glean)
- Спроектируйте загрузчик файлов для AI-чата, который обрабатывает большие мультимодальные файлы и помещает их в контекст модели. (xAI)
- Спроектируйте голосовое AI-приложение в реальном времени.
Поведение модели, данные и оценка (Evaluation)
В ML-инженерных циклах проверяют, можете ли вы диагностировать проблемы модели и работать с «грязными» данными, а не просто вызывать API.
Вопросы
- Развёрнутая диалоговая модель даёт уверенные, но неверные ответы в рискованных сценариях. Как вы будете расследовать и исправлять это? (Anthropic, ML-инженер)
- Извлеките и очистите набор данных из демо-базы компании, используя только SQL и Python. (Anthropic, ML-инженер)
- Как вы будете оценивать LLM-фичу, если нет единственно правильного ответа?
- Что такое LLM-as-a-judge и каковы его недостатки?
- Как вы ловите регрессии, когда меняете промпт или модель?
Практическое программирование (AI-Assisted Coding)
Кодинг-раунды в таких компаниях похожи на мини-проекты: нужно написать рабочую фичу, починить чужой код, часто разрешается пользоваться AI-ассистентом.
Вопросы
- Напишите пайплайн обработки изображений, который читает инструкции из файлов и применяет преобразования к большому набору изображений. (Anthropic)
- Отладьте и расширьте Python-код, добавив асинхронный механизм повторных попыток с экспоненциальной задержкой и таймаутами. (Sierra)
- Обойдите зависимости ячеек в таблице, похожей на Excel, и обнаружьте циклические ссылки. (Sierra)
- Просканируйте файловую систему и найдите дубликаты файлов. (Anthropic)
- Реализуйте in-memory key-value хранилище с операциями set, begin, commit и abort (транзакции). (OpenAI, xAI)
- По событиям начисления и списания кредитов с истекающим сроком вычислите остаток. (OpenAI)
- Реализуйте кодирование и декодирование списка строк. (OpenAI)
Стратегия, безопасность и поведенческие вопросы
Даже в инженерных циклах AI-компании проверяют ваше суждение, особенно в вопросах этики и ответственности. Anthropic особенно известна такими раундами.
Вопросы
- Разработайте стратегию для сервиса дообучения OpenAI, используя публичную документацию. (OpenAI)
- Как бы вы определили метрики успеха для AI-фичи или продукта? (Perplexity)
- Как вы подходите к безопасности генеративного ИИ в потребительских продуктах? (OpenAI, Anthropic, Google)
- Расскажите о случае, когда вы были уверены в решении, а потом поняли, что ошиблись. (Anthropic)
- Расскажите о случае, когда вам пришлось делать то, что противоречило вашим ценностям. (Anthropic)
- Почему вы хотите работать в Anthropic? (Anthropic)
- Какие новые достижения в AI вас интересуют? (Anthropic)
Фреймворки для ответов (Как структурировать)
1. Фреймворк для RAG / Agent Design
| Этап | Что делать |
|---|---|
| Определение границ | Вход, выход, бюджет по задержке, стоимость ошибки |
| Индексация | Нарезка на чанки, эмбеддинги, векторная БД с метаданными |
| Поиск | Поиск топ-K (гибридный поиск по необходимости) |
| Действие/Генерация | Структурированный вывод; для агентов — выбор инструментов |
| Guardrails | Отказ от ответа вне компетенции, валидация вывода, эскалация человеку |
| Оценка | Оцениваем поиск и генерацию отдельно, логируем с цитатами |
2. Фреймворк для LLM Serving / Инфраструктуры
| Этап | Что покрыть |
|---|---|
| Требования | QPS, SLA по задержке, синхронность/асинхронность |
| Батчинг | Динамический (таймаут + размер), непрерывный для генерации |
| Эффективность | Переиспользование KV-кэша, паддинг по длине, маршрутизация |
| Backpressure | Лимит очереди, поведение при переполнении |
| Стоимость | Токен-бюджет, кеширование, маленькие модели для лёгких запросов |
3. STAR (для поведенческих)
| Буква | Что делать |
|---|---|
| S (Situation) | Контекст в 1-2 предложениях |
| T (Task) | Ваша конкретная ответственность |
| A (Action) | Что вы сделали, с техническими деталями |
| R (Result) | Итог, выраженный в цифрах |
Часто задаваемые вопросы
1. «AI Engineer» — это отдельный трек?
Чаще всего это специализированный SWE или ML-трек. Готовьте и стандартный инжиниринг, и AI-темы. Компании (Anthropic, OpenAI) задают вопросы про инфраструктуру внутри общих инженерных раундов.
2. Какой вопрос самый частый?
Варианты «спроектируй систему батчинга» и «спроектируй RAG-агента с контролем стоимости».
3. Есть ли LeetCode?
Меньше абстрактных задач, больше проектного кода. Но структуры данных (LRU-кэш, графы, транзакции) всё ещё важны. Однако задачи теперь похожи на реальные фичи: пайплайны, ретраи, кредитные системы.
4. Нужно ли знать ML глубоко?
Да, чтобы рассуждать о компромиссах и отлаживать модель. Но детали обучения (backpropagation, оптимизаторы) нужны больше для core-ML ролей. Знайте разницу: дообучение (fine-tuning) — для изменения поведения, RAG — для добавления фактов.
Как готовиться (План на 3 недели)
- Неделя 1: Фундамент (RAG, эмбеддинги, архитектура трансформеров, батчинг).
- Неделя 2: Системный дизайн (дизайн агентов, управление стоимостью, балансировка нагрузки).
- Неделя 3: Практическое кодирование + подготовка историй по STAR и ответы на «поведенческие» вопросы.
Глоссарий (ключевые термины для собеса):
- Batching (батчинг): Группировка запросов для эффективного использования GPU.
- Continuous Batching: Динамическое добавление/удаление запросов из батча во время генерации.
- KV Cache: Кеширование ключей и значений для ускорения генерации (не пересчитывать их для уже обработанных токенов).
- Guardrails: Набор правил и фильтров для контроля вывода модели (безопасность, формат, эскалация).
- Eval Set (тестовый набор): Золотой стандарт данных для проверки качества модели.
- LLM-as-a-Judge: Использование другой LLM для оценки ответов основной модели.
- Structured Output: Генерация ответа в строгом формате (например, JSON) для интеграции с системами.
Также по теме: как ИИ меняет собеседования