- Telegram Web

MLinside - школа ML

Вопросы и задача с собеседований 🔥

В очередной раз подготовили для вас несколько вопросов и задачу, которые могут встретиться на интервью!

💬 Наши ответы опубликуем в пятницу, а сейчас ждём ваших ответов в комментариях!

📌 Вопросы и задача:

1️⃣ Как оценить переобучение без тестовой выборки?

2️⃣ Как быть, если у модели высокий precision, но низкий recall, а заказчик хочет наоборот — максимум охвата, даже ценой ложных срабатываний?

3️⃣ Задача — чему будет равен ROC-AUC для следующих данных и предсказаний? Посчитать руками!

Истинная метка:
1 0 1 1 0
Предсказание модели - метка:
1 1 1 0 0
Предсказание модели - число:
0.9 0.8 0.7 0.4 0.3

#собеседование

1.6K viewsedited 15:00

MLinside - школа ML

📌 Ответы на вопросы и задачу с собеседований

1️⃣ Как оценить переобучение без тестовой выборки?

1. С помощью кросс-валидации - если метрики сильно меняются между фолдами, то скорее всего мы переобучились.
2. По разнице между значениями метрик и лосс-функции на train и validation датасетах. Ошибка на validation сильно больше чем на train, значит есть переобучение. Если на train ошибка тоже большая, значит недообучение.
3. Посмотреть насколько “уверенно” предсказывает наша модель - большие значения могут свидетельствовать о переобучении.

2️⃣ Как быть, если у модели высокий precision, но низкий recall, а заказчик хочет наоборот — максимум охвата, даже ценой ложных срабатываний?

Главное — понимать, какая цена у ложноположительных и ложноотрицательных ошибок в задаче, в зависимости от этого мы можем делать трейдофф между precision и recall-ом следующими способами:

1. Самоё лёгкое решение - понизить порог классификации, допустим раньше объект с предсказанием модели 0.5 и выше определялся как положительный класс, а теперь сделать порог 0.3, а не 0.5. Выбрать новый порог можно построив PR-кривую.
2. Решения посложнее - изменить функцию потерь, чтобы сильнее наказывать пропущенные положительные примеры, в современных моделях градиентного бустинга (CatBoost, XGBoost) можно придать больший вес классу гиперпараметром. Сделать больше сэмплов положительного класса, даже с помощью oversampling-а (используя SMOTE, sklearn, data augmentations)
3. Ещё более сложный, но работающий вариант - сделать ансамбль моделей, где одна будет ловить всё, что может быть положительным классом

3️⃣ Чему будет равен ROC-AUC для следующих данных и предсказаний?

Истинная метка:
1 0 1 1 0
Предсказание модели - метка:
1 1 1 0 0
Предсказание модели - число:
0.9 0.8 0.7 0.4 0.3

Ответ - 0.667. Как легко посчитать - мини-гайд от Дьяконова

〰️

Автор: Александр Дубейковский, специалист по ML, ex-Yandex

#собеседование

Please open Telegram to view this post

VIEW IN TELEGRAM

1.7K views15:00

MLinside - школа ML

📣 Уже совсем скоро стартует Aha!25 — одна из крупнейших технических конференций по ML, AI, аналитике и продакт-менеджменту!

📍Когда: 29–30 мая
📍Где: Москва, кластер «Ломоносов» (МГУ)

Что вас ждет:
🔹 1200+ участников
🔹 80+ докладов
🔹 16 тематических потоков
🔹 Спикеры из Яндекса, Авито, OZON, Альфа-Банка, Т-Банка и других
🔹 Дополнительный онлайн-день 22 мая

🔥 Мы — партнеры конференции, помогли в организации секции по ML, в рамках которой вас ждет выступления на темы классических бизнес-задач, решённых с помощью ML, AI-предпринимательства и генеративного ИИ.

🎤 Кроме того, 29 мая основатель нашей школы и эксперт по Big Data & AI Виктор Кантор выступит с докладом и расскажет, какие задачи в AI действительно ценятся рынком — и за что готовы платить.

🎟 Билеты — на официальном сайте конференции
💥 Промокод MLINSIDE даст скидку 20% на скидка на онлайн- и офлайн-билеты!

1.8K views14:32

MLinside - школа ML

💬

Прошли демо-курс «База ML» на Stepik? Поделитесь впечатлениями!

В декабре мы открыли доступ к демо-версии нашего курса «База ML» на платформе Stepik, чтобы каждый мог оценить подачу материала, подход преподавателей и структуру обучения.

Если вы уже прошли демо-курс, нам важно узнать:
🔵Что было особенно полезно?
🔵Какие темы зашли лучше всего?
🔵Насколько удобно было проходить материалы?

📌 Будем признательны за ваш отзыв прямо на Stepik. Это поможет другим студентам принять решение, а нам продолжать улучшать курс и развивать культуру качественного обучения.

Демо-курс — это возможность познакомиться с ML на практике и оценить формат обучения в MLinside.

Если вы еще не проходили наш демо-курс — самое время начать!

👉 Ссылка на курс

Спасибо, что развиваетесь вместе с MLinside! Ваш отзыв поможет нам расти и становится еще лучше 🌟

Please open Telegram to view this post

VIEW IN TELEGRAM

1.6K views15:00

MLinside - школа ML

0:30

This media is not supported in your browser

VIEW IN TELEGRAM

▶️

На нашем YouTube-канале вышло интервью с Константином Чукреевым — Growth Product Lead в Manychat, ранее работал в Яндекс Лавке, где за короткий срок прошел путь от ML-разработчика до продакт менеджера уровня Middle+.

Константин рассказывает:
▪️ Как он переходил из аналитики и ML в продакт-менеджмент.
▪️ Какие задачи решал в Яндексе и Manychat.
▪️ Какие навыки нужны продактам и ML-специалистам для развития.
▪️Советы молодым специалистам по Data Science и ML
▪️ Будущее чатботов с ИИ и перспективы AI через 5–10 лет.
▪️ Как делать карьерный переход и кому стоит идти в продакт-менеджмент

🎯 Интервью для тех, кто хочет развиваться на стыке ML, аналитики и продукта.

🔥Спойлер: если вы хотите курс от MLinside и Константина специально для продакт-менеджеров — обязательно посмотрите это интервью!

👉 Смотреть здесь

Please open Telegram to view this post

VIEW IN TELEGRAM

6.9K viewsedited 15:02

MLinside - школа ML

Готовы проверить свои знания? ⚡️

Сегодня в нашем канале — новый квиз! Вопросы лёгкого уровня помогут освежить знания или узнать что-то новое.

Не пропустите, начнём совсем скоро! 👀 🧠

💥 СПОЙЛЕР: Если вы готовитесь к собеседованию на джуна в ML или просто хотите узнать, как это устроено изнутри — ждите отличную новость, которая совсем скоро появится в нашем канале!

1.4K views14:55

MLinside - школа ML

Что из перечисленного используется для регуляризации моделей?

Anonymous Quiz

88%

Добавление L1 и L2 штрафов за большие веса модели

Нормализация данных

Увеличение размера обучающей выборки

Уменьшение количества метрик качества

332 voters1.4K views15:01

MLinside - школа ML

Какое из утверждений о кластеризации k-means неверно?

Anonymous Quiz

21%

Кластеризация k-means требует указания числа кластеров заранее

Кластеризация k-means использует евклидово расстояние по умолчанию

56%

Кластеризация k-means может работать с любым типом данных без изменений

14%

Кластеризация k-means назначает объект к кластеру на основе минимального расстояния до центра

301 voters1.4K views15:01

MLinside - школа ML

Какой метод используется для автоматического подбора гиперпараметров модели?

Anonymous Quiz

17%

Градиентный спуск

78%

Grid Search или Random Search

Линейная регрессия

Преобразование признаков

336 voters1.4K views15:01

MLinside - школа ML

Знакомая ситуация? 😅

Ожидания от модели — небесные, качество данных — под землей.

👇 Поделитесь в комментариях под мемом, какие самые странные вещи вы видели в датасетах.

#мемнедели

1.3K views15:00

MLinside - школа ML

⚠️

Приглашаем на наш вебинар!

У нас отличная новость — совсем скоро мы проведем mock-собеседование на позицию junior ML специалиста! У вас будет возможность задавать вопросы в ходе вебинара, проверить свои знания и готовность пройти собеседование или просто узнать о том, как проходят такие интервью и какие вопросы задают.

🗓️ Когда: 28 мая (среда), 19:00 (МСК)

Собеседование будет вести Виктор Кантор — основатель MLinside, эксперт по Big Data и AI, бывший Chief Data Officer МТС и Chief Data Scientist Яндекс.Такси

В роли кандидата — Илья Кустов, выпускник первого потока курса «База ML» и инженер в государственном учреждении. Илья решил сменить направление, потому что верит, что искусственный интеллект — это будущее человечества. Его привлекает работа с аналитической обработкой данных и точными науками, а также желание развиваться и расти в новой для себя сфере.

📚 Вебинар покажет, каких результатов можно добиться после обучения на курсе «База ML» и насколько он помогает подготовиться к реальным собеседованиям.

🔗 Регистрируйтесь по ссылке

Please open Telegram to view this post

VIEW IN TELEGRAM

1.5K views15:03

MLinside - школа ML

🔥Вопросы с собеседований

Мы снова подготовили для вас вопросы, которые часто встречаются на собеседованиях по ML 📚

Ответы мы опубликуем в понедельник, а пока ждем ваши варианты в комментариях! 💬

📌 Вопросы:

1️⃣ В чём разница между методами ансамблирования моделей: бэггинг и бустинг?
2️⃣ В каких случаях увеличение количества данных для обучения не поможет избежать переобучения?
3️⃣ Что такое прунинг деревьев? Зачем он нужен, и какие виды существуют?

#собеседование

1.4K views15:01

MLinside - школа ML

📌 Ответы на вопросы с собеседований

1️⃣ В чём разница между следующими методами ансамблирования моделей: стэкинг и бустинг?

Бэггинг (bagging) обучает много моделей независимо друг от друга на разных подвыборках и усредняет результат — он снижает дисперсию (variance), не сильно влияя на смещение (bias).

Бустинг (boosting) обучает модели последовательно, каждая исправляет ошибки предыдущих — он снижаетсмещение (bias), но может увеличить дисперсию, особенно если переобучиться.

2️⃣ В каких случаях увеличение количества данных для обучения не поможет избежать переобучения?

Увеличение количества данных не поможет избежать переобучения, если модель слишком сложная для решаемой задачи — тогда она всё равно может подгонять шум в данных. Также, если новые данные не добавляют разнообразия (например, они из той же выборки и не покрывают новые случаи), переобучение сохранится. Кроме того, если данные остаются с теми же ошибками, увеличение объёма не решит проблему.

3️⃣ Что такое прунинг деревьев? Зачем он нужен, и какие виды есть?

Прунинг (обрезка) деревьев — это удаление лишних ветвей дерева, чтобы уменьшить переобучение и улучшить обобщающую способность модели.

Он нужен, потому что полностью выросшее дерево может подгоняться под шум и детали обучающей выборки.

Виды прунинга:

- Pre-pruning (ранняя остановка) — остановка роста дерева при достижении условий (например, макс. глубина, мин. число объектов в узле).
- Post-pruning (пост-обрезка) — сначала строится полное дерево, потом лишние ветви удаляются на основе кросс-валидации или прироста качества.

〰️

Автор: Александр Дубейковский, специалист по ML, ex-Yandex

#собеседование

Please open Telegram to view this post

VIEW IN TELEGRAM

1.3K views15:01

MLinside - школа ML

‼️

Не упустите шанс — вебинар уже завтра!

Завтра, 28 мая в 19:00 (МСК), мы проведём mock-собеседование на Junior ML специалиста — уникальная возможность увидеть, как проходят настоящие собеседования, получить ценные инсайты и проверить свою готовность.

Собеседование будет вести Виктор Кантор — основатель MLinside, эксперт по Big Data и AI, бывший Chief Data Officer МТС и Chief Data Scientist Яндекс.Такси.

В качестве кандидата выступит Илья Кустов, выпускник первого потока курса «База ML» и инженер в госучреждении.

⏳ Регистрируйтесь сейчас и готовьтесь к настоящим собеседованиям с уверенностью!

🔗 Ссылка на регистрацию

Please open Telegram to view this post

VIEW IN TELEGRAM

1.4K views15:04

MLinside - школа ML

🎉 Сегодня и завтра мы на Aha!25 — одной из крупнейших технических конференций по ML, AI, аналитике и продакт-менеджменту!

📍 Если вы тоже на Aha! — приходите знакомиться! У нас уютная зона (да, та самая с зеленым диваном), можно пообщаться про карьеру, обучение и узнать, как использовать ML, чтобы расти в профессии и приносить больше ценности бизнесу. А также поесть мандарины 🤫

📸 На фото — наш стенд. Заходите!

1.6K views11:30

MLinside - школа ML

This media is not supported in your browser

VIEW IN TELEGRAM

0:26

1.7K views15:17

MLinside - школа ML

🔥 Продолжаем рубрику “Вопросы с собеседований”!

Сегодня снова делимся вопросами, которые могут встретиться во время интервью на ML-позиции.

💬 Пишите свои ответы в комментариях, а наши ответы мы опубликуем в среду!

📌 Вопросы:

1️⃣ Как устроено/строится дерево решений?
2️⃣ Как оценить важность признаков?
3️⃣ Почему F1 метрика берёт именно среднее гармоническое от precision и recall, а не среднее, или среднее геометрическое к примеру?

📌Все прошлые вопросы в нашем канале ищите по хештегу #собеседование

Please open Telegram to view this post

VIEW IN TELEGRAM

1.2K viewsedited 15:01

MLinside - школа ML

📌 Ответы на вопросы с собеседований

1️⃣ Как устроено/строится дерево решений?

Дерево решений строится рекурсивно: на каждом шаге оно выбирает признак и порог, по которому лучше всего разделить данные, чтобы максимизировать "чистоту" разбиения (например, по информации, джини или снижению дисперсии).

Затем данные делятся на две части, и для каждой строятся поддеревья. Этот процесс продолжается до достижения заданной глубины, минимального количества объектов в узле или до тех пор, пока все объекты в узле не будут одного класса (для классификации).

2️⃣ Как оценить важность признаков?

Оценить важность признаков можно по-разному: в деревьях — по снижению импьюрити или permute importance, в линейных моделях — по коэффициентам. Но наиболее универсальный и надёжный метод — SHAP: он основан на теории игр, учитывает все взаимодействия, даёт как локальные, так и глобальные оценки и работает с любыми моделями. Лучше комбинировать несколько подходов для полноты картины.

3️⃣ Почему F1 метрика берёт именно среднее гармоническое от precision и recall, а не среднее, или среднее геометрическое к примеру?

F1 использует гармоническое среднее, потому что оно весьма строго наказывает дисбаланс между precision и recall: высокое значение возможно только если оба велики. Гармоническое среднее сильнее наказывает за перекос точности и полноты чем арифметическое или геометрическое средние, доказывается через неравенство Коши.

〰️

Автор: Александр Дубейковский, специалист по ML, ex-Yandex

#собеседование

Please open Telegram to view this post

VIEW IN TELEGRAM

1.1K views15:01

🔥 На YouTube-канале MLinside вышли интервью с Валерием Бабушкиным — одним из самых узнаваемых экспертов в сфере ML и Data Science, Senior Director по Data & AI в BP (British Petroleum), автором книги Machine Learning System Design и Kaggle Competitions Grandmaster’ом.

Обсудили:
✅ Чем отличается работа в российских и зарубежных компаниях — и что стало неожиданным при переходе.
✅ Как устроен бигтех изнутри и какие у него плюсы и минусы.
✅ Что выбрать: стартап или корпорацию? И в чём разница для DS-специалиста.
✅ Какие качества и подходы действительно важны для роста в ML/DS.
✅ Советы молодым специалистам: с чего начать и как продолжать расти.

👉 Смотреть первую часть
👉 Смотреть вторую часть

942 views15:01

MLinside - школа ML

🚀 Как работает градиентный спуск и почему он так важен?

🎯 1. Что такое функция потерь и зачем она нужна?
Когда мы обучаем модель (например, нейросеть), она делает предсказания. Чтобы понять, насколько они точные, мы используем функцию потерь, которая показывает, насколько сильно модель ошибается. Наша цель — минимизировать эту ошибку.

🤔 2. Почему напрямую найти минимум сложно?
Функция потерь зависит от множества параметров модели (весов). Эту функцию потерь можно нарисовать на многомерном графике, тогда у нас получится гиперплоскость, с количеством координат равным количеству параметров модели. Найти самую низкую точку (минимум) на этой гиперплоскости вычислительно тяжёлая задача.

🔍 3. Что такое антиградиент?
Антиградиент в точке гиперплоскости — это вектор, противоположный градиенту, указывающий направление наибыстрейшего убывания функции потерь.

⬇️ 4. Как работает градиентный спуск?
Градиентный спуск — это метод, который шаг за шагом движется в сторону антиградиента. Каждый шаг — это обновление параметров модели (наших координат для графика функции потерь), которое приближает нас к минимуму функции потерь. Новые значения координат дают нам новые значения весов.

⚡️ 5. Почему шаг обучения (learning rate) важен?
Если шаг слишком большой — мы можем «перепрыгнуть» минимум. Если слишком маленький — обучение будет очень медленным.

🚀 6. Почему градиентный спуск важен?
Градиентный спуск обеспечивает стабильное движение к оптимальным решениям и делает обучение масштабируемым и управляемым. С его помощью тренируют все современные глубокие нейросети, и даже базовые модели МЛ.

〰️

Автор: Александр Дубейковский, специалист по ML, ex-Yandex

Please open Telegram to view this post

VIEW IN TELEGRAM

615 views15:07

2025/06/11 10:08:04
Back to Top

HTML Embed Code:

<iframe width="100%" src="https://www.tgoop.com/buyppe/web?embed=1" title="Telegram Web" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowfullscreen></iframe>