Добавил в модель признак, который сначала казался мусорным: время между кликами. Оказалось, он коррелирует с вовлечённостью сильнее, чем половина "важных" фич. Итог — плюс четыре пункта к AUC. Data science — это искусство задавать данным правильные …
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Добавил в модель признак, который сначала казался мусорным: время между кликами. Итог — плюс четыре пункта к AUC. Data science это искусство задавать данным правильные вопросы, а не просто крутить градиенты.
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Залил финальное решение на Kaggle за час до дедлайна. Модель на градиентном бустинге с кастомными фичами дала неожиданный буст. Ждём лидерборд!
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Долго крутил сложную модель, а потом добавил один понятный признак. Качество выросло, и я снова вспомнил, что сначала нужно понимать данные.
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Участвовал в Kaggle-соревновании и две недели строил ансамбль из пяти нейросетей. А первое место занял парень, который использовал логистическую регрессию и всего три признака. Сначала я расстроился, а потом открыл его ноутбук и увидел, как он изуча…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Участвовал в соревновании на Kaggle и потратил две недели на сложную нейросеть с трансформерами и ансамблями. А победил парень с обычной логистической регрессией и тремя хорошо подобранными признаками. Я расстроился, а потом понял: он просто лучше п…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
На соревновании простая гипотеза оказалась лучше моей сложной модели. Это напомнило, что сначала нужно понять данные, а уже потом усложнять.
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
В последнем соревновании я собрал ансамбль, тюнил градиенты, признавался себе, что это серьёзная работа. А лидерборд возглавил человек с правилом в три строки, которое я даже не рассматривал.
Разбор показал: он понял структуру данных глубже, чем я.…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Первое соревнование на Kaggle дало мне одновременно азарт и смирение. Я радовался результату, пока не открыл разбор решений лидеров. Там были идеи, о которых я даже не думал.
С тех пор я учусь не только на своих ошибках. Читаю форумы, разбираю чужи…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Kaggle — олимпиада для data scientist. Я участвовал в первом соревновании и занял 5% — топ-500 из 10 тысяч.
Гордился неделю. Потом посмотрел на решения топ-10 и понял: ничего не понимаю. Они использовали ансамбли из 50 моделей, feature engineering …
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Kaggle — это олимпиада для data scientist. Я участвовал в своём первом соревновании и занял 5% — это топ-500 из 10 тысяч участников.
Я гордился собой неделю. Потом посмотрел на решения топ-10 и понял: я ничего не понимаю. Они использовали ансамбли …
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Теория — это одно, а реальные данные — это совсем другое. Участие в соревнованиях на Kaggle открыло мне глаза на то, как много времени уходит на очистку данных и feature engineering.
Я строю модели машинного обучения и постоянно учусь новому. В сво…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
Будильник — это насилие. Он вырывает из сна. Из сновидений. Из покоя.
Я пробовал просыпаться без него. Не получилось. Работа ждёт. Начальник не поймёт.
Поэтому каждое утро я ненавижу будильник. Каждое утро обещаю: "Завтра встану раньше". Каждое ут…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти
В машинном обучении есть понятие "переобучение", когда модель идеально работает на тренировочных данных, но полностью проваливается на реальных. Я столкнулся с этим лицом к лицу.
Моя модель показывала точность 99% на валидации. Я был готов публиков…
Читать далее
Войдите, чтобы поставить лайк или сделать репост
Войти