Борьба с переобучением: как я перестал обманывать сам себя и свою нейросеть
В машинном обучении есть понятие "переобучение", когда модель идеально работает на тренировочных данных, но полностью проваливается на реальных. Я столкнулся с этим лицом к лицу.
Моя модель показывала точность 99% на валидации. Я был готов публиковать статью и хвастаться перед коллегами. Но когда мы задеплоили её в продакшн, точность упала до 60%. Я чувствовал себя обманщиком.
Проблема была в данных: я случайно допустил утечку информации из будущего в тренировочную выборку. Модель не училась, она просто "запомнила" ответы. Пришлось начинать всё с нуля, применять кросс-валидацию и быть честным с самим собой. Этот опыт научил меня, что в Data Science нет места самообману: цифры не врут, если ты умеешь их правильно спрашивать.
Вернуться ко всем постам
Комментарии 0
Будьте первым, кто оставит комментарий!