0Pricing
Data Science Academy · Урок

Регуляризация Ridge и Lasso

Борьба с переобучением с помощью штрафов

«Регуляризация Ridge и Lasso» — бесплатный урок Data Science Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Data Science Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Data Science Academy содержит 4 уроков всего.

Когда линия переобучается

Обычная линейная регрессия может подстроиться под шум, создав огромные коэффициенты, которые хорошо описывают обучающие данные, но плохо работают на новых. Эта ловушка называется переобучением. 😬

Добавьте штраф

Регуляризация исправляет эту проблему, добавляя штраф за большие коэффициенты. Теперь модель уравновешивает подгонку под данные и сохранение небольших весов.

Гребневая регрессия уменьшает веса

Гребневая регрессия штрафует за квадрат величины коэффициентов. Она приближает каждый вес к нулю, но редко делает его ровно нулевым.

from sklearn.linear_model import Ridge
model = Ridge(alpha=1.0).fit(X, y)

Лассо может обнулить их

Лассо штрафует за абсолютную величину коэффициентов. Благодаря этому слабые коэффициенты могут стать равными нулю, и соответствующие признаки полностью исключаются.

from sklearn.linear_model import Lasso
model = Lasso(alpha=0.1).fit(X, y)

Лассо выбирает признаки

Поскольку лассо обнуляет слабые веса, оно одновременно выполняет отбор признаков. Ненулевые коэффициенты, которые остаются, соответствуют признакам, признанным полезными.

Альфа задаёт силу штрафа

Параметр альфа определяет силу воздействия штрафа. Чем больше альфа, тем сильнее сжатие и тем проще и плавнее модель.

Слишком большая альфа приводит к недообучению

Если слишком увеличить альфу, коэффициенты настолько уменьшатся, что модель перестанет учитывать реальные закономерности. Эта противоположная ошибка называется недообучением.

Масштабируйте данные до применения штрафа

Штрафы напрямую сравнивают коэффициенты, поэтому признаки сначала должны иметь общий масштаб. Стандартизируйте данные, иначе штраф будет несправедливо сильнее воздействовать на признаки с крупными единицами измерения.

from sklearn.preprocessing import StandardScaler

Гребневая регрессия или лассо?

Используйте гребневую регрессию, если большинство признаков немного помогает, а лассо — если подозреваете, что многие признаки бесполезны, и хотите получить разреженную компактную модель.

ElasticNet объединяет оба подхода

Не можете выбрать? ElasticNet объединяет штрафы гребневой регрессии и лассо, одновременно обеспечивая сжатие и исключение некоторых признаков.

from sklearn.linear_model import ElasticNet

Настройка с помощью перекрёстной проверки

Никогда не подбирайте alpha вручную. Попробуйте диапазон значений и выберите то, которое показывает лучший результат на отложенных фолдах при кросс-валидации.

from sklearn.linear_model import RidgeCV

Быстрая проверка

На практике эти два метода различает одно важное свойство.

Итоги

Регуляризация сдерживает переобучение: Ridge уменьшает веса, Lasso может обнулить их, а alpha задаёт силу регуляризации. Сначала масштабируйте данные, затем настраивайте модель. 🎯

Часто задаваемые вопросы

Урок «Регуляризация Ridge и Lasso» бесплатный?

Да — полный текст урока «Регуляризация Ridge и Lasso» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Data Science Academy, подпишись на CoddyKit PRO. Курс Data Science Academy содержит 4 уроков всего.

Чему я научусь в уроке «Регуляризация Ridge и Lasso»?

Борьба с переобучением с помощью штрафов Ты практикуешь Data Science Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Data Science Academy?

Предыдущий опыт не требуется. Data Science Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Регуляризация Ridge и Lasso»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Data Science Academy?

Да. Каждый урок Data Science Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Линейная регрессия: повторение
  2. Регуляризация Ridge и Lasso
  3. Регрессия с деревом решений
  4. Случайный лес для регрессии
← Назад к Data Science Academy