Назад к списку
Вузовская математикаМатан
22 мин чтение

Математический анализ: Градиенты и оптимизация в ML

Производная как скорость изменений

Производная f'(x) показывает мгновенную скорость изменения функции. Если производная больше нуля — функция возрастает, если меньше — убывает. В точках экстремума (минимума и максимума) производная равна нулю f'(x) = 0.

Частные производные и вектор Градиента \nabla f

В реальном мире функции зависят от сотен и миллионов переменных (например, веса нейросети). Градиент \nabla f(x_1, x_2, \dots, x_n) — это вектор частных производных:
\nabla f = \left( \frac{\partial f}{\partial x_1}, \frac{\partial f}{\partial x_2}, \dots, \frac{\partial f}{\partial x_n} \right)

Градиент указывает направление наиболее быстрого роста функции.

Алгоритм градиентного спуска (Gradient Descent)

Чтобы найти минимум функции потерь (Loss function) и обучить модель, мы делаем шаги в направлении, противоположном градиенту:
w_{new} = w_{old}
  • \eta \cdot \nabla f(w)
где \eta — темп обучения (Learning Rate).

Практическое применение

Без математического анализа невозможно понять, как работает обратное распространение ошибки (Backpropagation) в нейросетях и алгоритмы оптимизации Adam, RMSprop и SGD.