پرش به محتوای اصلی

گرادیان، تابع هزینه و gradient descent

از مشتق یک تابع ساده تا به‌روزرسانی پارامترهای یک مدل یادگیری.

ریاضیات برای هوش مصنوعیمتوسط

هدف یادگیری

بتوانید یک گام gradient descent را دستی محاسبه کنید و نقش گرادیان و learning rate را توضیح دهید.

پیش‌نیازها

  • مشتق یک‌متغیره
  • بردارهای مقدماتی

از مشتق تا جهت حرکت

مشتق نرخ تغییر موضعی تابع است. برای f(x)=(x-3)^2، مشتق در هر نقطه به ما می‌گوید اگر x کمی تغییر کند، تابع به کدام سمت حرکت می‌کند.

تابع و مشتق
f(x)=(x−3)2,f'(x)=2(x−3)

یک گام عددی

گرادیان‌کاهی یک‌بعدی
xt+1=xt−ηf'(xt)

اگر x₀=0 و η=0.1 باشد، f'(0)=-6 و بنابراین x₁=0.6 است. حرکت در خلاف جهت مشتق، ما را به سمت کمینه نزدیک می‌کند.

در چند متغیر

گرادیان‌کاهی چندمتغیره
θt+1=θt−η∇J(θt)

در شبکه عصبی θ شامل وزن‌ها و biasها و J معمولاً loss است. backpropagation گرادیان را محاسبه می‌کند و optimizer از آن برای به‌روزرسانی استفاده می‌کند.

تمرین

  • برای f(x)=(x-5)^2 از x=1 با η=0.2 سه گام محاسبه کنید.
  • دو learning rate متفاوت را مقایسه کنید.
  • تفاوت local و global minimum را در یک تابع غیرمحدب توضیح دهید.

پروژه‌های مرتبط

HowDeepLearningWorks

ریاضیات بهینه‌سازی در یادگیری عمیق.

باز کردن منبع

HowLLMsWork

جایگاه optimization در آموزش مدل‌های زبانی.

باز کردن منبع

گرادیان را در یک مدل واقعی بررسی کنیم؟

می‌توان ریاضیات، optimization و implementation را کنار هم دید.