گرادیان، تابع هزینه و gradient descent
از مشتق یک تابع ساده تا بهروزرسانی پارامترهای یک مدل یادگیری.
ریاضیات برای هوش مصنوعیمتوسط
هدف یادگیری
بتوانید یک گام gradient descent را دستی محاسبه کنید و نقش گرادیان و learning rate را توضیح دهید.
پیشنیازها
- مشتق یکمتغیره
- بردارهای مقدماتی
از مشتق تا جهت حرکت
مشتق نرخ تغییر موضعی تابع است. برای f(x)=(x-3)^2، مشتق در هر نقطه به ما میگوید اگر x کمی تغییر کند، تابع به کدام سمت حرکت میکند.
یک گام عددی
اگر x₀=0 و η=0.1 باشد، f'(0)=-6 و بنابراین x₁=0.6 است. حرکت در خلاف جهت مشتق، ما را به سمت کمینه نزدیک میکند.
در چند متغیر
در شبکه عصبی θ شامل وزنها و biasها و J معمولاً loss است. backpropagation گرادیان را محاسبه میکند و optimizer از آن برای بهروزرسانی استفاده میکند.
تمرین
- برای f(x)=(x-5)^2 از x=1 با η=0.2 سه گام محاسبه کنید.
- دو learning rate متفاوت را مقایسه کنید.
- تفاوت local و global minimum را در یک تابع غیرمحدب توضیح دهید.
پروژههای مرتبط
راهکارهای مرتبط
گرادیان را در یک مدل واقعی بررسی کنیم؟
میتوان ریاضیات، optimization و implementation را کنار هم دید.