پرش به محتوای اصلی

Attention از نگاه ریاضی؛ چرا Q، K و V لازم‌اند؟

از projection و ضرب ماتریسی تا softmax؛ attention را با معادلات اصلی و تفسیر آن‌ها یاد می‌گیریم.

ریاضیات برای هوش مصنوعیمتوسط

هدف یادگیری

Q، K، V، score، softmax و weighted aggregation را بفهمید و بتوانید زنجیره محاسبات attention را توضیح دهید.

پیش‌نیازها

  • بردار و ماتریس
  • تابع نمایی
  • احتمال مقدماتی

Q، K و V از کجا می‌آیند؟

ورودی X با سه ماتریس پارامتر به سه نمایش تبدیل می‌شود. Q و K برای ساخت score و V برای حمل اطلاعاتی است که در خروجی ترکیب می‌شوند.

Projectionهای attention
Q=XWQ,K=XWK,V=XWV

Score matrix

ضرب Query و Key
S=QKT

عضو (i,j) نشان می‌دهد query مربوط به token i با key مربوط به token j چقدر سازگار است.

چرا مقیاس‌بندی؟

Scaled dot-product
S=QKTdk

تقسیم بر √d_k اندازه scoreها را کنترل می‌کند تا softmax با افزایش بعد بردارها بیش از حد تند نشود.

Softmax و خروجی

Attention weights
A=softmax(QKTdk)
Attention output
Z=AV

هر سطر A وزن‌هایی با مجموع ۱ می‌سازد. سپس Z ترکیب وزن‌دار Valueهاست.

تمرین

  • برای دو بردار Q و K ضرب داخلی را محاسبه کنید.
  • softmax دو score ساده را حساب کنید.
  • توضیح دهید چرا A وزن است و V اطلاعات را حمل می‌کند.

پروژه‌های مرتبط

HowAttentionWorks

توضیح و پیاده‌سازی سازوکار attention.

باز کردن منبع

HowTransformersWork

ادامه ریاضیات attention تا Transformer.

باز کردن منبع

HowLLMsWork

ارتباط این مفاهیم با مدل‌های زبانی.

باز کردن منبع

ریاضیات یک مدل AI را عمیق‌تر بررسی کنیم؟

می‌توان یک مفهوم را از فرمول تا implementation دنبال کرد.