التعلم المعزز: أساليب القيمة وتدرجات السياسة

قارن بين أساليب القيمة والسياسة لاتخاذ القرارات المتتابعة.

هل تبحث عن شروحات خطوة بخطوة لأدوات ذكاء اصطناعي محددة؟

نظرة عامة على الدورة

مسار يبدأ بعمليات القرار لماركوف وأهداف التعلم، ثم يتناول أساليب القيمة والسياسة، والتكرار الملائم للقيمة، وتدرجات السياسة الحتمية. يربط بين اختيار الأسلوب وفضاء الأفعال وجمع البيانات والاستقرار، ويميز الأفكار الخوارزمية عن ضمان نجاح التحكم. مقاطع الفيديو باللغة الإنجليزية؛ أما الملاحظات والأنشطة الأصلية فلا تنسخ نصوصها.

تمثيل مشكلة قرار متتابعة بالحالات والأفعال والمكافآت والانتقالات والسياسة. مقارنة تقدير القيمة بالتحسين المباشر للسياسة وبيان متى تحفز الأفعال المستمرة استخدام تدرجات السياسة الحتمية. تصميم تقييم يميز تقدم التعلم عن الأداء الموثوق للمهمة ويحدد خطوط أساس مناسبة.

يُستحسن الإلمام بالشبكات العصبية والاحتمالات والتعلم الخاضع للإشراف. وتفيد معرفة الدوال وأهداف التحسين وأساسيات Python أو الشيفرة الكاذبة؛ لا يلزم إطار برمجي بعينه.

للمتعلمين ذوي الخبرة الراغبين في تعميق مهارات الذكاء الاصطناعي المتقدمة وتطبيقها

لمن يتعلمون بشكل أفضل من خلال الأمثلة والدروس الموجّهة والتطبيق العملي

للمهنيين والمبدعين والمطورين المستقلين الباحثين عن سير عمل قابل للتكرار

الدرس الأول مجاني

4 الدروس · متقدم · الدورة الكاملة.

محتوى دورة بترخيص مفتوح · مرخّص CC BY · الترخيص موثّق

تستخدم هذه الدورة مواد مرخّصة بموجب CC BY مع نسبتها إلى مزود المحتوى أو رافعها. لا يتاح تشغيل الدروس إلا بعد تسجيل الدخول واجتياز فحوص النشر والترخيص.