یادگیری تقویتی برای تراز و استدلال LLM توسط پیرسون
(Mitalearn-467684)
- مدت زمان: 3 ساعت 46 دقیقه
- انتشار: 1 May 2026
- مدرس: Pearson
- سطح: مناسب همه
- محتواها: 27
- زیرنویس فارسی دارد
درباره این دوره:
<p>پیشآموزش به LLMها قابلیت میدهد، نه قضاوت. در این دوره، یاد بگیرید که چگونه تکنیکهای یادگیری تقویتی مانند بهینهسازی اولویت مستقیم (DPO) و بهینهسازی خط مشی نسبی گروهی (GRPO) رفتار مدل، ایمنی و استدلال را شکل میدهند و چگونه سیستمهای ارزیابی و حاکمیتی را ایجاد کنید که همسویی را در مسیر نگه میدارند. این دوره برای توسعه دهندگان، دانشمندان داده و مهندسان ML که در حال تنظیم دقیق یا به کارگیری LLM هستند و می خواهند ایمنی، اثربخشی و قابلیت های استدلال خود را بهبود بخشند، مناسب است.</p><p>توجه: این دوره توسط Pearson ایجاد شده است. ما خوشحالیم که میزبان این آموزش در کتابخانه خود هستیم.</p>
مهارتهای مرتبط
Content
Reinforcement Learning for LLM Alignment and Reasoning by Pearson
