یادگیری تقویتی برای تراز و استدلال LLM توسط پیرسون
(Mitalearn-467684)
- Duration: 3 hours 46 minutes
- Release date: 1 May 2026
- Author: Pearson
- Level: مناسب همه
- Contents: 27
- Has Caption in Persian
درباره این دوره:
<p>پیشآموزش به LLMها قابلیت میدهد، نه قضاوت. در این دوره، یاد بگیرید که چگونه تکنیکهای یادگیری تقویتی مانند بهینهسازی اولویت مستقیم (DPO) و بهینهسازی خط مشی نسبی گروهی (GRPO) رفتار مدل، ایمنی و استدلال را شکل میدهند و چگونه سیستمهای ارزیابی و حاکمیتی را ایجاد کنید که همسویی را در مسیر نگه میدارند. این دوره برای توسعه دهندگان، دانشمندان داده و مهندسان ML که در حال تنظیم دقیق یا به کارگیری LLM هستند و می خواهند ایمنی، اثربخشی و قابلیت های استدلال خود را بهبود بخشند، مناسب است.</p><p>توجه: این دوره توسط Pearson ایجاد شده است. ما خوشحالیم که میزبان این آموزش در کتابخانه خود هستیم.</p>
Related Skills
Content
Reinforcement Learning for LLM Alignment and Reasoning by Pearson
