linkedin یادگیری تقویتی برای تراز و استدلال LLM توسط پیرسون (Mitalearn-467684)

  • مدت زمان: 3 ساعت 46 دقیقه
  • انتشار: 1 May 2026
  • مدرس: Pearson
  • سطح: مناسب همه
  • محتوا‌ها: 27
  • زیرنویس فارسی دارد
درباره این دوره:

<p>پیش‌آموزش به LLMها قابلیت می‌دهد، نه قضاوت. در این دوره، یاد بگیرید که چگونه تکنیک‌های یادگیری تقویتی مانند بهینه‌سازی اولویت مستقیم (DPO) و بهینه‌سازی خط مشی نسبی گروهی (GRPO) رفتار مدل، ایمنی و استدلال را شکل می‌دهند و چگونه سیستم‌های ارزیابی و حاکمیتی را ایجاد کنید که همسویی را در مسیر نگه می‌دارند. این دوره برای توسعه دهندگان، دانشمندان داده و مهندسان ML که در حال تنظیم دقیق یا به کارگیری LLM هستند و می خواهند ایمنی، اثربخشی و قابلیت های استدلال خود را بهبود بخشند، مناسب است.</p><p>توجه: این دوره توسط Pearson ایجاد شده است. ما خوشحالیم که میزبان این آموزش در کتابخانه خود هستیم.</p>
  • Content

    • Reinforcement Learning for LLM Alignment and Reasoning by Pearson

دوره‌های پیشنهادی